Чего нельзя снять нейросетью в 2026 — ограничения ИИ-видеопродакшена
Честный разговор про границы ИИ-видео
Все вокруг пишут про то, что нейросети умеют. Мы напишем про то, чего они не умеют — потому что это честнее, и потому что именно это знание отделяет людей, которые принимают правильные решения, от тех, кто обжигается на первом же проекте.
Спойлер: список ограничений короче, чем был год назад. И он продолжает сокращаться.
Тест Уилла Смита: история одного мема и трёх лет прогресса
Прежде чем говорить про ограничения, давайте поговорим про то, как быстро они исчезают. Для этого есть идеальный пример.
23 марта 2023 года пользователь Reddit выложил на r/StableDiffusion видео «Уилл Смит ест спагетти», созданное с помощью ModelScope. То, что вышло, было кошмаром: лицо Смита менялось от кадра к кадру, руки превращались в резиновые отростки, а лапша плавала так, будто подчинялась собственной гравитации. Видео мгновенно разлетелось по интернету — как наглядная демонстрация того, на что способен (и не способен) ИИ. Подробный разбор — в Wikipedia, Ars Technica и BBC Bitesize. Оригинальный ролик на Reddit.
Прошёл год. В феврале 2024-го сам Уилл Смит присоединился к мему — опубликовал пародийное видео, где намеренно копировал деревянные движения ИИ-версии себя. Об этом писали Wikipedia и BBC — «This is getting out of hand».
Прошёл ещё год. Google представил Veo — и новая версия теста произвела впечатление: лицо двигалось естественно, Смит по-настоящему жевал, вилка подбирала пасту с убедительной физикой. Впервые аудио генерировалось нативно и было синхронизировано с видео. Об этом — в Wikipedia и Mashable.
В 2026-м Kling 3.0 и Seedance 2.0 генерируют целые сцены с диалогом — Смит сидит за столом с другим человеком, они разговаривают, едят. Реализм почти неотличим от реального видео. Пример на Kling 3.0 — в материале Mashable; про Seedance и Veo 3 — в BBC Bitesize.
Три года. Один промпт. Пропасть между версиями. Именно это нужно держать в голове, когда кто-то говорит «ИИ не умеет делать X».
Что нейросеть не сделает хорошо прямо сейчас
Синхронизация губ в диалоговых сценах. Это всё ещё больное место — хотя Veo 3 сделал большой шаг вперёд именно здесь. Если вам нужна сцена, где два человека разговаривают в кадре с точной синхронизацией — закладывайте дополнительную обработку или стройте сцену иначе. Где традиционная съёмка всё ещё выигрывает — в сравнении подходов.
Точная работа с руками в деталях. Пальцы — классическая ловушка. Крупный план рук, которые набирают текст, перебирают монеты или застёгивают пуговицы — генераторы всё ещё нестабильны. Решение: избегать таких планов или снимать их отдельно.
Длинные непрерывные движения камеры. Плавный трекинг-шот через сложное пространство на протяжении минуты — пока за пределами надёжной генерации. Короткие движения, панорамы, статика — без проблем.
Стабильный персонаж в 50+ сценах без дополнительных техник. Без LoRA-файнтюнинга или IP-Adapter лицо будет плыть. Это решаемо, но требует подготовки на берегу.
Сложные физические взаимодействия. Борьба, столкновения, разбивающееся стекло — физика ведёт себя непредсказуемо достаточно часто, чтобы держать в голове запасной план.
Что уже можно — и это удивит
Масштабные сцены с массовкой. Армии, толпы, флоты. Мы в ГлавПромптФильме делали морские баталии — и это именно тот случай, когда ИИ не просто дешевле, а открывает возможности, которые традиционными методами были бы физически недостижимы при разумном бюджете. Подробнее — в нашей статье «Короткометражный фильм с ИИ — что происходит от идеи до экрана».
Фотореалистичные лица в медленных и статичных сценах. Крупный план человека, который думает, реагирует, смотрит в камеру — работает хорошо. Особенно когда есть реальный референс.
Исторические и фантастические среды. Рим первого века, затопленный город, арктическая станция — любая среда, которую невозможно построить физически. Здесь ИИ работает без компромиссов.
Смена времени суток, погоды, сезона. Снять один раз — получить четыре варианта: утро, закат, дождь, снег. Для рекламных кампаний это гибкость, которой раньше не существовало.
Прогноз: что станет возможным в ближайшие год-два
История с тестом Уилла Смита даёт хорошую систему координат для прогнозов.
Синхронизация губ — уже почти решена, в 2027 это перестанет быть проблемой для большинства задач. Консистентность персонажа без дополнительных техник — тоже движется в эту сторону. Длинные сцены без монтажных склеек — вопрос ближайших двух лет.
Единственный вопрос, который стоит задавать сегодня: что из того, что вам нужно, уже находится по правильную сторону этой границы?