惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

N
News and Events Feed by Topic
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Hugging Face - Blog
Hugging Face - Blog
S
SegmentFault 最新的问题
IT之家
IT之家
M
MIT News - Artificial intelligence
博客园_首页
aimingoo的专栏
aimingoo的专栏
C
Check Point Blog
B
Blog
人人都是产品经理
人人都是产品经理
爱范儿
爱范儿
宝玉的分享
宝玉的分享
Martin Fowler
Martin Fowler
L
LangChain Blog
Last Week in AI
Last Week in AI
Engineering at Meta
Engineering at Meta
Microsoft Security Blog
Microsoft Security Blog
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
F
Fortinet All Blogs
罗磊的独立博客
博客园 - 叶小钗
H
Help Net Security
Google Online Security Blog
Google Online Security Blog
Application and Cybersecurity Blog
Application and Cybersecurity Blog
The Last Watchdog
The Last Watchdog
S
Security @ Cisco Blogs
Google DeepMind News
Google DeepMind News
Cyberwarzone
Cyberwarzone
月光博客
月光博客
C
Cybersecurity and Infrastructure Security Agency CISA
博客园 - 司徒正美
S
Schneier on Security
V
Vulnerabilities – Threatpost
T
Troy Hunt's Blog
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
博客园 - 【当耐特】
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
Forbes - Security
Forbes - Security
D
Darknet – Hacking Tools, Hacker News & Cyber Security
雷峰网
雷峰网
Hacker News - Newest:
Hacker News - Newest: "LLM"
S
Secure Thoughts
V
Visual Studio Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
云风的 BLOG
云风的 BLOG
T
Tailwind CSS Blog
Security Archives - TechRepublic
Security Archives - TechRepublic
Hacker News: Ask HN
Hacker News: Ask HN
The GitHub Blog
The GitHub Blog

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания Автономность как точка невозврата: кто будет субъектом в цифровом будущем Обучение ИИ в «диких» условиях: как рутинные действия превращаются в датасеты Как измерить LLM для задач кибербеза: обзор открытых бенчмарков Где хранить код? Сравнение GitHub, GitLab и Bitbucket Математика объясняет, почему нормальное распределение встречается повсюду Почему ваш FinOps не работает: 12 тезисов от практиков Как подписать проектную документацию УКЭП с использованием бесплатных лицензий Pilot Адаптивное администрирование Sigla Vision Я грузил уран в бочки, а потом 20 лет строил ИТ в атомной отрасли Чем позвонить с Эвереста? История и обзор спутниковой связи. Часть 2 Как языковая модель помогает контролировать качество инструктажей по охране труда в металлургии Как не передать на desktop свой IP в РКН Анатомия SAP Privileges: как устроено управление правами в macOS MoneyDev: Сказка про три главных слова Обновлённый токенизатор видео K-VAE 2.0 от Сбера Как сделать диспетчеризацию дома на 1284 квартиры почти бесплатно Как мы разогнали железную дорогу Мы дали агентам рутину. Теперь надо решить — что делать с освободившимся временем Токсичный контент, промпт-хакинг и защита ИИ — всё о Guardrails для LLM Умный город начинается с точного взгляда: как «Фалькон Тех» меняет пространство к лучшему Навайбкодил приложение для анализа графов Почему Дюну так интересно читать? Упрощаем работу с рутиной или как стать Гендальфом Белым Деконструкция Go: CPU, RAM и что там происходит. Go Assembler база. Часть 1.1 Какие профессии исчезнут из-за ИИ, а какие появятся? И что с этим делать Как мы построили IT-отдел, где хочется расти: архитектурные встречи, прозрачные метрики и книжные подарки Rufler: Делаем из Claude Code автономный рой через один YAML-конфиг Sing-box и белый список приложений Как построить надёжный обмен сообщениями в микросервисах: лучшие практики для enterprise OpenAI строит MLM-пирамиду, а McKinsey и Accenture помогают ей в этом Дом, который не построил Фишер (Часть 2) «Сверхзвуковой математик» против «Вдумчивого логиста»: битва алгоритмов 3D-упаковки Мультимодальные модели – грубый и дорогой инструмент Разговоры ничего не стоят. Код тоже Проверки физических лиц: с кого начнет ФНС Топ-10 бесплатных нейросетей для создания видео в 2026 году Первые слои кода: как наши решения сегодня определяют архитектуру ИИ на десятилетия Разработка нового статического анализатора: PVS-Studio JavaScript Поиск уязвимостей ПО: базовый минимум или роскошный максимум Почему оценка персонала не работает как инструмент управления Как мы разработали ИИ-ассистента и сократили рутину продуктовой команды на 50% Как я ушел из найма, нажарил косточек и продал на маркетплейсах на 168 млн в год Когда 1С:ERP уже внедрена, а нормального производственного плана всё ещё нет Как я сделал Claude мультимодальным, подключив к нему Qwen Omni Как приглашение на вакансию мечты превращается в атаку Infrastructure as Code: философия и лучшие практики IaC Тестируем Yandex Code Assistant на задаче, в которой нужно хранить секреты nxs-universal-chart v3.0: новое поколение универсального Helm-чарта Callback Injection: Техника, которая отправила Microsoft Defender в глухой нокаут «Все идеи на стол»: митап как способ вывести проект из тупика Сегодня я узнал нечто новое о GPU благодаря багу в своей игре Как заставить LLM ̶ ̶г̶а̶л̶л̶ю̶ ̶ эволюционировать Карта событий как фундамент аналитики: практический кейс для E-commerce Что выбрать для AI: x86, ARM или RISC-V? Дайджест железа за март Роль соматических мутаций в развитии аутоиммунных заболеваний: путь к избирательной терапии Mythos от Anthropic — тревожный сигнал для всех, а не только для банков Guardrails для LLM на Java: как приручить промпт‑инъекции и токсичные ответы Green-VLA: как мы собрали VLA-модель для реального антропоморфного робота и не потеряли обобщение Финансовая гонка вооружений: почему умные люди добровольно в ней участвуют Эра ИИ-агентов наступила: выбираем лучшего цифрового сотрудника # Практический опыт внедрения WinCC Redundancy на производственном предприятии Сделал MVP за 3 дня, а потом неделю прикручивал оплату. Оно того стоило? Физика против Маска: почему Starship V3 может оказаться ещё одной катастрофой Нефть Венесуэлы: крупнейшие запасы в мире, но не крупнейшая нефтяная держава JPA 4. Переосмысление Hibernate Почему зеркальная фотокамера Nikon D5 десятилетней давности идеально подошла для миссии «Артемида-2» Проект «Уровень-Спутник» или как мы сделали платформу для гидрологов «Замедлиться, чтобы ускориться»: почему ИИ повышает цену ошибок в требованиях и архитектуре Как с нуля поднять трафик IT-компании на 1657% при бюджете 55 тыс. и выжить Pixel-perfect Downsampling — идеальная отрисовка 50 миллионов точек без потерь
Создать видео из фото ИИ через нейросеть: ТОП‑5 нейросетей для генерации видео из фото
VisionSoul ( · 2026-04-28 · via Все публикации подряд на Хабре

Генерация видео из одной фотографии уже перестала быть узким экспериментом. Сейчас различия между моделями заметны не по самому факту анимации кадра, а по тому, как именно они держат исходную композицию, насколько точно управляют движением и какие инструменты дают для контроля камеры, длительности и референсов.

Ниже — пять моделей, которые решают задачу сделать видео из фото разными способами. Это не рейтинг по принципу «кто сильнее», а практическая подборка по сценариям: портретная анимация, кинематографичное движение камеры, стилизованные сцены, управляемое движение персонажа и короткие концепт-ролики с озвученным окружением.

Нейросети, которые создают видео из одного фото

Seedance — анимирует статичное изображение, добавляя естественные микродвижения лица и мягкую пластику кадра. Хорошо сохраняет структуру исходного фото и подходит для портретной анимации.

Veo — генерирует плавные видеосцены с реалистичным движением камеры. Используется для создания кинематографичных переходов и расширения статичного кадра в полноценную видеосцену.

Wan — ориентирована на художественную анимацию. Работает со стилизованными изображениями, концепт‑артом и фантазийными сценами, добавляя мягкие световые и фоновые движения.

Kling — создаёт динамичные и насыщенные видеоролики, акцентируя внимание на движении объектов и детализации. Подходит для эффектных, визуально насыщенных сцен.

Grok — формирует простые видеосцены на основе фото, сохраняя композицию и общий стиль. Используется для быстрых концептов и минимальной анимации без сложных эффектов.

Нейросеть Seedance: создать видео из фото

Нейросеть Seedance — видеомодель ByteDance Seed. В официальных материалах Seedance 1.0 описывается как модель для генерации видео из текста и изображения с выходом до 1080p, многокадровыми переходами и упором на стабильность движения; Seedance 2.0 развивает эту линию и уже работает в единой мультимодальной схеме с текстом, изображением, аудио и видео.

Для задачи «видео из фото» у Seedance важны две вещи. Во-первых, ByteDance отдельно указывает структурную стабильность и снижение искажений в режиме генерации из изображения; во-вторых, Seedance 2.0 умеет опираться на композицию кадра, язык камеры, ритм движения и звуковые характеристики из входных материалов.

Из этого следует практический сценарий применения: Seedance уместен там, где исходный кадр должен остаться узнаваемым, а движение — выглядеть как продолжение уже существующей сцены. Это относится к портретам, предметным кадрам и крупным планам, где важны микропластика, свет, ткань, поворот головы и мягкое движение камеры, а не радикальная перестройка композиции.

Пример запроса:

Портретная фотография девушки у окна. Камера медленно приближается, взгляд чуть смещается в сторону света, волосы едва колышутся, на лице спокойная мимика, на шторах заметно мягкое движение от воздуха, естественный дневной свет, без резких жестов, без смены сцены.

Нейросеть Veo для работы с видео

Нейросеть Veo от Google поддерживает генерацию видео из изображения как из стартового кадра. В актуальной документации для Veo 3.1 также указаны режимы с первым и последним кадром, а еще — работа с референсными изображениями для сохранения внешности объекта или персонажа.

С технической точки зрения у Veo один из самых формализованных наборов настроек. Google указывает соотношения сторон 16:9 и 9:16, разрешения 720p, 1080p и 4K, частоту 24 кадра в секунду, длительность 4, 6 или 8 секунд, а также нативную генерацию аудио и водяной знак SynthID для созданного ролика.

Поэтому Veo рационально рассматривать не только как анимацию фотографии, но и как инструмент для управляемого движения камеры. Если задача требует наезда, отъезда, смены композиции между первым и последним кадром или сохранения внешности объекта по нескольким референсам, набор возможностей Veo закрывает именно этот класс сценариев.

Пример запроса:

Исходная фотография старого маяка на скалистом берегу. Камера начинает с общего плана и медленно летит вперед, волны бьются о камни, в кадре появляется морская дымка, луч маяка вращается по туману, реалистичная фактура воды и ветра, кинематографичное движение камеры.

Нейросеть Wan для создания видео из фото

Нейросеть Wan — открытая линейка видеомоделей Alibaba. В официальном репозитории Wan 2.1 заявлены генерация видео из текста и изображения, редактирование видео и генерация аудио для видео, а в Wan 2.2 выделены отдельные режимы генерации из изображения, текстово-визуальной генерации и анимации персонажа.

Для генерации видео из фото у Wan важны параметры исполнения. В документации Wan 2.2 указано, что режим генерации из изображения поддерживает 480p и 720p, соотношение сторон следует за исходной картинкой, а сама модель может работать даже только от изображения, без готового текстового описания, используя расширение запроса по содержимому кадра; для режима текст+изображение отдельно заявлены 720p и 24 кадра в секунду.

Отдельный интерес представляет ветка Animate-14B. В официальных примерах она вынесена в самостоятельный режим для анимации и замены персонажа по референсу, поэтому Wan логично использовать там, где исходное фото — это иллюстрация, концепт-арт, стилизованный персонаж или кадр, в котором критично сохранить пропорции и общий рисунок композиции.

Пример запроса:

Иллюстрация города в сумерках в рисованной манере. В окнах постепенно загорается свет, по мостовой проходит человек с фонарем, в небе движутся тонкие облака, отражения в мокром камне становятся заметнее, атмосфера спокойная, движение плавное, стилистика исходного рисунка без перехода в фотореализм.

Нейросеть Kling

Нейросеть Kling развивает генерацию видео из изображения через связку стартового кадра, привязки объекта и управления движением. В руководстве по Kling VIDEO 3.0 указано, что модель умеет фиксировать объект кадра так, чтобы при зуме, панораме и наклоне он оставался стабильным и не «терялся» в сцене.

Вторая важная часть — режим управления движением. В официальной документации Kling говорится, что для персонажа на изображении можно задать движение по референсному видео или по библиотеке движений; при этом отдельно описаны требования к входу: один персонаж, непрерывный дубль, длительность референса от 3 до 30 секунд, а длина результата соотносится с длительностью загруженного движения.

На практике это сдвигает Kling в сторону задач, где критично не только оживить фото, но и задать телесную механику. Такой режим полезен для сцен с походкой, боевыми движениями, жестами, мимикой и разворотами корпуса, когда нужен не абстрактный «оживший кадр», а контролируемое действие внутри этого кадра.

Пример запроса:

Фотография спортсменки в полный рост. Персонаж делает шаг вперед, поднимает подбородок, затем выполняет короткий разворот корпуса и уверенно смотрит в камеру, одежда и волосы реагируют на движение, камера идет по дуге слева направо, лицо остается стабильным на всем протяжении сцены.

Нейросеть Grok для создания видео

У xAI генерация видео вынесена в отдельную документацию и отдельную линейку Imagine API. Модель умеет анимировать статичные изображения, работать с референсными картинками, редактировать и продолжать видео, а также настраивать длительность, соотношение сторон и разрешение результата.

Для режима «из фото в видео» в документации прямо сказано, что исходная картинка становится стартовым кадром будущего ролика. Отдельно существует режим работы с референсами: до семи изображений, длительность до 10 секунд, при этом один запрос поддерживает только один активный режим — либо стартовое изображение, либо референсы; общий диапазон длительности для генерации составляет от 1 до 15 секунд.

Еще одна техническая особенность нейросети Grok — нативная генерация звука вместе с видео. xAI отдельно описывает синхронный вывод фоновой музыки, звуков среды и эффектов, поэтому модель подходит для коротких концепт-роликов, где нужно не только движение внутри кадра, но и сразу связанное с ним звуковое окружение.

Пример запроса:

Фотография винтажного проигрывателя на деревянном столе. Камера медленно обходит предмет по полукругу, пластинка начинает вращаться, на поверхности корпуса заметны блики теплой лампы, в комнате слегка движется пыль в луче света, слышен тихий треск пластинки и мягкий фон старой комнаты.

Что учитывать при выборе

При выборе модели для генерации видео из фото есть смысл смотреть не на общий шум вокруг названия, а на три конкретных параметра:

  • насколько хорошо модель удерживает исходный объект и композицию;

  • можно ли управлять камерой, длительностью и референсами;

  • нужен ли только визуальный ролик или сразу видео со звуком.

Если нужна мягкая анимация исходного кадра и высокая стабильность объекта, логично смотреть на Seedance. Если нужен формальный контроль над кадром, разрешением, первым и последним кадром и референсами, в документации наиболее подробно это раскрыто у Veo. Если важны стилизованные сцены, открытая экосистема и отдельные режимы анимации персонажа, у Wan для этого есть выделенные ветки. Kling полезен там, где движение персонажа задается почти как постановка, а Grok — там, где нужен короткий ролик с уже встроенным звуковым слоем.

Дополнительные возможности сервиса Ranvik

Генерация AI изображений — площадка позволяет создавать уникальный визуал по текстовым промптам, повышать разрешение снимков, редактировать графику и в один клик удалять задний план.

Инструменты ИИ для работы с текстом — сервис помогает в написании статей и сценариев любой сложности, переводе материалов, корректуре текстов и поиске креативных концепций.

Генерация видео нейросетью — функционал для разработки роликов на основе описаний, монтажа сцен, наложения субтитров, анимации и спецэффектов.

Платформа Ranvik — универсальный хаб, объединяющий в себе передовые технологии для комплексной работы с текстом, графикой, аудио- и видеофайлами.

Нейросети для работы с аудио — инструменты для профессиональной озвучки, написания авторских музыкальных композиций и полноценных песен с гибкой регулировкой настроек.

Анимация фотографий — опция, позволяющая трансформировать статичные кадры в выразительные видео с естественными движениями.

Озвучивание текста ИИ — качественное преобразование текста в живой голос с настройкой тембра, интонационных акцентов и эмоционального окраса.

Частые вопросы

1. Можно ли сделать ролик вообще без подробного текстового описания?

Да, но результат будет зависеть от конкретной модели. В документации Wan 2.2 прямо указано, что генерация из изображения может выполняться только по входной картинке, а текстовый запрос при необходимости достраивается автоматически; у Veo и Grok текстовое описание остается основным инструментом управления действием и камерой.

2. Какая модель дает больше контроля над камерой?

Если нужен именно формализованный набор параметров, у Veo есть работа с первым и последним кадром, референсными изображениями, разрешением, длительностью и соотношением сторон. У Kling камера тесно связана с режимом управления движением и фиксацией объекта внутри кадра.

3. Как уменьшить дрейф лица или объекта в кадре?

Нужны механизмы консистентности, а не только длинный запрос. У Veo для этого есть до трех референсных изображений одного персонажа или объекта, у Kling — привязка объекта, у Seedance 2.0 — опора на композицию и стабильность субъекта при сложных инструкциях.

4. Какая модель подходит для иллюстраций и концепт-артов?

Здесь имеет смысл смотреть на Wan. В официальной линейке есть режимы генерации из изображения, текстово-визуальной генерации и отдельная ветка анимации персонажа, а соотношение сторон в режиме генерации из изображения наследуется от исходной картинки, что удобно для нестандартных исходников.

5. Можно ли сразу получить ролик со звуком?

Да, но не у всех моделей это устроено одинаково. В актуальной документации Veo 3.1 и Grok отдельно указана нативная генерация аудио вместе с видео; у Seedance 2.0 также заявлена совместная аудио-видео генерация.

Вывод

Генерация видео из фото уже разделилась на несколько разных классов задач. Seedance ориентирован на сохранение исходной сцены и аккуратную пластику кадра, Veo — на точный контроль камеры и структуры ролика, Wan — на работу со стилем, аспектом исходного изображения и анимацией персонажа, Kling — на управляемое движение внутри кадра, а Grok — на короткие ролики из изображения с нативным звуком.

Если задача сформулирована как «оживить фото», этого уже недостаточно для выбора модели. Намного важнее понять, что именно должно ожить: лицо, одежда, свет, камера, предмет, целая сцена или действие персонажа.