VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
Главная→Новости→Wan 3.0 от Alibaba: 30 секунд за один проход, нативный звук и document-to-video
НовостьРелизwan

Wan 3.0 от Alibaba: 30 секунд за один проход, нативный звук и document-to-video

VCL
Редакция
Vibe Coding Lab
25 августа 2026обновлено 25.08
3 мин чтения
КОРОТКО

Alibaba представила Wan 3.0 в режиме preview через Alibaba Cloud Model Studio. Модель генерирует до 30 секунд видео за один проход, принимает на вход текст, изображения, аудио, видео, документы (DOC, PDF, PowerPoint) и веб-страницы, а также поддерживает нативный звук с синхронизацией речи.

Wan 3.0 появился в режиме preview на Alibaba Cloud Model Studio в конкурентном окружении: этим же летом 2026 года вышли Seedance 2.5, Kling 3.0, MiniMax H3 и Veo 3.1. Но у Wan 3.0 есть две конкретные особенности, которые выделяют его из общего ряда.

30 секунд за один проход

До сих пор нормой были ролики на 4-8 секунд: один кадр, короткий motion, simple product shot. При таком ограничении модель решает задачу одного кадра, а не сцены.

Wan 3.0 генерирует до 30 секунд за один запуск. Это меняет сам класс задач: появляется пространство для полноценного диалога, смены фаз, развития действия.

Официальные демо показывают именно это. «Пир над облаками» - 30-секундная фантазийная сцена из чистого текста: горы-острова, гигантская черепаха, золотая птица, ночной пир. «Последние восемь тактов» - непрерывный проход камеры: героиня в красном платье идёт через закулисье и выходит к залу. Такие one-take-сцены - один из самых честных тестов на зрелость видеомодели.

Разрешения: 480p, 720p и 1080p. Модель также автоматически рекомендует нужную длину ролика под задачу.

Everything to video: документы и веб-страницы на входе

Самая необычная часть релиза - расширенный набор входных модальностей. Wan 3.0 принимает:

  • текст, изображения, аудио, видео
  • документы: DOC, PDF, PowerPoint
  • веб-страницы по ссылке

Ограничение - один файл или одна ссылка на запрос, до 100 МБ и до 50 страниц.

Практический сценарий из официального демо: на вход подаётся DOC-файл с позиционированием кофейни, требованиями к зерну и описанием пространства - на выходе ролик про атмосферу и ощущения, без прописанного героя. Это уже не «оживить картинку», а собрать видео из рабочего документа.

Alibaba называет это направление «everything to video».

Удержание персонажей и мультиязычная синхронизация

Для production-сценариев важнее всего не красота отдельного кадра, а то, насколько модель держит идентичность героев и структуру сцены на протяжении всего ролика.

Официальное демо «Схватка в руинах»: два референсных изображения задают персонажей - полосатую кошку и снежного барса в синем халате. Дальше модель должна удержать их в 30-секундной боевой сцене с прыжками, падением и погоней в пещерном храме. Именно здесь обычно вылезают «плывущие» хвосты, съезжающая одежда и потеря взаимного положения персонажей.

Другой тест - «Восемь языков, один бит»: одна вокалистка последовательно переключается между восемью языками, а модель удерживает сцену, ось камеры и синхронизацию губ с речью. Проверка мультиязычной аудиовизуальной согласованности в одном ролике.

Аниме-демо «Додзё загружается»: три картинки задают двух персонажей и пространство, после чего строится сцена противостояния с диалогом на японском и согласованным поведением камеры и звука.

Нативный звук

Wan 3.0 генерирует нативный звук: речь, синхронизацию с изображением. Отдельного прохода для озвучки не нужно - звук входит в один запуск вместе с видео.

Alibaba также отдельно отмечает улучшенную работу с человеческими лицами: больше разнообразия типажей, меньше эффекта «одного и того же глянцевого AI-лица», лучше микровыражения.

Редактирование без полной перегенерации

Wan 3.0 умеет редактировать уже созданный ролик, не пересобирая его с нуля. Подробностей о механике в открытых материалах пока нет, но сам факт такой возможности заметен в официальном описании.

Что это значит

Если тебе нужно сделать короткий маркетинговый ролик из брифа или презентации - document-to-video выглядит как реальный рабочий сценарий, а не только демо-фича. Подаёшь DOC, получаешь видео.

При этом Wan 3.0 пока в режиме preview через Alibaba Cloud Model Studio. Насколько стабильно работают 30-секундные сцены и document-to-video за пределами идеальных демо - покажет практика.

Доступ из России: сервис работает через Alibaba Cloud, VPN для этого не нужен по умолчанию, но стоит проверить актуальный статус оплаты и доступности в своём регионе.


Источник: Habr / ODS, 25 августа 2026 - читать полный разбор

Habr · 25 августа ↗
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться