AI: дайджест за 6 августа 2026
1. Alibaba открыла публичную бету Wan 3.0 для генерации видео со звуком и раскрыла цены
Alibaba официально запустила публичную веб-бету Wan 3.0: генерация видео со звуком до 30 секунд в 480p/720p/1080p, добавлены автоподбор длительности, продолжение видео и более стабильная консистентность персонажей/сцены. Опубликованы API-тарифы (примерно $0.04/$0.08/$0.17 за секунду по разрешениям) и уточнение, что при видео-референсе тарифицируется сумма длительностей входного и выходного видео; при этом свободный API-доступ пока не для всех (invitation testing).
Источники: t.me/cgevent
2. Tencent показала Hunyuan3D-Buffalo 1.0 — 3D-генерация с пониманием структуры и редактированием частей
Tencent представила экспериментальный прототип Hunyuan3D-Buffalo 1.0: система не только генерирует 3D-модели, но и «понимает» их структуру, отвечает на вопросы об объекте и позволяет удалять/заменять детали по текстовой команде. Проект позиционируется как ресерч: публичных весов/кода и демо нет, большинство результатов — от разработчиков.
Источники: t.me/cgevent
3. ByteDance выпустила SeedRealtime — аудиовизуальную full-duplex модель для более естественного диалога
ByteDance анонсировала SeedRealtime — нативную аудиовизуальную full-duplex модель, которая может одновременно воспринимать видео и речь пользователя и отвечать голосом без пауз «договорите — подумаю». Заявлены единая архитектура для аудио/видео/текста, устойчивость к перебиваниям и способность реагировать на изменения в кадре; открытых весов пока нет.
Источники: t.me/cgevent
4. Исследование GenCeption: превращение text-to-video диффузионок в одношаговые модели для задач компьютерного зрения
В работе «Video Generation Models are General-Purpose Vision Learners» представлен GenCeption — фреймворк, который конвертирует предобученную text-to-video диффузионную модель в feed-forward (одношаговую) модель для CV-задач, сводя разные плотные предсказания к RGB-представлению и используя queries для разреженных задач. Авторы заявляют сопоставимость со специализированными SOTA при обучении до 500 раз меньшим объёмом данных и сильную zero-shot генерализацию, что усиливает аргумент о видеогенераторах как источнике «мировых» представлений.
Источники: t.me/gonzo_ML
5. Джефф Дин ушёл из Google и запустил стартап Discovery Loop
Сообщается, что Джефф Дин покинул Google и перешёл в собственный стартап Discovery Loop. Это заметное кадровое событие для AI-экосистемы, учитывая его роль в развитии инфраструктуры и исследований в Google.
Источники: t.me/gonzo_ML
6. Google объявила о смене роли Демиса Хассабиса и передаче управления Google DeepMind
В сообщении Google говорится, что Демис Хассабис переходит на новую роль и передаёт управление Google DeepMind. Перестановка может повлиять на приоритеты и темпы развития одного из ключевых игроков в AI-исследованиях и продуктах.
Источники: t.me/gonzo_ML
7. MiniMax-H3 Turbo 4-Step: опубликована «турбо» LoRA и workflow для ComfyUI
Выложена MiniMax-H3 Turbo 4-Step в виде LoRA для ComfyUI, заявлена «турбированная и запруненная» версия с четырьмя шагами, а также приложены workflow и ссылка на оригинальный Minimax H3 Turbo. Это упрощает практическое использование и ускоряет генерацию для пользователей ComfyUI.
Источники: t.me/cgevent
8. Подборка ресурсов по MiniMax H3: репозиторий awesome-minimax-H3
Опубликован постоянно обновляемый репозиторий со ссылками по MiniMax H3: модели, LoRA, квантизации, статистики, декодеры/автоэнкодеры, workflow, гайды и туториалы. Это снижает порог входа и помогает быстрее находить актуальные инструменты и практики.
Источники: t.me/cgevent
9. Seedance 2.5 раскатывают на США; CapCut раздаёт кредиты
Сообщается о раскатке Seedance 2.5 на США и возможном появлении в агрегаторах; параллельно CapCut предлагает ограниченную по времени раздачу 1000 кредитов. Для пользователей это означает расширение доступности и возможность протестировать модель на бесплатных кредитах.
Источники: t.me/cgevent
10. Кейс-пайплайн AI-короткометражки Cypher: 2 недели и бюджет около $70–100
Описан производственный пайплайн проекта Cypher: препродакшн со сценарной таблицей, генерация ключевых изображений в Nano Banana 2, финальная анимация в Kling 3.0 (First/Last frame), сборка и доработка в After Effects. Приведены сроки (2 недели) и бюджет (~$70, максимум до $100), что полезно как ориентир по трудозатратам и стоимости.
Источники: t.me/cgevent