AI: дайджест за 9 июля 2026

AI: дайджест за 9 июля 2026

1. G-Star+ улучшает masked diffusion для текста и кода за счет точечного перемаскирования

Исследователи из T-Tech и ВШЭ представили на ICML 2026 метод G-Star+ для masked diffusion: он находит токены с высокой вероятностью ошибки и перемаскирует/переписывает их на поздних шагах, снижая эффект «ранняя ошибка навсегда». По описанию источников, подход дает лучшее качество и разнообразие при меньшем числе шагов (например, 128 против 512 у прежних методов) и ускоряет генерацию; заявлена переносимость предсказателя ошибок на разные домены.

Источники: t.me/cgevent, t.me/ai_newz

2. Meta выпустила Muse Spark 1.1 и запустила API с ценами и кредитами

Meta обновила модель до Muse Spark 1.1, заявив улучшения «во всём» с акцентом на агентный кодинг. Одновременно запущен API с ценой $1.25/$4.25 за миллион токенов и выдачей $20 бесплатных кредитов всем аккаунтам.

Источники: t.me/ai_newz

3. OpenAI представила GPT-Live: full-duplex голосовой режим ChatGPT

OpenAI анонсировала GPT-Live — голосовой режим, который умеет слушать и говорить одновременно (full-duplex), реагируя в процессе речи пользователя и поддерживая более естественный диалог и синхронный перевод. Для сложных задач режим может делегировать рассуждения и поиск GPT-5.5; развёртывание идет глобально, для бесплатных пользователей доступна mini-версия, API обещан позже.

Источники: t.me/cgevent

4. xAI выпустила Grok 4.5 для кодинга и агентных задач, с бенчмарками и ценами API

xAI представила Grok 4.5, ориентированную на программирование и агентные сценарии; модель сравнивают с конкурентами по Terminal Bench 2.1 и DeepSWE 1.1, отмечая сильные и слабые стороны на разных наборах задач. Объявлены цены API ($2 за 1 млн входных и $6 за 1 млн выходных токенов), заявлены скорость до 80 ток/с и отложенный запуск в ЕС до середины июля; доступность заявлена в консоли xAI, Grok Build и Cursor.

Источники: t.me/cgevent

5. Pika запустила Directors Suite (бета) для «режиссерского» видеопайплайна

Pika открыла экспериментальный Directors Suite в бете; по описанию источника, интерфейс включает панель ассетов и таймлайн, фокус — на монтаж и «кнопку сделать красиво». Это сигнал о движении рынка к специализированным «режиссерским» инструментам для генеративного видео, хотя функциональность превиза/референсов, по мнению автора поста, пока ограничена.

Источники: t.me/cgevent

6. Motion Previs Studio v4: десктопный инструмент для превиза и экспорта управляющих данных в видеогенерацию

Вышла Motion Previs Studio v4 — автономное приложение, которое превращает исходные видео в наборы данных для превиза/референсов: поза, глубина, движение камеры, маски, края и управляющие слои с экспортом в Seedance, ComfyUI, Blender, Runway, Kling и др. Проект опубликован на GitHub вместе со вторым инструментом blockout; заявлена поддержка MCP для обоих.

Источники: t.me/cgevent

7. Pallaidium: опенсорсный Blender-пайплайн 2D→3D→видео с учетом освещения

Описан опенсорсный пайплайн Pallaidium для Blender, который строит 3D из 2D (через Pixal3D), добавляет 360/HDRI окружение с авто-выравниванием света и использует это как управляющий контур для генерации видео (в связке с LTX и озвучкой). Важность в том, что пайплайн пытается переносить не только геометрию, но и освещение, улучшая управляемость и консистентность результата.

Источники: t.me/cgevent

8. Framethrower: бесплатный video-to-depthmap конвертер для управления генерацией видео

Появился инструмент Framethrower для извлечения depth map из видео, чтобы использовать глубину как управляющий сигнал при генерации собственного видео. Источник отмечает, что сервис доступен бесплатно, что снижает порог входа для depth-guided видеопайплайнов.

Источники: t.me/cgevent

9. Демонстрация MCP-автоматизации ComfyUI: от поиска видео до depth/pose и генерации

Приведен кейс, где Claude через Comfy MCP автоматизирует видеопайплайн: находит фрагмент, режет по сценам, прогоняет workflow с Depth Anything и OpenPose, выбирает кадр и делает замену персонажа через GPT Image 2, затем пишет промпты и запускает генерации в Seedance 2.0 и собирает сравнение. Важность в том, что MCP сокращает ручной препроцессинг и работу с нодами, превращая сложный workflow в управляемую агентом процедуру.

Источники: t.me/cgevent

10. LTX выпустила LoRA для LTX 2.3: превращение фото в зацикленные синемаграфы

Опубликована LoRA-модель Lightricks для LTX 2.3, которая превращает статичные изображения в плавные зацикленные cinemagraph-лупы с выборочным движением при сохранении остальной сцены неподвижной. Это расширяет набор готовых инструментов для контролируемой анимации из одного кадра.

Источники: t.me/cgevent

11. ByteDance Seedream 5.0 Pro: упор на редактирование, слои PNG и текст/инфографику

ByteDance представила Seedream 5.0 Pro с инструментами редактирования по выделению (точка/рамка/лассо/пометки/скетч), возможностью менять цвет по HEX, материалы и превращать набросок в дизайн. Отдельно заявлено разбиение результата на более чем 10 независимых слоев в PNG с прозрачностью и поддержка текста/инфографики (14 языков); доступны страницы продукта, техблог и API-документация.

Источники: t.me/cgevent

12. Прототип Human Operator: ИИ управляет движениями человека через EMS на хакатоне MIT

Команда из шести участников на 48-часовом хакатоне MIT Hard Mode 2026 показала прототип Human Operator: камера и голосовая команда отправляются в ИИ (через Claude API), модель планирует движения, а Arduino управляет Electrical Muscle Stimulation, заставляя мышцы выполнять действия (например, играть на пианино). Важность в демонстрации связки «модель → план действий → физическое исполнение человеком» и потенциальных применений/рисков интерфейсов управления телом.

Источники: t.me/cgevent

Read more

AI: дайджест за 2 сентября 2026

AI: дайджест за 2 сентября 2026

1. Google выпустила Gemini 3.8 Flash и закрытую версию Cyber для поиска уязвимостей Сообщается о релизе Gemini 3.8 Flash: цена за токен как у 3.7 Flash, но модель в среднем расходует больше токенов; также представлена Gemini 3.8 Flash Cyber для задач поиска уязвимостей, доступ к которой

By Kirill Brusenskiy
AI: дайджест за 1 сентября 2026

AI: дайджест за 1 сентября 2026

1. Инженер SpaceX описал «команду» из Grok Bot, управляющую сотнями cloud-агентов и PR Инженер SpaceX Линкси Ли рассказал, как организовал пять специализированных ботов в Grok Bot, которые запускают Cursor cloud-агентов, проверяют CI/PR, делают код-ревью и мержат безопасные изменения, масштабируя работу до 200+ параллельных агентов. Заявлены результаты вроде 2000+ PR

By Kirill Brusenskiy
AI: дайджест за 31 августа 2026

AI: дайджест за 31 августа 2026

1. Fal запустил интерактивные «бесконечные» AI-стримы и готовит H3 Max Director с долгим контекстом Fal после вирусного кейса с бесконечным AI-стримом запустил fal.live, где зрители могут влиять на генерацию в чате, и совместно с levelsio сделал отдельный проект Infinite Slop. Параллельно компания навайбтренировала новый чекпойнт H3 Max Director: long-form

By Kirill Brusenskiy
AI: дайджест за 30 августа 2026

AI: дайджест за 30 августа 2026

1. Google довела Gemini Omni 1.1 Flash до GA и улучшила продление видео Google перевела Gemini Omni 1.1 Flash в статус GA и добавила инструменты для сборки длинных роликов: видео можно продлевать 10‑секундными кусками до 40 секунд, при этом модель учитывает последние 10 секунд исходника. Появился черновой

By Kirill Brusenskiy