AI: дайджест за 16-23 мая 2026
1. AutoTTS: агентный автопоиск стратегий test-time scaling для LLM
Представлен фреймворк AutoTTS, где LLM-агент автоматически синтезирует контроллеры, управляющие ветвлением/прунингом/остановкой на инференсе вместо ручных эвристик. Сообщается о снижении расхода токенов почти на 70% относительно self-consistency при сохранении качества и о низкой стоимости автоматического поиска (менее $40), что делает TTS более практичным для прикладных задач.
Источники: t.me/gonzo_ML
2. Anthropic Mythos/Project Glasswing: масштабные результаты по поиску уязвимостей и высокая подтверждаемость
Anthropic опубликовали промежуточные итоги Mythos/Project Glasswing: партнеры нашли десятки тысяч уязвимостей, а некоторые сообщили о росте скорости обнаружения багов более чем в 10 раз; Cloudflare заявляет о 2000 найденных уязвимостях и более низком уровне ложных срабатываний, чем у людей. В опенсорсе просканировано более 1000 крупных репозиториев, заявлено 6202 уязвимости высокого/критического уровня; из 1752 проверенных независимыми компаниями 90% подтверждены, что подчеркивает как пользу, так и риски злоупотребления такими моделями.
Источники: t.me/denissexy
3. Cerebras: запуск Kimi K2.6 на 1000 ток/с и новости об IPO
Сообщается, что Cerebras запустили модель Kimi K2.6 (триллион параметров) со скоростью около 1000 токенов в секунду, что позиционируется как первый такой запуск для модели этого масштаба, но пока доступен только enterprise-клиентам. Также утверждается, что компания вышла на IPO и привлекла $5.5 млрд при оценке $60 млрд.
Источники: t.me/ai_newz
4. Black Forest Labs выпустили Flux Erase: удаление объектов с ручной маской (API/демо)
У Black Forest Labs появился инструмент Flux Erase для удаления объектов, который требует ручной грубой маски и доступен через API и демо. Указывается, что под капотом Flux.2 Klein 9B и что релиз выглядит слабее альтернатив, что важно для оценки реальной динамики продукта FLUX и его конкурентоспособности.
Источники: t.me/cgevent
5. WavFlow от Meta: генерация аудио напрямую в waveform-пространстве
Meta представили WavFlow для генерации звука (в т.ч. Foley по видео и по тексту), где синтез идет напрямую в пространстве аудиоволны без VAE и латентного сжатия. Заявляется, что подход работает быстрее и не хуже по качеству, а наличие демо и кода упрощает проверку и внедрение.
Источники: t.me/cgevent
6. PanoWorld: превращение 2D-планов этажей в согласованные фотореалистичные виртуальные туры
Показан проект PanoWorld, который преобразует планы этажей дома в фотореалистичные, структурно согласованные виртуальные туры с сохранением планировки при перемещении. Это важно для девелопмента и недвижимости как способ визуализировать объект до строительства; код заявлен, но на момент сообщения недоступен.
Источники: t.me/cgevent
7. Партнерство CapCut и Google: монтаж изображений и видео внутри Gemini
Сообщается о партнерстве CapCut с Google: пользователи смогут редактировать изображения и видео прямо в приложении Gemini, используя инструменты CapCut. Это может превратить Gemini в более полноценную среду для креативных рабочих процессов (вплоть до таймлайна монтажа) и усилить конкуренцию среди AI-видеоредакторов.
Источники: t.me/cgevent
8. Runway Aleph 2: обновленный инструмент редактирования видео до 1080p и 30 секунд
Runway выпустили Aleph 2 — инструмент для видеоредактирования, где правки в одном кадре распространяются на весь ролик, включая мультишот-сцены, с учетом физики и освещения и минимальным затрагиванием фона. Заявлены поддержка 1080p и длины до 30 секунд, а также работа через Studio с текстовыми правками и референс-изображениями, что повышает пригодность для продакшна.
Источники: t.me/cgevent
9. GRAM: стохастические рекурсивные рассуждения для задач с множеством решений
Предложен фреймворк GRAM (Generative Recursive reAsoning Models), который делает рекурсивные латентные рассуждения стохастическими и многотраекторными за счет обучаемого шума и вариационного вывода. Это снижает риск коллапса мод и позволяет масштабировать инференс «в ширину» параллельным сэмплингом, показывая преимущества на комбинаторных задачах вроде экстремального судоку, ферзей и раскраски графов.
Источники: t.me/gonzo_ML
10. Apple ML-LiTO: 3D-генерация по одной картинке с открытыми кодом и весами
Apple выпустили собственный 3D-генератор по одному изображению с акцентом на использование освещения под разными ракурсами для более точного восстановления формы. Важно, что опубликованы код и веса, что позволяет воспроизводить результаты и сравнивать подход с другими 3D-генераторами.
Источники: t.me/cgevent
11. Rodin 2.5: рост детализации органики в 3D-генерации (волосы, вены, бороды)
Отмечено, что Rodin 2.5 в режиме Extreme High генерирует более реалистичные анатомические детали (волосы, брови и др.) и поддерживает очень высокую плотность геометрии (упоминается до 10 млн полигонов). Это сигнал о прогрессе 3D-генераторов в сложной органике, что важно для VFX/игр/3D-печати.
Источники: t.me/cgevent
12. Krea.ai: заявлены планы по улучшениям K2 и возможному open-source релизу
В сообщении со ссылкой на пост разработчика Krea.ai перечислены планы: постоянные улучшения K2, выпуск версии с открытым исходным кодом, технический отчет и блоги, а также возможная отдельная аниме-модель. Значимость в том, что потенциальный open-source релиз может повлиять на экосистему генеративных моделей и доступность технологий.
Источники: t.me/cgevent