AI: дайджест за 17 мая 2026
1. Red Hat AI сравнила TurboQuant с FP8/BF16 в vLLM: компрессия есть, но часто ценой скорости
Команда Red Hat AI провела систематическое исследование TurboQuant в интеграции с vLLM на ряде задач (включая reasoning и long-context retrieval) и сравнила режимы bf16, fp8 и несколько вариантов TurboQuant. По результатам, FP8 сохраняет около 98% качества при ~2× экономии памяти и может ускорять инференс на Llama, тогда как TurboQuant k8v4 почти не выигрывает по памяти относительно FP8 и замедляет инференс, а 4bit-nc выглядит компромиссом по качеству/сжатию при падении скорости; более агрессивные квантизации заметно ухудшают качество.
Источники: t.me/gonzo_ML