← На главную

Ради рассуждений GLM-5.2 и Qwen3.5 выдают 80% галлюцинаций

16.08.2026 19:04 · hackernews

Бенчмарки показывают странный разрыв: рассуждения становятся дешевле, а знания — нет. GLM-5.2 набирает 99,2% на AIME 2026 примерно с 40 млрд активных параметров на токен, Qwen3.5 — 91,3% с 17 млрд, DeepSeek V4-Flash работает с 13 млрд. По слухам, у GPT-4 в 2023 году было около 280 млрд активных параметров, и он едва решал задачи AIME. Qwen3.5 9B в квантованном виде влезает в 6GB VRAM и примерно удваивает результат следующей лучшей модели до 10B на индексе Artificial Analysis.

Но стоит спросить их о фактах — картина переворачивается. В SimpleQA лидирует Gemini 2.5 Pro всего с 53%. У Qwen3.5 4B и 9B уровень галлюцинаций 80–82% на бенчмарке знаний Artificial Analysis: когда модель не знает факт, а это почти всегда, она его выдумывает. Спроси у 9B год рождения малоизвестного математика 19-го века — получишь уверенный, правдоподобный, но неверный ответ.

Лаборатории сознательно меняют знания о мире на умение рассуждать. Факты занимают место: серия Physics of Language Models оценивает ёмкость порядка двух бит фактов на параметр. Знать всех второстепенных персонажей Википедии, население нидерландских муниципалитетов и порядок аргументов каждой функции в каждом npm-пакете — это огромные веса. Рассуждения сжимаются лучше: это небольшой набор процедур — разбить задачу, проверить себя, откатиться при неудаче. Дистилляция и RL на проверяемых задачах переносят их в маленькие модели. Phi-4 (14B) хороша в математике и плоха в фактах — раньше это выглядело ограничением, теперь это замысел.

Выжившие знания — генералистские: модель знает, что такое PostgreSQL и примерно как работает MVCC, но не помнит, в какой версии добавили конкретную фичу планировщика. Глубина дёшево достаётся поиском, поэтому из весов уходит именно она.

Факты портятся: API меняются, цены меняются, половина знаний модели 2024 года о JavaScript устарела до релиза. Процедуры не портятся: алгебра в 1970-м работала так же. Значит, факты должны жить во внешнем каркасе — retrieval, поиск, вызовы инструментов. Rust — это harness для агентов: источник дешёвой машино-проверяемой обратной связи. Кодинг-агент делает grep по node_modules, а не помнит API наизусть. DeepSeek V4-Flash рассуждает с 13B активных, остальные 271B в экспертах — в основном факты. Убери их — модель 20–40B в 4-битном квантовании влезет в 24GB GPU. Загвоздка: она мало знает.

Это почти решает галлюцинации. Ошибку в весах нельзя найти и исправить; ошибку в документе — можно. Модель цитирует источник, вы правите документ, и все будущие запросы получают исправление. Ошибка в базе знаний — обычный баг. Поэтому в будущем карточки моделей могут перестать указывать knowledge cutoff.

Читать оригинал →