Vivedha Elango в разборе работы Gekhman et al. «Thinking to Recall» добавляет к пересказу собственный эксперимент — и именно он делает статью стоящей. Центральный тезис исследования: reasoning нужен не только «сложным задачам» — он расширяет границу того, что модель способна вспомнить из собственных весов. 90% вопросов SimpleQA-Verified — однохоповые фактические, и thinking всё равно помогает. Механизма два, и они разделимы экспериментально: computational buffer (филлер «Let me think» ×200 поднимает accuracy — лишние forward-пассы дают скрытому состоянию дорефайниться) и factual priming (модель генерирует смежные факты и выводит себя к целевому — девять королей Непала подводят к десятому).
Совет, который не пережил теста
Самое ценное в статье — не результат, а дисциплина. Автор экстраполировала находку на RAG: facts-first пайплайн — retrieve, сжать в список фактов, отвечать по списку. Протестировала до публикации — экстраполяция не выжила: accuracy идентичная (82.4% против 82.4%) при ~6.5× латентности. Объяснение честное: priming разблокирует знание, запертое в весах; в RAG ответ уже лежит в retrieved-контексте, разблокировать нечего, остаётся лишний lossy-проход. Для Medium, где советы публикуются без прогона, отрицательный результат — жанр, которого катастрофически не хватает. Механизмы не переносятся между режимами бесплатно — этот мета-урок стоит больше любого прироста в процентах.
Что беру для локальных моделей
- Слабые модели выигрывают больше. Прирост от reasoning упорядочен обратно способности модели: Qwen3-32B получает больше, чем Gemini 2.5 Flash, тот — больше, чем Pro. У маленькой модели больше «запертого» знания. Для локального деплоя на собственном железе это меняет расчёт: thinking-бюджет у 30B-модели окупается там, где у фронтир-модели он потрачен впустую.
- Решение по метрикам, а не по вкусу. Top-1 низкий при высоком pass@k — модель «знает, но не дотягивается», thinking поможет. Оба низкие — знания в весах нет, нужен retrieval, thinking-токены жгут бюджет впустую.
- Facts-first prompting для closed-book: первым вызовом перечислить релевантные факты, вторым — ответить по списку с reasoning OFF. Близко к полному thinking за долю компьюта.
Тёмная сторона важнее бенчмарков
Галлюцинация в промежуточном факте каузально тянет неверный финал: regression slope 0.84–0.86, чистые трейсы дают 71.1% против 32.2% у грязных. Reasoning-модель заворачивает неверный ответ в убедительную цепочку промежуточных «фактов» — ложная уверенность вместо честного незнания. В многошаговом агенте это компаундится: галлюцинация шага 2 становится priming-контекстом шага 3. Лекарство без перетренинга — селекция трейсов («Only Facts» +8.2%, «Only Correct Facts» +12.2% relative), с одним жёстким требованием: верификатор обязан уметь воздерживаться — галлюцинирующий верификатор хуже отсутствующего.
Итог
Thinking — не тумблер «сделать умнее», а инструмент с измеримой зоной применимости. Граница проходит по pass@k, цена — по чистоте трейса, а советы — даже собственные — живут до первого прогона.