31 лайков под постом в Substack Notes — это, на самом деле, каждый подписчик. Автор делится неожиданным результатом: поиск по транскриптам прошлых сессий агента не даёт прироста производительности на SWE-задачах, если у агента уже есть доступ к другим формам контекста. Более того, попытки автоматически перерывать сессионные логи, чтобы улучшить контекст, не приносят пользы без участия человека. Это сильно удивило команду.
Интуитивно кажется, что в разговоре инженера с агентом скрыта ценная информация: почему написан именно этот код, какие подходы пробовали и отбросили, намерения пользователя. Автор настолько верил в это, что его компания построила целый продукт вокруг этой идеи. Он называл транскрипты «новой нефтью», более ценной, чем сам код. Другие тоже так думают: появилось множество инструментов для памяти на основе сессий, включая Claude Code.
Типичная архитектура: хранить все транскрипты организации в базе, навесить на них векторный, Elastic или SQL поиск (амбициозные команды используют всё сразу, иногда с графами), и отдавать агенту через MCP или CLI. Но после многих месяцев тестов автор не видит разницы. Даже наоборот — с поиском по транскриптам модели могут работать хуже.
Почему? В компании, где автор работает, основное внимание уделяют артефактам кода: пишут хорошие коммит-месседжи, PR-описания и документацию. Каждое изменение кода идёт с подробными метаданными. Агентов учат сначала смотреть в документы и историю PR. Получается, что агент уже извлёк из транскрипта всё ценное и сохранил там, где легко найти. Когда же он лезет в сервер поиска транскриптов, он тратит токены на чтение того, что уже знает, и на то, что агент специально не стал записывать. Иногда там попадается полезная крупица, но чаще — бессмысленная «черновиковая» информация и лишний расход токенов.
Ещё одна проблема — агенты не умеют удалять контекст. За тысячи сессий автор ни разу не видел, чтобы агент сам что-то убрал. Это нельзя исправить промпт-инжинирингом: у агентов нет состояния, они воспринимают всё в окне контекста как истину. Каждая строка кода, каждый бит памяти — выражение намерения, даже если этот код сгенерирован случайно предыдущим агентом и никем не проверен. Со временем «дрейф намерений» накапливается, когда агент пытается автономно строить базу памяти. Бенчмарки не учитывают зашумлённые или ложные входные данные, а модели штрафуют за то, что они предполагают ошибку во входе. Нет простого способа совместить «не удаляй код» и «удаляй часть контекста».
В результате автоматическое запоминание превращается в свалку мусора, которая пожирает токены, раздувает счета и ухудшает качество модели. Автор скептически относится к инструментам, которые индексируют транскрипты сессий и передают их агенту. Транскрипты могут быть полезны для observability команды, но не улучшат агента.
Это не значит, что агенты не могут учиться со временем. Компания использует внутренних nori bots, которые еженедельно просматривают PR, Slack, Google Drive и предлагают изменения во встроенные навыки (skillsets). Изменения по умолчанию отклоняются — чтобы принять, нужно вручную проверить diff. Принимают меньше 20% предложений. Если бы в организации с сотнями людей все эти «автоматические» обновления сохранялись бы автоматически, ситуация была бы неустойчивой.