← На главную

Neon и Castform сводят тренировку агентов к промптам

05.08.2026 18:18 · hackernews

У большинства команд лучшие тренировочные данные уже лежат в базах. Проблема — превратить их в пригодный вид и дать агентам возможность дёшево искать и менять данные. Хорошему агенту нужны две вещи: контекст, то есть инструменты, чтобы найти нужные данные, и модель, которая решает, что искать. Расширения Neon (Lakebase Postgres) и Search решают первую задачу, Castform — вторую.

В 2022-м все делали ставку на embedding search. pgvector стал самым скачиваемым расширением Neon, инженеры вручную собирали RAG-пайплайны. К 2025-му появились multi-hop сценарии: модель планирует и ищет несколько раз в цикле. Каждая итерация — вызов фронт-модели. Типичный multi-turn запрос через gpt-5.6-sol занимает больше 10 секунд и стоит около $0.03 end-to-end. Это медленно и дорого.

Маленькие открытые модели в 100 раз дешевле, но из коробки слабее закрытых API-моделей. RL post-training сокращает разрыв: на поиске открытые модели догоняют и обходят frontier-модели, а запрос стоит на порядки меньше. Castform позволяет делать RL post-training без погружения в ML и GPU-инфраструктуру. Цель — сделать это таким же простым, как prompt engineering.

Пайплайн Castform работает через Neon и Lakebase Search. Документы живут в Postgres на Neon. Для синтетических заданий используются lakebase_text и lakebase_vector. Во время RL-обучения каждый rollout ходит в Lakebase Search, финальная модель — тоже на инференсе. Для RL нужны задача, среда с инструментами и reward-функция. Castform превращает корпус в задания и сам ведёт RL-цикл.

Пример: документ про поезда через Navan превращается в ground truth и синтетический вопрос. Поиск в reward-функции гибридный: bm25 через neon.lakebase_text и векторный через neon.lakebase_vector, результаты смешиваются через rrf_merge. Reward оценивает, нашёл ли агент нужный чанк, зацитировал ли источник и дал ли верный ответ. Виден рост награды, можно заходить в отдельные задания и отлаживать сломанные инструменты или reward hacking.

Нагрузка от обучения bursty: агент много раз дёргает Lakebase Search. Neon динамически масштабирует compute, поглощая пики, и снижает ресурсы в простое. Для агентов, которые меняют данные, нужны изолированные окружения. Neon branching даёт каждому rollout отдельное состояние базы, а time-travel запросы показывают, что видел агент. Вместе с autoscaling и scale-to-zero это позволяет тренировать тысячи stateful-роллаутов, не держа тысячи постоянно работающих окружений.

Читать оригинал →