Запустить большую языковую модель дома — помогает BitTorrent-подход. Вы загружаете только часть модели, а затем подключаетесь к сети других участников, которые держат остальные куски. Так можно генерировать текст с Llama 3.1 (до 405B), Mixtral (8x22B), Falcon (40B+) или BLOOM (176B) — и даже дообучать их под свои задачи. Для этого хватит обычного потребительского GPU или Google Colab.
Однопоточный инференс выдаёт до 6 токенов в секунду для Llama 2 (70B) и до 4 токенов/с для Falcon (180B). Этого достаточно для чат-ботов и интерактивных приложений. В отличие от классических API больших моделей, тут можно применять любые методы тонкой настройки и сэмплирования, выполнять произвольные пути через модель или смотреть её скрытые состояния. Получается удобство API с гибкостью PyTorch и 🤗 Transformers.
Проект — часть исследовательского воркшопа BigScience. Следить за разработкой можно в Discord или по email. На сайте есть форма подписки и список топ-контрибьюторов (сейчас не загружается).