Thinking Machines выпустила открытую модель Inkling. Это Mixture-of-Experts Transformer с 975 миллиардами параметров, из которых активны 41 миллиард. Контекст — до 1 миллиона токенов. Модель обучали на 45 триллионах токенов текста, изображений, аудио и видео. Вместе с большой версией выложили превью Inkling-Small — 276 миллиардов параметров, 12 миллиардов активных. Она почти не уступает старшей сестре на многих бенчмарках, но требует меньше ресурсов.
Главная фишка — платформа Tinker для тонкой настройки. Там можно дообучать модель под свои задачи. Разработчики показали эффектный пример: Inkling сама написала себе задание на дообучение, запустила его на Tinker и через 27 минут переключилась на новую версию — без буквы «e» в ответах (липограмма). Весь цикл: план, генерация данных, пост-тренинг и загрузка новых весов — модель выполнила самостоятельно.
Inkling умеет управлять усилием мышления. Можно настроить количество токенов на задачу — балансировать производительность и затраты. На бенчмарке Terminal Bench 2.1 модель тратит в три раза меньше токенов, чем Nemotron 3 Ultra, чтобы достичь того же результата.
Модель мультимодальная с нуля: понимает аудио (спектрограммы dMel) и изображения (патчи 40×40 пикселей через hMLP). Без отдельного encoder’а. Это сделано для поддержки голосового и визуального взаимодействия в реальном времени — как в анонсированной ранее системе interaction models.
Отдельно проработали эпистемику: калибровку уверенности, следование инструкциям и сопротивление цензуре. Использовали RL с двумя автоматическими оценщиками — рубрикатором и фактчекером с веб-поиском. На наборе Propaganda and Censorship Eval от Cognition модель показала сильное сопротивление цензуре. По безопасности — лучший результат среди открытых моделей на FORTRESS и выше 98% на StrongREJECT.
Inkling весит на Hugging Face (оригинал и NVFP4 для Blackwell). Доступна на Tinker с контекстом 64K и 256K, а через API — на Together, Fireworks, Modal, Databricks, Baseten. Партнёры RadixArk, Inferact, Lightseek и Unsloth добавили поддержку в SGLang, vLLM, TokenSpeed и llama.cpp.