← На главную

Эмили Бендер разъясняет: стохастические попугаи — про LLM, а не весь AI

06.07.2026 14:45 · hackernews

В марте 2021 года четверо исследователей (лингвисты и компьютерщики) опубликовали свою легендарную статью «On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?🦜». Статья прогремела не в последнюю очередь из-за того, что Google уволил двух авторов — Тимнит Гебру и Маргарет Митчелл — незадолго до публикации. Главная мысль: большие языковые модели (LLM) не понимают смысла, а просто статистически предсказывают вероятные последовательности слов. Этот процесс авторы назвали «стохастическим попугаем» — система повторяет шаблоны без осмысления.

За пять лет метафора разошлась далеко за пределы академии, породив споры и даже проекты вроде наплечного робота Stochastic Parrot из MIT Media Lab. Но широкое использование привело к непониманию. Ведущий автор Эмили Бендер, профессор компьютерной лингвистики в University of Washington, написала блог-пост к пятилетию статьи, чтобы развеять мифы.

Самое частое заблуждение: «Бендер считает, что AI — это стохастический попугай». Это не так. Слово «AI» в статье встречается один раз в самом конце. Метафора относилась строго к LLM, а не к шахматным движкам, AlphaFold или системам распознавания изображений. Ещё одна ошибка — воспринимать «стохастического попугая» как оскорбление. Бендер говорит, что это просто точное описание того, как работают модели. Обижаться на него может либо сама модель (что бессмысленно), либо тот, кто считает LLM шагом к великому AI — а Бендер этого идеала не разделяет.

Бендер давно критикует сам термин «искусственный интеллект». Он, по её мнению, сваливает в кучу разные технологии и переоценивает каждую из них. В быту «AI» уже почти синоним «чатбота», но под это же слово подводят совершенно иные вещи вроде AlphaFold или прогнозов погоды. Понятие удобно маркетологам и стартапам, но для обсуждения и регулирования технологий нужны чёткие описания.

Интересный факт: фраза «stochastic parrots» встречается в тексте самой статьи всего два раза — только в заголовке и ещё раз. Бендер признаётся: выбрали её за броскость, а в работе обсуждали целый спектр рисков — от экологии и предвзятости данных до проблем со сбором обучающих выборок. Если бы она переписывала статью сегодня, то обязательно добавила бы раздел об эксплуататорском труде разметчиков данных и массовом воровстве интеллектуальной собственности.

Читать оригинал →