Программы для Windows

Голосовой ИИ-чат не справляется: Стартап нашел решение

13 мая 2026 г.Филипп Радмиров2 мин

Голосовое общение с современным искусственным интеллектом часто напоминает устаревший радиообмен, где участники вынуждены говорить по очереди. Диалог примерно такой: "Привет, ChatGPT, давай поговорим о фильмах! Прием." "Конечно, Бен, о каком фильме ты хотел бы поговорить? Прием." Хотя в голосовых чатах с ChatGPT или Gemini не нужно буквально произносить "прием" или "отбой", именно так устроена их работа изнутри.

В некоторых аспектах голосовые режимы ИИ даже более ограничены, чем старые радиопереговоры. Искусственный интеллект не только ждет, пока вы закончите говорить, но и не воспринимает ничего, что происходит во время вашей речи, включая течение времени. Аналогично, когда ИИ говорит, он слишком занят генерацией ответа, чтобы "думать" о чем-то еще. По сути, текущий голосовой режим ИИ — это обычный текстовый чат, к которому просто добавили озвучку. Поэтому я почти никогда им не пользуюсь.

Эта ситуация может измениться благодаря новому поколению ИИ-моделей, ориентированных на "взаимодействие", которые способны следовать за течением разговора и даже прерывать собеседника, слушая его в реальном времени. Эти "интерактивные" модели, разработанные стартапом Thinking Machines, основанным бывшим руководителем OpenAI Мирой Мурати, отличаются от современных однопоточных ИИ-моделей, которые не могут ни думать во время прослушивания, ни реагировать во время говорения. Вместо этого новые модели используют конфигурацию "мультипоточных микро-оборотов", что позволяет им продолжать обрабатывать входные данные — включая звуки и визуальную информацию — пока они слушают, а затем даже прерывать разговор, основываясь на том, что вы говорите.

В серии демонстрационных роликов Thinking Machines показывает, как их модели (пока находящиеся на стадии исследовательского превью) реагируют на людей-участников в реальном времени во время видеочатов. Они могут определять предметы, которые те держат в руках, и вести текущий подсчет "животных" слов (например, "олень" и "овца"), пока пользователь продолжает говорить. Модели Thinking Machines также демонстрируют впечатляющую выдержку: в другом взаимодействии они терпеливо ждут, не перебивая, пока их собеседник делает глоток кофе посреди предложения.

В другой демонстрации модель (по инструкции) прерывает разговор, в реальном времени исправляя произношение слова "асаи" у говорящего и корректируя ее преднамеренно неверное утверждение о том, что асаи-боулы родом из Аргентины. Да, это может показаться раздражающим, но демонстрация наглядно показывает, что ИИ от Thinking Machines способен реагировать во время прослушивания, а не замирать в ожидании своей очереди.

В чем же секрет Thinking Machines? Компания использует две ИИ-модели: "интерактивная" модель постоянно "присутствует" с пользователем, обрабатывая входные и выходные данные в быстрых 200-миллисекундных интервалах, в то время как вторая, "фоновая" модель, выполняет более сложные задачи, передавая результаты более быстрой интерактивной модели по готовности.

Новые интерактивные ИИ-модели Thinking Machines все еще находятся в разработке (автор пока не видел и не слышал их в действии). Стартап признает, что его модели испытывают трудности с "очень длинными" разговорами и что для корректной работы им требуется "надежное соединение". Текущая "интерактивная" модель компании также довольно компактна, поскольку более крупные модели "слишком медленны для использования в таком режиме".

Тем не менее, новая "полнодуплексная" парадигма от Thinking Machines может стать прорывным решением для голосовых ИИ-чатов, сделав их общение плавным и естественным, а не принужденным и прерывистым, напоминающим устаревший радиообмен.