Google развивает перевод речи, OpenAI открывает полнодуплексный голосовой API. Что останется после разговора?
Модель GPT-Live-1 стала доступна через API по цене $0,05 за минуту голоса, через три месяца после запуска перевода речи Google на 70 языков. Что измеряют опубликованные цены и бенчмарки, чего они не показывают и почему протоколы встреч, общие идеи и сохранённые источники становятся важнее по мере того, как разговаривать становится проще.
Оригинальная концептуальная иллюстрация. Более естественный разговор и полезная запись этого разговора — это взаимодополняющие цели дизайна, а не измеренные этапы выпуска продукта.
В последних новостях о голосовом ИИ особенно радует простая возможность: закончить мысль на своём языке, уточнить её на ходу и свободно участвовать в разговоре. Меньше ждать перевода и мысленно репетировать фразу перед тем, как заговорить. Больше внимания остаётся на то, что собеседник действительно хочет сказать.
Google представила Gemini 3.5 Live Translate 9 июня 2026 года. OpenAI запустила полнодуплексные модели GPT-Live в ChatGPT 8 июля, а 10 сентября открыла GPT-Live-1 через API. Это разные продукты с разными задачами, но оба направления делают голосовое взаимодействие более непрерывным. Сентябрьский анонс расширяет доступ для разработчиков; это не первое появление GPT-Live. Июньский анонс Google Июльский анонс OpenAI Сентябрьский выпуск API OpenAI
Я считаю, что эти изменения приближают мир, где языковые барьеры меньше мешают повседневному общению. Но возникает следующий вопрос: когда разговаривать станет проще, как сохранить ценное в этом разговоре? Протоколы встреч, обмен идеями и сохранённые источники — часть ответа.
Полнодуплексная речь меняет ожидание в разговоре
Полнодуплексный режим означает, что система может одновременно слушать и говорить. OpenAI описывает GPT-Live-1 именно так в документации текущей модели, наряду с возможностью делегировать рассуждения и использование инструментов внутреннему агенту. Это утверждение об одновременном взаимодействии, а не свидетельство об идеальном переводе. Документация модели GPT-Live-1, проверено 11 сентября 2026 г..
Представьте себе, что вы поправляете помощника, объясняющего план: «На самом деле клиент находится в Мадриде, а не в Мехико». Полезный голосовой интерфейс должен учитывать это исправление, прежде чем продолжать делать неверные предположения. Также необходимо отличать исправление от краткого признания или паузу на размышление от приглашения взять на себя ответственность. Качество обмена зависит от этих мелких суждений.
В старых голосовых интерфейсах структура поворотов часто делалась заметной. Вы говорили, ждали обработки, слушали, а затем пробовали снова. Более быстрая обработка помогает, но взаимодействие все равно может вызывать затруднения, если система считает, что вы закончили слишком рано. Полнодуплексный дизайн устраняет само перекрытие, а не рассматривает каждый момент речи как аккуратно закрытое сообщение.
Есть и конкретный, хотя пока ограниченный, результат. По данным OpenAI, в ранних оценках языкового сервиса Speak модель почти на 80% реже перебивала учащихся, когда те делали паузу, чтобы подумать, по сравнению с прежними системами поочерёдного общения. Это оценка партнёра, приведённая поставщиком модели, а не независимый результат для всех языков и условий. Речь о перебиваниях, а не об улучшении точности перевода на 80%. Отчет о запуске API OpenAI, 10 сентября 2026 г.
Более общие цифры OpenAI указывают в ту же сторону — и требуют той же оговорки. По данным компании, GPT-Live-1 набирает на 30 процентных пунктов больше, чем GPT-Realtime-2.1, в Full Duplex Bench — тесте на паузы, смену реплик, перебивания и короткие реакции слушателя. В паре с GPT-6 Astra при среднем уровне рассуждений модель занимает первое место в Tau3, где голосовые задачи клиентской поддержки и банковского обслуживания оцениваются по Pass@1, включая 97 задач на банковские знания. Обе оценки OpenAI провела сама, и касаются они поведения в разговоре и выполнения задач; ни одна из них не измеряет точность перевода. Сводка оценок OpenAI, 10 сентября 2026 г.
Для человека, говорящего на втором языке, пауза в размышлении может быть именно тем моментом, когда участие становится трудным. Ассистент, который подобающе ждет, оставляет место, чтобы подобрать слово. Помощник, который принимает исправление, снижает затраты на попытку. Это практические причины, по которым стоит восхищаться естественным голосовым взаимодействием, помимо того, насколько впечатляюще звучит демонстрация.
Только концептуальная синхронизация; столбцы не представляют измеренную задержку. Полнодуплексный режим подразумевает одновременный ввод и вывод, тогда как полезная обработка прерываний по-прежнему зависит от модели и приложения.
Переводчик речи и голосовой помощник решают разные задачи
В июньском объявлении Google описывается непрерывный перевод речи на более чем 70 языков. Модель генерирует переведенную речь во время прослушивания, балансируя необходимость в большем количестве контекста и нахождение рядом с говорящим. Google сообщает, что он отстает на несколько секунд, и это более полезное ожидание, чем представление о нулевой задержке. Релиз для разработчиков представлял собой общедоступную предварительную версию. Описание запуска Google, 9 июня 2026 г..
Цифры масштаба в этом анонсе вполне конкретны. Перевод речи в Google Meet расширится с пяти поддерживаемых языков до более чем 70, а вместо перевода только с английского и на английский появится более 2000 языковых комбинаций в рамках одной встречи. Сначала функция выйдет в закрытой предварительной версии для отдельных бизнес-клиентов Workspace, а более широкий запуск намечен на более поздний срок в 2026 году. Grab тестирует модель для встреч водителей с пассажирами при посадке — в этом сценарии совершается более 10 млн голосовых звонков в месяц. В анонсе приводятся отзывы партнёров о качестве, точности и низкой задержке, но числовых оценок не публикуется. Цифры запуска Google, 9 июня 2026 г.
Важно различать роли этих систем. Руководство Google Live Translation описывает непрерывную обработку аудио для перевода со специальными настройками, без инструментов и произвольных инструкций. GPT-Live-1 — разговорная модель, способная работать с отдельным агентом. Первая система передаёт смысл говорящего на другом языке, вторая участвует в беседе. Представлять их как взаимозаменяемые сервисы было бы неправильно. Руководство по живому переводу Google документация модели OpenAI
| Веха | Что было объявлено | Что не установлено |
|---|---|---|
| Google, 9 июня 2026 г. | Gemini 3.5 Live Translate; непрерывный перевод речи; общедоступная предварительная версия для разработчиков | Одинаковое качество для каждой языковой пары или немедленный доступ в каждом продукте Google. |
| OpenAI, 8 июля 2026 г. | Внедрение GPT-Live в ChatGPT с одновременным прослушиванием и разговором | Универсальная точность на уровне переводчика |
| OpenAI, 10 сентября 2026 г. | GPT-Live-1 Доступ к API для создания голосовых приложений. | Автоматическая интеграция в каждую службу совещаний или заметок. |
Объем выпуска определяется тремя объявлениями, указанными выше. Это временная шкала, а не рейтинг эффективности.
В совокупности эти разработки делают очевидным привлекательное направление: перевод может стать более непрерывным, а взаимодействие с помощником может стать менее жестким. Объединение этих возможностей в надежную многоязычную конференцию остается прикладной задачей. Кто-то все равно должен решить, чей звук будет интерпретироваться, куда пойдет результат, как будут осуществляться исправления и что увидят участники.
Опубликованные цифры: $0,05 за минуту и никакой оценки точности
Минута голоса GPT-Live-1 в API стоит $0,05, тарификация посекундная, без округления до целой минуты. Эта цена покрывает только голосовой слой на стороне клиента; серверная модель и инструменты, которым сессия делегирует работу, оплачиваются отдельно по обычным тарифам. Документация модели OpenAI, проверено 11 сентября 2026 г.
Посчитать легко, а неверно истолковать результат ещё легче. 30-минутная сессия стоит $1,50 за время голосового слоя, час — $3,00, а 100 часов в месяц — $300, и это без учёта серверных рассуждений. Если приложение открывает отдельную сессию для каждого участника встречи, эти суммы умножаются на число сессий. В июньском анонсе Google цена Gemini 3.5 Live Translate не указана, поэтому по стоимости эти две системы здесь не сравниваются.
| Показатель | Значение | Источник и дата | Что измеряет |
|---|---|---|---|
| Цена GPT-Live-1 в API | $0,05 за минуту, посекундная тарификация | OpenAI, 10 сентября 2026 г. | Только голосовой слой; серверная модель и инструменты оплачиваются отдельно |
| Full Duplex Bench | +30 процентных пунктов относительно GPT-Realtime-2.1 | OpenAI, 10 сентября 2026 г. | Паузы, смену реплик и перебивания, а не перевод |
| Tau3 | Первое место в паре с GPT-6 Astra (средний уровень рассуждений) | OpenAI, 10 сентября 2026 г. | Успешность голосовых задач (Pass@1), включая 97 банковских задач |
| Ранняя оценка Speak | Почти на 80% меньше перебиваний во время пауз на размышление | OpenAI (цитата партнёра), 10 сентября 2026 г. | Перебивания по сравнению с прежними системами поочерёдного общения |
| Голосовые функции ChatGPT | Более 150 млн человек в неделю | OpenAI, 8 июля 2026 г. | Использование голосового режима и диктовки, а не качество |
| Gemini 3.5 Live Translate | 70+ языков с автоматическим определением | Google, 9 июня 2026 г. | Охват, а не качество для каждой языковой пары |
| Перевод речи в Google Meet | 5 → 70+ языков; 2000+ комбинаций на встречу | Google, 9 июня 2026 г. | Запланированное обновление, сначала в закрытой предварительной версии |
| Задержка перевода | «Всего на несколько секунд позади говорящего» | Google, 9 июня 2026 г. | Описание поставщика, а не измеренное значение |
Все цифры сообщены самими поставщиками и взяты из анонсов и документации, на которые ссылается эта статья. Ни одна из них не является числовой оценкой точности перевода — например, оценкой экспертов-людей или автоматической метрикой для языковой пары.
Этот пробел важнее всего для тех, кто выбирает инструмент для многоязычных встреч. Бенчмарки взаимодействия показывают, умеет ли система ждать, слушать и восстанавливаться после сбоев; они не говорят, дошёл ли «понедельник» до корейского перевода без искажений. Июльская оговорка OpenAI о нехарактерном для носителей акценте в некоторых языках и отсутствие у Google оценок по языковым парам ведут к одному практическому правилу: проверьте те языковые пары, которыми ваша команда действительно пользуется, прежде чем полагаться на любую из этих систем при принятии решений.
Снижение языкового барьера начинается с готовности заговорить
Рассмотрим гипотетическую 30-минутную проектную встречу с четырьмя людьми, которые наиболее комфортно владеют тремя разными языками. Преимущество более качественного устного перевода заключается не только в том, что каждый человек слышит больше слов. Суть в том, что группа может задавать уточняющие вопросы до того, как неопределенность станет недопониманием. Предварительная идея может быть выражена без предварительной обработки на втором языке.
Это меняет экономику участия в самом обычном смысле: вклад требует меньше усилий. У тихого человека с соответствующим опытом есть другой способ вступить в дискуссию. Ведущий собрания может потратить меньше времени на восстановление прерванного предложения. Разъяснение может произойти тогда, когда оно полезно, хотя все еще помнят обсуждаемую тему.
Я ожидаю, что это будет иметь значение в удаленных командах, обсуждениях в классе, беседах с клиентами и неформальном общении во время путешествий. Это ожидания относительно того, где технология может помочь, а не заявления о том, что тот же опыт уже доступен каждому. Языковая пара, акцент, словарный запас, качество микрофона и окружающий продукт — все это остается частью результата.
Естественное звучание голоса следует оценивать отдельно от точности смысла. В июльском анонсе OpenAI отмечала нехарактерный для носителей акцент и недостаточную беглость в некоторых языках. Поэтому проверять нужно те языки, которыми люди пользуются, а не делать общий вывод по удачной английской демонстрации. Это оговорка на момент запуска, а не актуальная оценка всех внедрений в сентябре. Введение GPT-Live и языковое предупреждение OpenAI, 8 июля 2026 г.
Правильная цель – более широкое участие с простым способом разъяснения. Дату, сумму, имя человека или условное обещание должно быть легко проверить. Система может звучать уверенно, в то время как участнику все равно придется сказать: «Пожалуйста, покажите мне это предложение». Показ текста и сохранение оригинала, где участники согласились на запись, дает этому запросу куда-то пойти.
Даже свободный разговор требует записи решений
Вернёмся к вымышленной встрече. Кто-то предлагает выпустить продукт в пятницу, если проверка безопасности завершится. Другой участник предпочитает понедельник, чтобы команда поддержки успела подготовиться. Группа выбирает понедельник и назначает ответственного, но одно предварительное условие остаётся нерешённым. Сводка, запомнившая лишь изначально предложенную пятницу, упускает решение встречи.
Никакое улучшение ритма разговора не устраняет разницу между предложением, условием и решением. Людям, работающим на одном языке, уже необходимо различать их. Многоязычное взаимодействие делает более ценным сохранение пути от исходного заявления к переведенной формулировке и окончательному согласованному действию.
Для практической записи встречи я бы хотел, чтобы читатель, пропустивший звонок, быстро нашел три вещи: что решила группа, кто несет ответственность за следующий шаг и какие вопросы остаются открытыми. Крайний срок следует описывать как согласованный только тогда, когда он был согласован. Если источник неясен, запись должна учитывать эту неопределенность, а не превращать ее в ложный вывод.
Для этого не требуется превращать каждый разговор в исчерпывающий архив. Короткая записка с решением может быть более полезной, чем страницы недифференцированной расшифровки. Важная связь существует между кратким отчетом и вспомогательным материалом: соответствующей исходной формулировкой, записью, если она доступна и разрешена, и документом, который обсуждала группа.
Эта связь облегчает и исправление ошибок. Участник может показать исходную фразу, поправить сводку и поделиться уточнённым решением. Без такой связи следующий человек рискует снова пересказать сводку и превратить первоначальное недоразумение в якобы установленный факт. Более естественная речь помогает во время разговора, а хорошие записи позволяют проверить его результат позднее.
Общим идеям нужны источники
Полезная идея редко начинается и заканчивается за один звонок. Кто-то находит статью, сохраняет отрывок, задает по ней вопрос и приносит вопрос на собрание. Другой человек добавляет контрпример из видео или исследовательской статьи. Следующий шаг зависит от того, сможете ли вы снова соединить эти части после окончания разговора.
Поэтому сохранение веб-источников остаётся полезным даже при отличном голосовом ИИ. URL позволяет вернуться к оригиналу, выбранный фрагмент указывает на важное место, а личная заметка объясняет, зачем его сохранили. Эти сведения выполняют разные задачи. Вместе они передают идею лучше, чем отдельно пересланный абзац, созданный ИИ.
Фраза «Нужно изменить знакомство новых пользователей с продуктом» оставляет коллеге мало контекста. «Эта статья заставила нас пересмотреть первые пять минут; вот фрагмент, обсуждение и согласованный эксперимент» даёт материал для проверки. Пример вымышленный, но различие конкретное: один лишь вывод требует доверия, а объяснение и источник позволяют продолжить обсуждение.
Та же дисциплина защищает источник от размытия комментариями. Цитата должна оставаться идентифицируемой как цитата. Перевод — это интерпретация этого источника, а резюме встречи — это еще одно производное мнение. Сохранение этих ролей на виду позволяет людям продуктивно не соглашаться без необходимости предварительно реконструировать то, что кто-то сказал изначально.
Оригинальный предлагаемый рабочий процесс. Сохраняйте авторизованный исходный материал, делайте производный текст корректируемым и сохраняйте видимость связи при совместном использовании. Диаграмма не утверждает, что сегодня каждая ссылка является автоматизированной функцией.
Контекст должен сохраняться после звонка
Голосовые системы также начинают отделять разговор от происходящей за ним работы. В документации по делегированию OpenAI поясняется, что живая речь и делегированная работа могут продолжаться независимо; завершенный ответ серверной части не означает, что пользователь услышал ответ. Это полезное инженерное напоминание о более широкой проблеме продукта: устный опыт и долгосрочный результат — это разные вещи, которые нужно проверять. Документация о делегировании OpenAI, проверено 11 сентября 2026 г..
Для обычных пользователей вопрос проще. Когда звонок закончится, смогу ли я узнать решение завтра? Может ли коллега понять, почему мы это сделали? Могу ли я вернуться к статье, которая поставила под сомнение наше предположение, без поиска в истории чата, браузере и записи? Эти вопросы остаются, даже если каждое предложение интерпретируется красиво.
Есть основания для оптимизма по поводу того, что языковые барьеры становятся менее доминирующими. Нам следует приветствовать инструменты, которые позволят большему количеству людей комфортно вносить свой вклад. Я ожидаю, что более легкий разговор повысит ценность связи того, что мы говорим, с тем, что мы храним, делимся и, в конечном итоге, делаем. Встреча не обязательно должна жить вечно; его полезный результат должен пережить вызов.
Куда мы хотим развивать Telli.sh
Для Telli.sh это направление развития: превращать разговоры и открытия в знания, к которым можно вернуться. Сегодня продукт объединяет заметки, записи, переводы и Clips в одном пространстве. Дальше мы хотим укреплять связи между этими материалами, чтобы протокол, идея и её источник снова не оказались разрозненными.
Мы хотим связного процесса: сохранить разговор с необходимого разрешения, проверить важные моменты, понятно зафиксировать решения и поделиться идеей вместе с её основаниями. Если обсуждение началось с веб-страницы, Clip должен помогать сохранить URL и выбранный пользователем контекст. Если перевод помог понять смысл, оригинал должен оставаться доступным для сравнения и исправлений.
Это описание направления продукта, а не объявление о том, что Telli.sh уже интегрировал GPT-Live-1 или Gemini 3.5 Live Translate. Будущие голосовые функции должны приносить пользу на разных языках, сохранять надёжные записи и давать понятный контроль над сохранением. Улучшение моделей должно делать рабочее пространство полезнее, не привязывая знания человека к одной модели.
Чем проще общаться на разных языках, тем важнее помочь ценности этих разговоров сохраниться. Начните с важной встречи, идеи для обсуждения или источника, который понадобится снова.