Google представила новую модель Gemini 3.5 Live Translate для голосового перевода в режиме реального времени. Нейросеть автоматически распознает более 70 языков и генерирует перевод, сохраняя оригинальную интонацию, темп и высоту голоса говорящего.
В отличие от систем, ожидающих завершения фразы, Gemini 3.5 Live Translate обрабатывает аудиопоток синхронно. Задержка между исходной репликой и переводом составляет всего несколько секунд, что позволяет избежать неестественных пауз в диалоге. Модель адаптирована для работы в шумных условиях и не требует ручной настройки параметров. В целях безопасности и борьбы с дезинформацией все сгенерированные аудиозаписи маркируются невидимым цифровым водяным знаком SynthID.
Разработчики уже имеют доступ к инструменту в формате публичной предварительной версии через Gemini Live API и Google AI Studio. Интеграция с платформами Agora, LiveKit и Vision Agents позволяет создавать приложения без необходимости выстраивать собственную инфраструктуру потоковой передачи медиа. В настоящее время технологию тестирует азиатский сервис такси и доставки Grab, обрабатывающий более 10 миллионов звонков в месяц, — для обеспечения коммуникации между водителями и клиентами.
В корпоративном сегменте внедрение начнется в этом месяце в рамках закрытого тестирования для подписчиков Google Workspace в сервисе видеоконференций Google Meet. Обновление будет поддерживать более 2000 языковых комбинаций в рамках одной встречи — в то время как предыдущая версия системы поддерживала лишь пять языков и требовала обязательного наличия английского. Широкий релиз для бизнеса Google планирует на конец 2026 года.
Подписывайтесь на Mediasat в Telegram: здесь самые интересные новости из мира технологий
Обычные пользователи получат доступ к этой функции благодаря глобальному обновлению приложения Google Translate на платформах iOS и Android. При подключении любых наушников система будет транслировать переведенный звук непосредственно собеседнику. Для владельцев устройств на базе Android компания также предусмотрела режим прослушивания (listening mode), позволяющий услышать перевод через динамик телефона — удобное решение для ситуаций, когда наушников нет под рукой.
Gemini 3.5 Live Translate — не единственная новинка в линейке ИИ-моделей Google. Ранее компания анонсировала мультимодальную серию Gemini Omni, первая модель которой — Gemini Omni Flash — умеет не только генерировать видео с нуля, но и редактировать имеющиеся ролики по текстовым командам в диалоговом режиме.
