Google представила Gemini 3.5 Transcribe — модель распознавания речи для прямых эфиров, голосовых ассистентов, встреч и записанных разговоров. Она работает более чем с 85 языками, умеет автоматически расставлять знаки препинания, убирать слова-паразиты, учитывать пользовательский словарь и размечать реплики разных людей. Разработчикам доступны отдельные версии для потокового и готового аудио.
Новую модель Google представила 26 августа. Потоковая версия gemini-3.5-transcribe-live подключается через Live API и рассчитана на задержку менее секунды. Версия gemini-3.5-transcribe обрабатывает записи через Interactions API, добавляет временные метки на уровне слов и определяет говорящих.
Чем новая модель отличается от обычной диктовки
Классическое распознавание старается буквально записать звуки. Gemini 3.5 Transcribe дополнительно восстанавливает структуру фразы. Если человек скажет: «Встретимся во вторник — нет, в среду», итоговый текст может сразу содержать исправленный день без устной оговорки. Модель также форматирует числа, адреса и идентификаторы.
Это удобно для заметок, но требует осторожности в юридически значимой расшифровке. Удаленный повтор или слово-паразит может быть важен для экспертизы. Сервис для протокола должен хранить исходное аудио и позволять отключить «улучшение» текста.
Два режима для разных задач
Потоковая версия нужна голосовым помощникам, субтитрам и звонкам. Она возвращает текст почти сразу и может работать в двустороннем режиме, когда приложение одновременно слушает пользователя и отвечает.
Обработка записи подходит для интервью, совещаний и колл-центров. Модель ставит временные метки и распределяет реплики между тремя говорящими; поддержка большего числа участников пока обозначена как экспериментальная.
Пользовательский словарь позволяет заранее передать фамилии, названия продуктов и профессиональные термины. Это снижает число ошибок там, где обычная система пытается заменить незнакомое слово на похожее общеупотребительное.
Насколько точнее стало распознавание
По данным, которые приводит Google со ссылкой на Artificial Analysis, средняя доля ошибочных слов составляет 4% для потока и 2,6% для обработки записей. Компания также заявляет, что окончательная расшифровка формируется примерно на 70% быстрее, чем у предыдущей модели Chirp 3.
Эти числа нельзя переносить на любой микрофон и язык. Результат зависит от шума, акцента, дистанции до телефона и того, перебивают ли участники друг друга. Для русского языка практический тест важнее среднего показателя по набору языков.
Что получат владельцы Android
Часть технологии уже используется в функции Rambler клавиатуры Gboard. Пользователь может надиктовать черновик, голосом исправить слово или попросить изменить стиль. Google говорит о запуске только в отдельных странах и языках, поэтому обновление Gboard не гарантирует появления новой кнопки в России.
Gemini 3.5 Transcribe также работает в приложении Gemini на macOS, а интеграция с Chrome должна расширяться позднее. Владельцам Android полезно отделять три разных продукта: Gemini в браузере, голосовой ввод Gboard и API для сторонних приложений. Мы уже объясняли, почему кнопка Gemini в Chrome пока не появилась в России.
Что происходит с аудиоданными
Перед включением новой диктовки стоит проверить, где обрабатывается запись и сохраняет ли ее конкретное приложение. Модель может быть одна, а политика данных — разная у Gboard, корпоративного сервиса и программы стороннего разработчика. Для рабочих встреч нужно учитывать правила компании и согласие участников на запись.
Главное изменение Gemini 3.5 Transcribe — переход от «машинной стенограммы» к готовому тексту, который почти не требует редакторской чистки. Именно эта полезность одновременно создает риск: чем глаже выглядит результат, тем легче не заметить уверенно исправленную моделью фамилию, число или отрицание.
- Pixel 11 Pro получил более тусклый фонарик из-за HiLight: зачем Google пожертвовала яркостью - 27.08.2026
- Google научила ИИ следить за ценами на авиабилеты и бронировать отели: где работает функция - 27.08.2026
- Android 17 начнет замедлять и закрывать прожорливые приложения: кого затронут лимиты памяти - 27.08.2026
