Дом
Google представляет Gemini 3.5 Transcribe для точного преобразования речи в текст в условиях сильного шума
Компания Google официально представила Gemini 3.5 Transcribe — новейшую разработку в серии Gemini, позиционируя её как самую точную модель распознавания речи в линейке продуктов. Модель, которая теперь доступна разработчикам, предприятиям и обычным пользователям, решает хронические проблемы отрасли, в том числе связанные с фоновым шумом, специализированной терминологией и естественными речевыми паттернами.
Обладая мощными возможностями обобщения, Gemini 3.5 Transcribe отлично справляется с фильтрацией фонового шума и обработкой сложной лексики в различных специализированных областях. Модель уже повысила эффективность работы приложения Gemini на macOS и функции Rambler в Gboard для Android. Разработчики могут использовать этот инструмент для создания инновационных решений, таких как голосовые помощники, системы субтитров в режиме реального времени и рабочие процессы анализа после завершения звонка.

Оптимизированная с учётом нюансов повседневного общения, модель точно улавливает семантический замысел и распознаёт пользовательский словарный запас, помогая пользователям выполнять задачи с помощью голоса. Она включает такие практичные функции, как автоматическая самокоррекция, интеллектуальное удаление слов-заполнителей (например, «э-э», «а-а») и автоматическое форматирование текста. Кроме того, она может делегировать сложные задачи, такие как анализ файлов и генерация изображений, другим моделям Gemini, обеспечивая комплексный опыт взаимодействия между несколькими моделями.
Согласно открытым данным Google, Gemini 3.5 Transcribe демонстрирует средний показатель ошибок по словам (WER) всего 4,0 % в сценариях потоковой обработки и 2,6 % в сценариях без потоковой обработки. Она сохраняет высокую стабильность распознавания даже в условиях сильного шума, обеспечивая превосходную точность при распознавании критически важной алфавитно-цифровой информации, такой как номера заказов и почтовые индексы.
Модель также отличается многоязычной поддержкой и возможностями персонализации, поддерживая 85 языков с адаптацией к различным региональным акцентам и диалектам. Для предварительно обработанного аудио она предлагает идентификацию говорящих с временными метками для максимум трех говорящих. Кроме того, она полностью поддерживает пользовательские словарные списки, эффективно обрабатывая профессиональную терминологию, нестандартные варианты написания и отраслевые названия.
Что касается интеграции в экосистему, разработчики могут получить доступ к Gemini 3.5 Transcribe в режиме предварительного просмотра через API Gemini в Google AI Studio и Google Antigravity, а обычные пользователи могут опробовать его на Android и macOS. Google планирует интегрировать модель в Chrome, обеспечив возможность голосового ввода в любом поле веб-страницы. Этот запуск следует за выпуском Gemini 3.7 Flash, расширением доступа к Gemini для всех пользователей Android в США и его интеграцией в автономные автомобили Waymo, что подкрепляет стремительное развитие Google в области матрицы продуктов искусственного интеллекта для всех сценариев использования.
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (0)
Компания Google официально представила Gemini 3.5 Transcribe — новейшую разработку в серии Gemini, позиционируя её как самую точную модель распознавания речи в линейке продуктов. Модель, которая теперь доступна разработчикам, предприятиям и обычным пользователям, решает хронические проблемы отрасли, в том числе связанные с фоновым шумом, специализированной терминологией и естественными речевыми паттернами.
Обладая мощными возможностями обобщения, Gemini 3.5 Transcribe отлично справляется с фильтрацией фонового шума и обработкой сложной лексики в различных специализированных областях. Модель уже повысила эффективность работы приложения Gemini на macOS и функции Rambler в Gboard для Android. Разработчики могут использовать этот инструмент для создания инновационных решений, таких как голосовые помощники, системы субтитров в режиме реального времени и рабочие процессы анализа после завершения звонка.

Оптимизированная с учётом нюансов повседневного общения, модель точно улавливает семантический замысел и распознаёт пользовательский словарный запас, помогая пользователям выполнять задачи с помощью голоса. Она включает такие практичные функции, как автоматическая самокоррекция, интеллектуальное удаление слов-заполнителей (например, «э-э», «а-а») и автоматическое форматирование текста. Кроме того, она может делегировать сложные задачи, такие как анализ файлов и генерация изображений, другим моделям Gemini, обеспечивая комплексный опыт взаимодействия между несколькими моделями.
Согласно открытым данным Google, Gemini 3.5 Transcribe демонстрирует средний показатель ошибок по словам (WER) всего 4,0 % в сценариях потоковой обработки и 2,6 % в сценариях без потоковой обработки. Она сохраняет высокую стабильность распознавания даже в условиях сильного шума, обеспечивая превосходную точность при распознавании критически важной алфавитно-цифровой информации, такой как номера заказов и почтовые индексы.
Модель также отличается многоязычной поддержкой и возможностями персонализации, поддерживая 85 языков с адаптацией к различным региональным акцентам и диалектам. Для предварительно обработанного аудио она предлагает идентификацию говорящих с временными метками для максимум трех говорящих. Кроме того, она полностью поддерживает пользовательские словарные списки, эффективно обрабатывая профессиональную терминологию, нестандартные варианты написания и отраслевые названия.
Что касается интеграции в экосистему, разработчики могут получить доступ к Gemini 3.5 Transcribe в режиме предварительного просмотра через API Gemini в Google AI Studio и Google Antigravity, а обычные пользователи могут опробовать его на Android и macOS. Google планирует интегрировать модель в Chrome, обеспечив возможность голосового ввода в любом поле веб-страницы. Этот запуск следует за выпуском Gemini 3.7 Flash, расширением доступа к Gemini для всех пользователей Android в США и его интеграцией в автономные автомобили Waymo, что подкрепляет стремительное развитие Google в области матрицы продуктов искусственного интеллекта для всех сценариев использования.
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её











