Дом
Google расширяет возможности API Gemini по поиску файлов за счет внедрения передовых мультимодальных функций RAG
Компания Google внедрила значительное обновление функции поиска файлов в своем API Gemini, предоставив разработчикам расширенные возможности мультимодального генерации с использованием результатов поиска (RAG). Это обновление выходит за рамки традиционного поиска, ограниченного только текстом, позволяя ИИ интерпретировать изображения и глубоко интегрироваться со сложными документами — это ключевой шаг вперед в обеспечении точности ИИ корпоративного уровня при поиске информации.
С технической точки зрения новая функция поиска файлов использует модель Gemini Embedding2. В отличие от предыдущих систем, ограниченных векторным поиском по тексту, обновленная система отличается унифицированным мультимодальным встраиванием, что позволяет ей распознавать и обрабатывать визуальный контент в PDF-файлах, документах и различных типах изображений. Это означает, что разработчикам больше не нужно создавать сложные векторные базы данных или системы сегментации документов; они могут реализовать полный рабочий процесс RAG — от загрузки данных до поиска информации — непосредственно в рамках API Gemini.

На практике это усовершенствование решает распространенную проблему: традиционные системы RAG часто не справляются с обработкой нетекстового контента. Раньше графики, проектные схемы или скриншоты продуктов в документах были «слепыми зонами» для ИИ, из-за чего упускался важный контекст. Теперь API Gemini изначально распознает эти визуальные элементы. Например, когда компания загружает PDF-файл с техническими архитектурными схемами или графиками тенденций продаж, ИИ может объединять данные графиков с текстовыми описаниями для предоставления точных аналитических выводов, что значительно повышает полезность ботов службы поддержки клиентов и систем анализа документов.
Для улучшения управления обширными базами знаний Google добавил возможность фильтрации по настраиваемым метаданным. Разработчики могут маркировать файлы по отделу, времени или категории, а при поиске отфильтровывать нерелевантную информацию с помощью заранее заданных условий, что гарантирует более целенаправленные ответы, сгенерированные ИИ.
Кроме того, чтобы учесть опасения относительно отслеживаемости информации, API Gemini теперь поддерживает цитирование на уровне страниц. При генерации ответов ИИ четко указывает конкретный номер страницы для каждого фрагмента информации, а не просто ссылается на весь файл. Такая прозрачность помогает пользователям быстро проверять точность и способствует более глубокому изучению материала.
Улучшенная функция поиска по файлам теперь доступна разработчикам по всему миру. Пользователи могут получить к ней доступ через Google AI Studio или платформу Google Cloud, чтобы оценить удобство разработки и повышение эффективности, которые обеспечивает мультимодальная технология RAG.
Связанная статья
Slackbot становится ИИ-агентом
Slackbot, автоматизированный помощник, встроенный в корпоративную платформу обмена сообщениями Salesforce Slack, превращается в ИИ-агента. Технический директор Salesforce Паркер Харрис предполагает, что он достигнет вирусной популярности, сопоставимо
ByteDance усиливает основные стимулы для ИИ, поскольку Doubao растет на 14,6%
Недавно ByteDance провела краткий брифинг по акциям DouBao, чтобы раскрыть новые стимулирующие политики для сотрудников, участвующих в подразделении DouBao. Цена исполнения для акций DouBao была повышена с $14.85 в июне 2026 года до $17.02, что соста
MiniMax представляет программу Team Program с 10-кратным вознаграждением для стимулирования глобальных экспертов в области ИИ
Компания MiniMax (Xiyu Technology), Лаборатория общего искусственного интеллекта, официально запустила инициативу по глобальному сотрудничеству с талантами «Команда 10x». Эта программа направлена на привлечение ведущих экспертов из различных отраслей
Рекомендации по связанным специальным темам
Комментарии (0)
Компания Google внедрила значительное обновление функции поиска файлов в своем API Gemini, предоставив разработчикам расширенные возможности мультимодального генерации с использованием результатов поиска (RAG). Это обновление выходит за рамки традиционного поиска, ограниченного только текстом, позволяя ИИ интерпретировать изображения и глубоко интегрироваться со сложными документами — это ключевой шаг вперед в обеспечении точности ИИ корпоративного уровня при поиске информации.
С технической точки зрения новая функция поиска файлов использует модель Gemini Embedding2. В отличие от предыдущих систем, ограниченных векторным поиском по тексту, обновленная система отличается унифицированным мультимодальным встраиванием, что позволяет ей распознавать и обрабатывать визуальный контент в PDF-файлах, документах и различных типах изображений. Это означает, что разработчикам больше не нужно создавать сложные векторные базы данных или системы сегментации документов; они могут реализовать полный рабочий процесс RAG — от загрузки данных до поиска информации — непосредственно в рамках API Gemini.

На практике это усовершенствование решает распространенную проблему: традиционные системы RAG часто не справляются с обработкой нетекстового контента. Раньше графики, проектные схемы или скриншоты продуктов в документах были «слепыми зонами» для ИИ, из-за чего упускался важный контекст. Теперь API Gemini изначально распознает эти визуальные элементы. Например, когда компания загружает PDF-файл с техническими архитектурными схемами или графиками тенденций продаж, ИИ может объединять данные графиков с текстовыми описаниями для предоставления точных аналитических выводов, что значительно повышает полезность ботов службы поддержки клиентов и систем анализа документов.
Для улучшения управления обширными базами знаний Google добавил возможность фильтрации по настраиваемым метаданным. Разработчики могут маркировать файлы по отделу, времени или категории, а при поиске отфильтровывать нерелевантную информацию с помощью заранее заданных условий, что гарантирует более целенаправленные ответы, сгенерированные ИИ.
Кроме того, чтобы учесть опасения относительно отслеживаемости информации, API Gemini теперь поддерживает цитирование на уровне страниц. При генерации ответов ИИ четко указывает конкретный номер страницы для каждого фрагмента информации, а не просто ссылается на весь файл. Такая прозрачность помогает пользователям быстро проверять точность и способствует более глубокому изучению материала.
Улучшенная функция поиска по файлам теперь доступна разработчикам по всему миру. Пользователи могут получить к ней доступ через Google AI Studio или платформу Google Cloud, чтобы оценить удобство разработки и повышение эффективности, которые обеспечивает мультимодальная технология RAG.
Slackbot становится ИИ-агентом
Slackbot, автоматизированный помощник, встроенный в корпоративную платформу обмена сообщениями Salesforce Slack, превращается в ИИ-агента. Технический директор Salesforce Паркер Харрис предполагает, что он достигнет вирусной популярности, сопоставимо
ByteDance усиливает основные стимулы для ИИ, поскольку Doubao растет на 14,6%
Недавно ByteDance провела краткий брифинг по акциям DouBao, чтобы раскрыть новые стимулирующие политики для сотрудников, участвующих в подразделении DouBao. Цена исполнения для акций DouBao была повышена с $14.85 в июне 2026 года до $17.02, что соста
MiniMax представляет программу Team Program с 10-кратным вознаграждением для стимулирования глобальных экспертов в области ИИ
Компания MiniMax (Xiyu Technology), Лаборатория общего искусственного интеллекта, официально запустила инициативу по глобальному сотрудничеству с талантами «Команда 10x». Эта программа направлена на привлечение ведущих экспертов из различных отраслей











