AIREITER

Mistral Agentic Search: что это такое и что говорят цифры

Последнее обновление: 2026-08-20 19:01:29

На FinanceBench — это 368 отчётностей SEC общим объёмом около 53 900 страниц и 150 вопросов — новый слой Mistral Agentic Search, по данным Mistral, повысил точность ответов на 47–53 процентных пункта относительно однопроходного RAG при цикле только с поиском. Полный цикл с навигацией дал прирост до 59 пунктов и сократил расход токенов почти на треть. Обратная сторона заметна сразу: p90 для полного цикла составляет 154 секунды, средняя задержка — 71 секунду.

Mistral Agentic Search, анонсированный 20 августа 2026 года, — это поисковый слой для сложных корпоративных массивов: отчётностей, договоров и сканированных PDF. Он не улучшает поиск в интернете: инструмент работает с вашим индексом. А точность здесь покупается временем — цикл может занимать минуты.

Официальная страница анонса Mistral Agentic Search

Как устроен Mistral Agentic Search

Mistral Agentic Search вышел 20 августа 2026 года. Слой оборачивает существующий индекс в многошаговый цикл из пяти инструментов: search, open, navigate, read и grep. Он доступен через Mistral Search Toolkit и встроен в Libraries в Studio и Vibe. Индекс остаётся вашим, дообучение не требуется: агентный цикл берёт на себя вопросы, с которыми один лишь поиск по чанкам не справляется.

Пять инструментов: от поиска до чтения таблицы

Работу механизма хорошо показывает пример самого Mistral — расходы США на национальную оборону за календарный 1953 год. Один вызов поиска нашёл данные только за январь—июнь, упустив вторую половину года. Агентный сценарий сделал два поиска, обнаружил treasury_bulletin_1954_02.pdf, затем прочитал страницу 15, таблицу 3 и вернул все двенадцать месячных значений. Итог за год — 44 463 миллиона долларов.

ИнструментНазначение
searchИщет в индексе наиболее вероятные источники
openОткрывает найденный документ
navigateПереходит к нужным страницам, таблицам или разделам
readИзвлекает содержимое из выбранного места
grepИщет точные токены, коды и идентификаторы по шаблону

Однопроходный RAG получает фиксированный набор чанков и должен ответить с первой попытки: запросить ещё один документ после неудачной выдачи он не может. Цикл способен сопоставлять источники, идти по ссылкам в сноски и таблицы, а также исправляться после неполных результатов. По утверждению Mistral, выгода здесь не в дополнительных попытках и диалогах, а в их сокращении.

Что на самом деле показывают бенчмарки

В анонсе приведены две серии тестов. Обе заявлены самим поставщиком и запускались с настройками Search Toolkit по умолчанию, без тюнинга. Формулировка Mistral: «эти результаты — не потолок, а нижняя граница». FinanceBench (Islam et al., 2023; открытый набор доступен на GitHub) включает 368 отчётов SEC форматов 10-K, 10-Q и 8-K — в среднем около 147 страниц каждый по подсчётам Mistral — и 150 вопросов. В конфигурации Mistral ответы оценивает LLM, откалиброванная по человеческим разметкам.

Прирост точности Mistral Agentic Search на FinanceBench относительно однопроходного RAG

Добавление инструментов навигации — open, navigate, read и grep — к циклу только с поиском дало ещё +8,7 п. п. для Mistral Medium 3.5 и +6,7 п. п. для GLM-5.2. По сравнению с поисковым агентным циклом полный вариант использовал на 23,9% меньше токенов с Mistral Medium 3.5 и на 33,7% меньше с GLM-5.2. Задержка также снизилась: p90 — с 255 до 154 секунд, среднее значение — со 108 до 71 секунды. Важно, что сокращение токенов измеряется относительно агентного цикла только с поиском, а не однопроходного RAG.

Сравнение задержек цикла только с поиском и полного цикла с навигацией на FinanceBench

OfficeQA Pro — более сложный набор: 696 исторических бюллетеней Казначейства США, около 89 000 страниц сканированных государственных PDF с большим количеством таблиц и 133 вопроса. С полным циклом GLM-5.2 достиг 51,9% точности — рост на 45,6 п. п., что подразумевает базовый результат однопроходного режима в 6,3%. Mistral Medium 3.5 прибавил 27,1 п. п. Навигация также сократила число шагов до 7,0%.

Mistral тестировала собственную Mistral Medium 3.5 и стороннюю Z.ai GLM-5.2; обе модели показали одинаковую динамику улучшений. В анонсе также упомянуто исследование Kimi: в нём GLM-5.2 получила 41,4% на OfficeQA Pro в обвязке Claude Code против 51,9% в обвязке Mistral. Первичный источник Kimi не указан, поэтому разрыв в 10,5 п. п. — это характеристика Mistral. Вывод компании — «качество поиска масштабируется вместе с возможностями модели» — сводится к тому, что ограничением выступает обвязка, а не модель.

Когда однопроходный RAG всё ещё лучше

Сама Mistral подчёркивает: поиск по индексу остаётся фундаментом, а агентный цикл нужен, когда начальной выдачи недостаточно. Выбор в основном определяется структурой документов и допустимой задержкой:

Тип задачиС чего начать
Прямые запросы к коротким и чисто оформленным документамОднопроходный RAG
Высоконагруженный поиск по ключевым словам или семантикеОднопроходный RAG
Ответы находятся в заранее известных местахОднопроходный RAG
Отчётности, договоры и руководства с таблицами и сноскамиAgentic Search
Сканированные PDF с множеством таблицAgentic Search
Ответы разбросаны по нескольким документам и требуют сверкиAgentic Search
Интерактивный продукт с задержкой в секундыОднопроходный RAG

Если p90 в 154 секунды ломает пользовательский сценарий, рост точности этого не исправит. Для пакетного анализа финансовой отчётности картина уже другая.

Agentic Search — не инструмент web_search

При поиске продукта Google выводит документацию Mistral по websearch, но это другой инструмент. web_search и web_search_premium относятся к Agents API, ищут в живом интернете и добавляют цитаты. На странице API-тарифов Mistral они стоят соответственно $30 и $50 за 1 000 вызовов, не считая токенов модели. Agentic Search работает в противоположном направлении: он углубляется в ваш индексированный корпус и не обращается к открытому вебу. Это решения для разных задач, и опубликованные цены есть лишь у одного из них: тарифов на Agentic Search в анонсе нет.

С чего начать работу

  1. Search Toolkit. Открытые модули для загрузки данных, эмбеддингов и индексации. Их можно разворачивать в облаке или локальной инфраструктуре; доступны настройка парсеров, разбиения на чанки, моделей эмбеддингов, схем Vespa, профилей ранжирования и гибридного поиска.
  2. Libraries в Studio и Vibe. Управляемый вариант. Search Starter App создаёт локальный индекс по вашему корпусу с конфигурацией по умолчанию — это самый быстрый способ воспроизвести бенчмарк-конфигурацию, прежде чем что-либо настраивать.

Какой бы путь вы ни выбрали, сначала прогоните одинаковый набор репрезентативных вопросов через однопроходный RAG и полный цикл. Сравните качество ответов, расход токенов и p90 задержки — и только потом принимайте решение.

Что пока остаётся неизвестным

Mistral не опубликовала цены на Agentic Search, а результаты бенчмарков заявлены самим вендором. На момент запуска независимых практических повторений тестов не было. Первые публичные отзывы сводятся к впечатлениям:

«mistral just added agentic search to their api is the right move. wrapping perplexity-style search into a native agent tool saves us from writing fragile web-scraping pipelines and managing proxy rotation ourselves.» — @AbdoKerdawy, AI product developer (X)

Заявления об экономии токенов уже вызвали вопросы, на которые анонс Mistral отвечает не до конца:

«The Mistral agentic search retrieval tool claims to cut single-pass search failures by over 40%. If it bypasses database lookups, will it reduce the number of tokens you need to spend?» — @therawlogs, independent blogger (X)

Официальный ответ — сокращение расхода токенов на 24–34% относительно цикла только с поиском. Насколько этот результат сохранится за пределами бенчмарк-корпусов, покажет независимый запуск на открытом наборе FinanceBench.

У соседних продуктов те же ограничения: агентный режим поиска Toast-1 от Mixedbread ограничивает цикл четырьмя раундами и восемью параллельными поисковыми вызовами. В документации прямо сказано, что он медленнее одиночного поиска. В этой категории задержка — плата за точность, которую берут все поставщики.

Короткие ответы

Доступен ли Mistral Agentic Search через Agents API?

Нет. Он поставляется через Mistral Search Toolkit и Libraries в Studio и Vibe. Инструмент web_search в Agents API — отдельный продукт для поиска в живом вебе с собственной тарификацией.

Agentic Search действительно сокращает расход токенов?

Согласно официальным бенчмаркам, полный цикл с навигацией на FinanceBench использовал на 23,9–33,7% меньше токенов, чем поисковый агентный цикл. Независимых повторений результата пока не опубликовано.

Какие модели работают с Agentic Search?

Mistral протестировала Mistral Medium 3.5 и Z.ai GLM-5.2, получив стабильный прирост в обоих случаях. Слой заявлен как независимый от модели и не требующий дообучения.

Сколько стоит Mistral Agentic Search?

Цены на сам Agentic Search не опубликованы. Указанные на странице тарифов Mistral $30 за 1 000 вызовов относятся к старому агентному инструменту web_search.

Главный компромисс здесь предельно ясен: точность покупается минутами ожидания. Для пакетной работы с отчётностями, договорами и сканированными государственными документами прирост точности на +45–59 п. п. — для OfficeQA Pro и FinanceBench с полным циклом соответственно — и сокращение токенов почти на треть относительно более медленного цикла выглядят разумной сделкой. Но для пользовательских сценариев средняя задержка в 71 секунду пока неприемлема. И пока FinanceBench не перезапустит кто-то за пределами Mistral, самые впечатляющие цифры на этой странице остаются цифрами самого вендора.

Читайте также: в гайде по GLM-5.2 API и обзоре GLM-5.2 разобрана вторая модель, использованная в тестах Mistral.