На FinanceBench — это 368 отчётностей SEC общим объёмом около 53 900 страниц и 150 вопросов — новый слой Mistral Agentic Search, по данным Mistral, повысил точность ответов на 47–53 процентных пункта относительно однопроходного RAG при цикле только с поиском. Полный цикл с навигацией дал прирост до 59 пунктов и сократил расход токенов почти на треть. Обратная сторона заметна сразу: p90 для полного цикла составляет 154 секунды, средняя задержка — 71 секунду.
Mistral Agentic Search, анонсированный 20 августа 2026 года, — это поисковый слой для сложных корпоративных массивов: отчётностей, договоров и сканированных PDF. Он не улучшает поиск в интернете: инструмент работает с вашим индексом. А точность здесь покупается временем — цикл может занимать минуты.
Как устроен Mistral Agentic Search
Mistral Agentic Search вышел 20 августа 2026 года. Слой оборачивает существующий индекс в многошаговый цикл из пяти инструментов: search, open, navigate, read и grep. Он доступен через Mistral Search Toolkit и встроен в Libraries в Studio и Vibe. Индекс остаётся вашим, дообучение не требуется: агентный цикл берёт на себя вопросы, с которыми один лишь поиск по чанкам не справляется.
Пять инструментов: от поиска до чтения таблицы
Работу механизма хорошо показывает пример самого Mistral — расходы США на национальную оборону за календарный 1953 год. Один вызов поиска нашёл данные только за январь—июнь, упустив вторую половину года. Агентный сценарий сделал два поиска, обнаружил treasury_bulletin_1954_02.pdf, затем прочитал страницу 15, таблицу 3 и вернул все двенадцать месячных значений. Итог за год — 44 463 миллиона долларов.
| Инструмент | Назначение |
|---|---|
search | Ищет в индексе наиболее вероятные источники |
open | Открывает найденный документ |
navigate | Переходит к нужным страницам, таблицам или разделам |
read | Извлекает содержимое из выбранного места |
grep | Ищет точные токены, коды и идентификаторы по шаблону |
Однопроходный RAG получает фиксированный набор чанков и должен ответить с первой попытки: запросить ещё один документ после неудачной выдачи он не может. Цикл способен сопоставлять источники, идти по ссылкам в сноски и таблицы, а также исправляться после неполных результатов. По утверждению Mistral, выгода здесь не в дополнительных попытках и диалогах, а в их сокращении.
Что на самом деле показывают бенчмарки
В анонсе приведены две серии тестов. Обе заявлены самим поставщиком и запускались с настройками Search Toolkit по умолчанию, без тюнинга. Формулировка Mistral: «эти результаты — не потолок, а нижняя граница». FinanceBench (Islam et al., 2023; открытый набор доступен на GitHub) включает 368 отчётов SEC форматов 10-K, 10-Q и 8-K — в среднем около 147 страниц каждый по подсчётам Mistral — и 150 вопросов. В конфигурации Mistral ответы оценивает LLM, откалиброванная по человеческим разметкам.
Добавление инструментов навигации — open, navigate, read и grep — к циклу только с поиском дало ещё +8,7 п. п. для Mistral Medium 3.5 и +6,7 п. п. для GLM-5.2. По сравнению с поисковым агентным циклом полный вариант использовал на 23,9% меньше токенов с Mistral Medium 3.5 и на 33,7% меньше с GLM-5.2. Задержка также снизилась: p90 — с 255 до 154 секунд, среднее значение — со 108 до 71 секунды. Важно, что сокращение токенов измеряется относительно агентного цикла только с поиском, а не однопроходного RAG.
OfficeQA Pro — более сложный набор: 696 исторических бюллетеней Казначейства США, около 89 000 страниц сканированных государственных PDF с большим количеством таблиц и 133 вопроса. С полным циклом GLM-5.2 достиг 51,9% точности — рост на 45,6 п. п., что подразумевает базовый результат однопроходного режима в 6,3%. Mistral Medium 3.5 прибавил 27,1 п. п. Навигация также сократила число шагов до 7,0%.
Mistral тестировала собственную Mistral Medium 3.5 и стороннюю Z.ai GLM-5.2; обе модели показали одинаковую динамику улучшений. В анонсе также упомянуто исследование Kimi: в нём GLM-5.2 получила 41,4% на OfficeQA Pro в обвязке Claude Code против 51,9% в обвязке Mistral. Первичный источник Kimi не указан, поэтому разрыв в 10,5 п. п. — это характеристика Mistral. Вывод компании — «качество поиска масштабируется вместе с возможностями модели» — сводится к тому, что ограничением выступает обвязка, а не модель.
Когда однопроходный RAG всё ещё лучше
Сама Mistral подчёркивает: поиск по индексу остаётся фундаментом, а агентный цикл нужен, когда начальной выдачи недостаточно. Выбор в основном определяется структурой документов и допустимой задержкой:
| Тип задачи | С чего начать |
|---|---|
| Прямые запросы к коротким и чисто оформленным документам | Однопроходный RAG |
| Высоконагруженный поиск по ключевым словам или семантике | Однопроходный RAG |
| Ответы находятся в заранее известных местах | Однопроходный RAG |
| Отчётности, договоры и руководства с таблицами и сносками | Agentic Search |
| Сканированные PDF с множеством таблиц | Agentic Search |
| Ответы разбросаны по нескольким документам и требуют сверки | Agentic Search |
| Интерактивный продукт с задержкой в секунды | Однопроходный RAG |
Если p90 в 154 секунды ломает пользовательский сценарий, рост точности этого не исправит. Для пакетного анализа финансовой отчётности картина уже другая.
Agentic Search — не инструмент web_search
При поиске продукта Google выводит документацию Mistral по websearch, но это другой инструмент. web_search и web_search_premium относятся к Agents API, ищут в живом интернете и добавляют цитаты. На странице API-тарифов Mistral они стоят соответственно $30 и $50 за 1 000 вызовов, не считая токенов модели. Agentic Search работает в противоположном направлении: он углубляется в ваш индексированный корпус и не обращается к открытому вебу. Это решения для разных задач, и опубликованные цены есть лишь у одного из них: тарифов на Agentic Search в анонсе нет.
С чего начать работу
- Search Toolkit. Открытые модули для загрузки данных, эмбеддингов и индексации. Их можно разворачивать в облаке или локальной инфраструктуре; доступны настройка парсеров, разбиения на чанки, моделей эмбеддингов, схем Vespa, профилей ранжирования и гибридного поиска.
- Libraries в Studio и Vibe. Управляемый вариант. Search Starter App создаёт локальный индекс по вашему корпусу с конфигурацией по умолчанию — это самый быстрый способ воспроизвести бенчмарк-конфигурацию, прежде чем что-либо настраивать.
Какой бы путь вы ни выбрали, сначала прогоните одинаковый набор репрезентативных вопросов через однопроходный RAG и полный цикл. Сравните качество ответов, расход токенов и p90 задержки — и только потом принимайте решение.
Что пока остаётся неизвестным
Mistral не опубликовала цены на Agentic Search, а результаты бенчмарков заявлены самим вендором. На момент запуска независимых практических повторений тестов не было. Первые публичные отзывы сводятся к впечатлениям:
«mistral just added agentic search to their api is the right move. wrapping perplexity-style search into a native agent tool saves us from writing fragile web-scraping pipelines and managing proxy rotation ourselves.» — @AbdoKerdawy, AI product developer (X)
Заявления об экономии токенов уже вызвали вопросы, на которые анонс Mistral отвечает не до конца:
«The Mistral agentic search retrieval tool claims to cut single-pass search failures by over 40%. If it bypasses database lookups, will it reduce the number of tokens you need to spend?» — @therawlogs, independent blogger (X)
Официальный ответ — сокращение расхода токенов на 24–34% относительно цикла только с поиском. Насколько этот результат сохранится за пределами бенчмарк-корпусов, покажет независимый запуск на открытом наборе FinanceBench.
У соседних продуктов те же ограничения: агентный режим поиска Toast-1 от Mixedbread ограничивает цикл четырьмя раундами и восемью параллельными поисковыми вызовами. В документации прямо сказано, что он медленнее одиночного поиска. В этой категории задержка — плата за точность, которую берут все поставщики.
Короткие ответы
Доступен ли Mistral Agentic Search через Agents API?
Нет. Он поставляется через Mistral Search Toolkit и Libraries в Studio и Vibe. Инструмент web_search в Agents API — отдельный продукт для поиска в живом вебе с собственной тарификацией.
Agentic Search действительно сокращает расход токенов?
Согласно официальным бенчмаркам, полный цикл с навигацией на FinanceBench использовал на 23,9–33,7% меньше токенов, чем поисковый агентный цикл. Независимых повторений результата пока не опубликовано.
Какие модели работают с Agentic Search?
Mistral протестировала Mistral Medium 3.5 и Z.ai GLM-5.2, получив стабильный прирост в обоих случаях. Слой заявлен как независимый от модели и не требующий дообучения.
Сколько стоит Mistral Agentic Search?
Цены на сам Agentic Search не опубликованы. Указанные на странице тарифов Mistral $30 за 1 000 вызовов относятся к старому агентному инструменту web_search.
Главный компромисс здесь предельно ясен: точность покупается минутами ожидания. Для пакетной работы с отчётностями, договорами и сканированными государственными документами прирост точности на +45–59 п. п. — для OfficeQA Pro и FinanceBench с полным циклом соответственно — и сокращение токенов почти на треть относительно более медленного цикла выглядят разумной сделкой. Но для пользовательских сценариев средняя задержка в 71 секунду пока неприемлема. И пока FinanceBench не перезапустит кто-то за пределами Mistral, самые впечатляющие цифры на этой странице остаются цифрами самого вендора.
Читайте также: в гайде по GLM-5.2 API и обзоре GLM-5.2 разобрана вторая модель, использованная в тестах Mistral.