AstaBrief 8B, OpenScholar и PaperQA2 часто оказываются в одном списке инструментов для работы с научной литературой, хотя решают разные задачи и подключаются на разных этапах исследования. OpenScholar — лучший универсальный вариант для широкого синтеза литературы с опорой на цитаты; PaperQA2 удобнее для работы с контролируемой коллекцией PDF; AstaBrief 8B — быстрый генератор отчётов, который стоит подключать уже после того, как поиск источников налажен. Это различие важнее, чем цифра в названии модели.
Три системы — три точки старта
| Система | На входе | Охват поиска | Основной результат | Лучший первый сценарий |
|---|---|---|---|---|
| AstaBrief 8B | Исследовательский вопрос и найденные фрагменты | Определяется окружающим процессом Asta/ScholarQA или вашим собственным пайплайном | Быстрый отчёт с цитатами | Быстро подготовить отчёт после поиска источников |
| OpenScholar | Научный вопрос | OpenScholar DataStore, ретриверы, ранжировщики и другие источники поиска | Развёрнутый синтез с цитатами | Искать и обобщать материалы по широкой теме |
| PaperQA2 | Вопрос и каталог документов или корпус | Локальная индексация, поиск по метаданным, эмбеддинги, переранжирование и агентный поиск | Ответ на основе источников с inline-цитатами | Регулярно задавать вопросы по контролируемой коллекции документов |
Большой встроенный корпус расширяет поиск, но требует больше времени на подготовку. Собственные файлы дают меньше охвата, зато позволяют лучше контролировать доказательную базу.
AstaBrief 8B: быстрый генератор отчётов после поиска
AstaBrief 8B — компактная модель для подготовки отчётов, выпущенная Ai2. В официальном анонсе говорится, что на вход она получает исследовательский вопрос и найденные фрагменты научной литературы, а не самостоятельно ищет статьи. Модель распространяется по лицензии Apache 2.0; вместе с ней Ai2 опубликовала обучающие данные и пример рабочего процесса для подготовки отчётов по PDF-файлам исследователей.
По данным Ai2, полный пайплайн Asta в режиме Fast в среднем занимал 51.1 секунды, тогда как в режиме Thinking — 178.5 секунды, то есть в приведённом сравнении был примерно в 3.5 раза быстрее. Это показатель всего пайплайна, а не универсальная гарантия скорости инференса для любого локального развёртывания.
AstaBrief хорошо вписывается в пайплайны, где уже есть найденные фрагменты, стабильные идентификаторы цитат и отдельный этап проверки соответствия утверждений источникам. Но рассматривать модель как самостоятельную замену хранилищу и поисковому стеку OpenScholar не стоит: если нужные фрагменты не были переданы на вход, генератор не сможет восстановить отсутствующие статьи.
Подробнее об установке и локальном запуске читайте в нашем обзоре AstaBrief 8B и руководстве по локальному развёртыванию.
OpenScholar: рабочий процесс для широкого синтеза литературы
OpenScholar использует OpenScholar DataStore — корпус из 45 миллионов статей в открытом доступе и 236 миллионов эмбеддингов фрагментов. В систему также входят обученные ретриверы, переранжировщики, генерация с опорой на цитаты и цикл самопроверки (Nature).
OpenScholar стоит выбрать в первую очередь, если вопрос звучит примерно так:
- «Что говорит литература на стыке нескольких научных направлений?»
- «Сравнить методы в большой и быстро меняющейся исследовательской области».
- «Сначала найти релевантные статьи, а уже потом писать синтез».
В статье Nature указано, что комбинированная конфигурация поиска в абляционном исследовании по компьютерным наукам достигла 49.6 по корректности и 47.6 по citation F1, превзойдя поиск только в интернете и поиск только через Semantic Scholar. Большое хранилище, ретривер, переранжировщик и цикл обратной связи требуют заметно больше инфраструктуры, чем небольшая модель для написания отчётов; простой запуск чекпойнта 8B без этих компонентов не воспроизводит полноценную систему.
PaperQA2: оптимальный вариант для собственной коллекции документов
PaperQA2 изначально построен вокруг поиска ответов по документам. Он умеет разбирать PDF, Markdown, HTML, файлы Office, исходный код, изображения и таблицы; находить подходящие фрагменты; создавать контекстные выжимки; переранжировать доказательства и формировать ответ с цитатами. Пакет поддерживает локальные модели и провайдеров, совместимых с LiteLLM, хотя в документации настройками по умолчанию предусмотрены внешние модели и эмбеддинги.
В PaperQA2 можно указать каталог с файлами, создать переиспользуемый индекс и отдельно настроить модель, эмбеддинги, количество доказательств и лимит источников. В репозитории указаны значения по умолчанию: 10 фрагментов доказательств и максимум 5 источников в ответе. Режим высокого качества использует больше доказательств и обходится дороже.
Поэтому PaperQA2 особенно удобен для таких задач:
- Закрытые или ещё не опубликованные PDF-файлы лаборатории.
- Подборка источников под конкретный проект.
- Повторяющиеся вопросы по одной и той же коллекции документов.
- Сценарии, где важны рисунки, таблицы, метаданные или номера страниц в PDF.
Обратная сторона — зависимость от провайдера и настроек. PaperQA2 распространяется с открытым исходным кодом, но итоговые качество и стоимость определяются выбранной LLM, моделью эмбеддингов, парсером, корпусом и конфигурацией. Официальный репозиторий не обещает единую фиксированную цену за вопрос.
«В конфигурации по умолчанию используются модели OpenAI и векторная база данных NumPy, однако пакет рассчитан на поддержку альтернативных LLM, моделей эмбеддингов, векторных хранилищ и локальных серверов». — FutureHouse, документация PaperQA2
Одна исследовательская задача — разные рабочие процессы
Для поиска по незнакомой области: выбирайте OpenScholar
Начинайте с OpenScholar, если вы ещё не знаете, какие статьи должны войти в ответ. Большое открытое хранилище и специализированный поисковый пайплайн системы рассчитаны на поиск и синтез доказательств по множеству публикаций.
Для закрытой библиотеки проекта: выбирайте PaperQA2
PaperQA2 подходит, когда границы доказательной базы задаёт каталог проекта. Проиндексируйте статьи, зафиксируйте набор источников и настройте количество фрагментов доказательств и итоговых источников. Проверяющий сможет посмотреть, на каком именно корпусе построен ответ.
Для быстрого отчёта после поиска: выбирайте AstaBrief 8B
Подключайте AstaBrief после того, как другой компонент уже выполнил поиск. Это наиболее понятный выбор, когда важнее задержка, локальный контроль или скорость подготовки отчётов, а не построение полноценной системы поиска литературы.
Для гибридного стека: ищите через OpenScholar, пишите через AstaBrief
Соберите доказательства с помощью научного ретривера и переранжировщика, передайте выбранные фрагменты в AstaBrief 8B, а перед публикацией отдельно проверьте соответствие утверждений источникам. Такой подход сочетает поиск в стиле OpenScholar с компактным генератором AstaBrief, но добавляет задачу интеграции — ни один компонент не снимает её полностью.
Что на самом деле доказывают опубликованные бенчмарки
Версии статьи OpenScholar на сайтах Nature и PMC дают наиболее ясное сравнение с PaperQA2 на одном и том же бенчмарке. В ScholarQABench опубликованный результат по многодокументной метрике Scholar-CS rubric составил 51.1 для OpenScholar-8B и 45.6 для PaperQA2. При этом в той же таблице PaperQA2 получил небольшое преимущество по citation F1: 48.0 против 47.9 у OpenScholar-8B. В статье оценочная стоимость одного вопроса для PaperQA2 указана как $0.30–$2.30, а для OpenScholar-8B — $0.003 при предположениях, использованных авторами.
| Опубликованный результат ScholarQABench | OpenScholar-8B | PaperQA2 |
|---|---|---|
| Оценка Scholar-CS rubric | 51.1 | 45.6 |
| Scholar-CS citation F1 | 47.9 | 48.0 |
| Расчётная стоимость одного вопроса | $0.003 | $0.30–$2.30 |
Эти показатели не образуют универсальный рейтинг. Авторы тестировали PaperQA2 на OpenScholar DataStore, поскольку собственное хранилище PaperQA2 не было опубликовано. Кроме того, в эксперименте использовались конкретные модель и конфигурация. И главное: опубликованное сравнение не включает AstaBrief 8B в том же окружении ScholarQABench. Приведённые для AstaBrief показатели скорости и качества получены в оценках Ai2, посвящённых Asta, поэтому по ним нельзя установить место модели относительно OpenScholar и PaperQA2.
Авторы также отмечают, что ответы PaperQA2 отличались высокой точностью цитирования, но часто опирались всего на одну или несколько статей. Это снижало полноту охвата и качество организации материала по нескольким публикациям. Точность цитат и полнота литературного обзора — разные цели.
Простое правило выбора
| Ваше ограничение | Рекомендуемый выбор | Почему |
|---|---|---|
| Найти неизвестную литературу в широком масштабе | OpenScholar | Поиск и синтез объединены в одном процессе |
| Ограничить доказательную базу локальным каталогом | PaperQA2 | Корпус, индекс и настройки контролирует пользователь |
| Быстро подготовить отчёт по переданным источникам | AstaBrief 8B | Компактная генерация отчёта за один проход |
| Работать за межсетевым экраном с открытыми весами | AstaBrief 8B или OpenScholar-8B | Открытые артефакты моделей; окружающий стек по-прежнему имеет значение |
| Проверять каждое утверждение по известному фрагменту | PaperQA2 или гибрид | Локальная индексация и явный контроль доказательств упрощают проверку |
| Снизить расходы, если локальный инференс возможен | OpenScholar-8B; AstaBrief тестировать отдельно | Опубликованные показатели стоимости нельзя напрямую сопоставлять |
Прежде чем доверять любой из трёх систем, проверьте границы поиска, подтверждение цитатами, полноту охвата литературы, масштаб утверждений, а также воспроизводимость корпуса и настроек.
FAQ
Может ли AstaBrief 8B заменить OpenScholar?
Нет. AstaBrief 8B — прежде всего модель для подготовки отчётов, которая получает найденные фрагменты, тогда как OpenScholar включает научное хранилище, поиск, переранжирование и цикл самопроверки. AstaBrief может заменить часть генеративного слоя, но не весь поисковый стек автоматически.
Умеет ли AstaBrief 8B самостоятельно искать статьи?
В официальном описании AstaBrief модель получает исследовательский вопрос и найденные фрагменты литературы. Поиск выполняется окружающим процессом Asta/ScholarQA или отдельным пайплайном, который вы собираете самостоятельно.
У какой системы лучше точность цитирования?
В опубликованной таблице ScholarQABench у PaperQA2 небольшое преимущество над OpenScholar-8B по citation F1: 48.0 против 47.9. При этом OpenScholar-8B получил более высокий результат по Scholar-CS rubric — 51.1 против 45.6. Результата AstaBrief на том же бенчмарке в этом сравнении нет.
Можно ли полностью развернуть PaperQA2 локально?
PaperQA2 поддерживает локальные серверы моделей, локальные эмбеддинги, локальные индексы и локальные коллекции документов. Полностью локальное развёртывание всё равно зависит от выбранных парсера, модели эмбеддингов, качества LLM, оборудования и конфигурации.
Что лучше выбрать для систематического обзора?
Ни одна из этих систем не заменяет зарегистрированный протокол обзора, ручной отбор и проверку цитат. Для поиска OpenScholar лучше подходит как инструмент широкого охвата; для заранее заданной библиотеки источников PaperQA2 даёт более строгий контроль корпуса; AstaBrief полезен для подготовки черновика после формирования доказательной базы.
Если свести решение к одной строке: выбирайте OpenScholar, когда сложнее всего найти правильную литературу, PaperQA2 — когда важнее всего контролировать известный корпус, а AstaBrief 8B — когда поиск уже решён и узким местом стала скорость подготовки отчёта.