AstaBrief 8B, OpenScholar, PaperQA2는 과학 연구용 AI를 고를 때 자주 함께 언급되지만, 실제로는 연구 워크플로의 출발점이 서로 다릅니다. 넓은 범위의 문헌을 검색하고 인용 기반으로 종합하는 기본 선택지는 OpenScholar, 관리된 PDF 모음에서 질문을 반복해서 다루려면 PaperQA2, 검색이 이미 해결된 뒤 빠르게 보고서를 만들려면 AstaBrief 8B가 적합합니다. 모델 크기보다 중요한 것은 바로 이 차이입니다.
세 시스템은 출발점부터 다르다
| 시스템 | 입력의 시작점 | 검색 범위 | 주요 결과물 | 가장 적합한 첫 활용 |
|---|---|---|---|---|
| AstaBrief 8B | 연구 질문과 검색된 발췌문 | 주변의 Asta/ScholarQA 워크플로 또는 직접 구축한 파이프라인이 제공 | 빠르게 생성되는 인용 포함 보고서 | 검색이 끝난 뒤 신속하게 보고서 작성 |
| OpenScholar | 과학 연구 질문 | OpenScholar DataStore, 검색기, 재순위화 모델 및 기타 검색 소스 | 인용을 뒷받침하는 장문 종합 결과 | 넓은 문헌을 검색하고 종합 |
| PaperQA2 | 질문과 문서 디렉터리 또는 코퍼스 | 로컬 인덱싱, 메타데이터 검색, 임베딩, 재순위화, 에이전트 검색 | 인라인 인용이 포함된 근거 기반 답변 | 관리된 문서 모음에 반복적으로 질문 |
내장 코퍼스가 클수록 준비 시간은 늘어나지만 문헌을 발견할 수 있는 범위는 넓어집니다. 반대로 사용자가 직접 제공하는 파일은 검색 범위가 좁아지는 대신 근거를 더 세밀하게 통제할 수 있습니다.
AstaBrief 8B: 검색 이후의 빠른 보고서 생성에 최적화
AstaBrief 8B는 Ai2가 공개한 소형 보고서 생성 모델입니다. 공식 발표에 따르면 이 모델은 독립적인 논문 검색 서비스라기보다 연구 질문과 검색된 문헌 발췌문을 입력으로 받습니다. Apache 2.0 모델 라이선스로 제공되며, 연구자가 보유한 PDF에서 보고서를 생성하는 학습 데이터와 예제 워크플로도 Ai2가 함께 공개했습니다.
Ai2의 측정 결과, 전체 Asta 파이프라인은 Fast 모드에서 평균 51.1초, Thinking 모드에서 178.5초가 걸렸습니다. 해당 비교에서는 약 3.5배 빠른 결과입니다. 다만 이는 파이프라인 전체를 측정한 값이며, 모든 로컬 배포 환경에서 동일한 추론 속도를 보장하는 수치는 아닙니다.
AstaBrief는 검색된 구절, 안정적인 인용 ID, 주장과 근거를 대조하는 검토 단계를 이미 갖춘 파이프라인에 잘 맞습니다. 반대로 OpenScholar의 데이터스토어와 검색 스택을 대체하는 독립형 시스템으로 봐서는 안 됩니다. 필요한 발췌문이 빠져 있다면, 보고서 생성 모델은 애초에 제공되지 않은 논문을 찾아낼 수 없기 때문입니다.
설치와 로컬 배포를 자세히 살펴보려면 AstaBrief 8B 리뷰 및 로컬 배포 가이드를 참고하세요.
OpenScholar: 폭넓은 문헌 종합을 위한 워크플로
OpenScholar는 4,500만 편의 오픈 액세스 논문과 2억 3,600만 개의 구절 임베딩으로 구성된 OpenScholar DataStore를 사용합니다. 여기에 학습된 검색기와 재순위화 모델, 인용 기반 생성, 자기 피드백 루프가 결합됩니다(Nature).
다음과 같은 질문이라면 OpenScholar에서 시작하는 것이 좋습니다.
- “여러 세부 분야를 아울러 보면 기존 문헌은 무엇을 말하는가?”
- “규모가 크고 계속 변하는 연구 분야에서 방법론을 비교해 달라.”
- “종합 글을 쓰기 전에 관련 논문부터 찾아 달라.”
Nature 논문에 따르면 컴퓨터과학 절제 실험에서 통합 검색 설정은 49.6의 정확성과 47.6의 인용 F1을 기록했습니다. 웹 검색만 사용하거나 Semantic Scholar만 사용한 검색보다 높은 수치입니다. 대규모 데이터스토어와 검색기, 재순위화 모델, 피드백 루프를 운영하려면 소형 보고서 모델보다 훨씬 많은 인프라가 필요합니다. 8B 체크포인트만 실행한다고 해서 전체 시스템이 재현되는 것은 아닙니다.
PaperQA2: 통제된 로컬 문서 모음에 가장 잘 맞는 선택
PaperQA2는 문서를 근거로 연구 질문에 답하도록 설계됐습니다. PDF, Markdown, HTML, Office 파일, 소스 코드, 이미지, 표를 파싱하고 후보 구절을 검색한 뒤 문맥 요약을 만들고 근거를 재순위화합니다. 최종 답변에는 인용도 포함됩니다. 로컬 모델과 LiteLLM 호환 제공업체를 지원하지만, 문서에 명시된 기본 설정은 호스팅 모델과 임베딩을 사용합니다.
PaperQA2에서는 디렉터리를 지정해 재사용 가능한 인덱스를 만들고, 모델과 임베딩, 근거 개수, 소스 제한을 조정할 수 있습니다. 저장소 문서에 따르면 기본값은 근거 구절 10개와 최대 답변 소스 5개이며, 고품질 설정에서는 더 많은 근거를 사용하고 비용도 증가합니다.
따라서 PaperQA2는 다음과 같은 경우에 특히 유용합니다.
- 연구실의 비공개 또는 미출판 PDF
- 특정 프로젝트에 맞춘 근거 자료 모음
- 동일한 문서 컬렉션에 반복해서 질문하는 작업
- PDF 그림, 표, 메타데이터 또는 페이지 참조가 필요한 워크플로
대신 제공업체와 설정에 따라 결과가 달라진다는 점은 감안해야 합니다. PaperQA2 자체는 오픈 소스지만 최종 품질과 비용은 선택한 LLM, 임베딩 모델, 파서, 코퍼스, 설정에 좌우됩니다. 공식 저장소도 질문 하나당 고정된 단일 가격을 제시하지 않습니다.
“기본 설정은 OpenAI 모델과 NumPy 벡터 데이터베이스를 사용하지만, 이 패키지는 다른 LLM, 임베딩 모델, 벡터 저장소, 로컬 서버도 지원하도록 설계됐습니다.” — FutureHouse, PaperQA2 문서
같은 연구 과제라도 워크플로는 달라진다
낯선 분야를 폭넓게 탐색한다면: OpenScholar
어떤 논문이 답변에 포함돼야 할지 아직 모를 때는 OpenScholar에서 시작하세요. 대규모 오픈 데이터스토어와 특화된 검색 파이프라인이 여러 논문에서 근거를 찾고 종합하는 데 맞춰져 있습니다.
비공개 프로젝트 라이브러리라면: PaperQA2
근거의 범위를 프로젝트 디렉터리 안으로 제한해야 한다면 PaperQA2를 사용하세요. 논문을 인덱싱하고 소스 집합을 안정적으로 유지한 뒤 근거 구절 수와 최종 소스 수를 조정할 수 있습니다. 검토자는 답변에 실제로 사용된 코퍼스를 직접 확인할 수 있습니다.
검색 후 빠르게 보고서를 만든다면: AstaBrief 8B
검색과 발견을 다른 구성 요소가 담당한 뒤에는 AstaBrief를 사용하세요. 완전한 문헌 검색 시스템을 구축하는 것보다 지연 시간과 로컬 제어, 보고서 처리량이 더 중요할 때 가장 깔끔한 선택입니다.
하이브리드 스택이라면: OpenScholar로 검색하고 AstaBrief로 작성
학술 검색기와 재순위화 모델로 근거를 모은 다음, 선택한 발췌문을 AstaBrief 8B에 전달하고, 공개 전에 별도의 주장-근거 검증을 실행하는 방식입니다. OpenScholar식 탐색과 AstaBrief의 간결한 생성 경로를 결합할 수 있지만, 통합 작업이라는 책임까지 없애 주는 것은 아닙니다.
공개된 벤치마크가 실제로 보여주는 것
OpenScholar 논문의 Nature 버전과 PMC 버전은 PaperQA2와의 동일 벤치마크 비교를 가장 명확하게 보여줍니다. ScholarQABench에서 여러 논문을 대상으로 한 Scholar-CS 루브릭 점수는 OpenScholar-8B가 51.1, PaperQA2가 45.6으로 보고됐습니다. 해당 표에서는 PaperQA2가 인용 F1에서 근소하게 앞섰습니다. OpenScholar-8B의 47.9에 비해 48.0이었습니다. 논문이 추정한 PaperQA2의 비용은 질문당 $0.30–$2.30이며, 논문의 비용 가정에서 OpenScholar-8B는 $0.003입니다.
| 공개된 ScholarQABench 결과 | OpenScholar-8B | PaperQA2 |
|---|---|---|
| Scholar-CS 루브릭 점수 | 51.1 | 45.6 |
| Scholar-CS 인용 F1 | 47.9 | 48.0 |
| 질문당 추정 비용 | $0.003 | $0.30–$2.30 |
이 수치를 모든 상황에 적용되는 순위표로 받아들여서는 안 됩니다. 논문에서는 PaperQA2의 자체 데이터스토어가 공개되지 않았기 때문에 OpenScholar DataStore를 사용해 평가했습니다. 평가에 사용된 모델과 설정도 특정 조건에 해당합니다. 무엇보다 이 비교에는 동일한 ScholarQABench 설정에서 측정한 AstaBrief 8B 결과가 포함되지 않았습니다. AstaBrief의 속도와 품질 수치는 Ai2의 Asta 중심 평가에서 나온 것이므로, 이를 바탕으로 OpenScholar 및 PaperQA2와의 순위를 정할 수는 없습니다.
논문은 PaperQA2의 답변이 높은 인용 정확성을 보였지만, 한두 편의 논문에 의존하는 경우가 많아 여러 논문을 폭넓게 다루거나 구조화하는 능력은 떨어졌다고도 설명합니다. 인용의 정밀도와 문헌의 포괄성은 서로 다른 목표입니다.
선택을 위한 실용적인 기준
| 당면한 제약 | 추천 선택 | 이유 |
|---|---|---|
| 넓은 범위에서 아직 모르는 문헌을 탐색 | OpenScholar | 검색과 종합이 하나의 워크플로에 통합돼 있음 |
| 로컬 폴더 안에 근거 자료를 한정 | PaperQA2 | 코퍼스, 인덱스, 설정을 사용자가 통제할 수 있음 |
| 제공된 근거로 빠르게 보고서 작성 | AstaBrief 8B | 간결한 단일 경로 보고서 생성 |
| 오픈 웨이트 모델을 방화벽 내부에서 실행 | AstaBrief 8B 또는 OpenScholar-8B | 모델 산출물이 공개돼 있음. 다만 주변 스택도 중요함 |
| 알려진 구절을 기준으로 모든 주장을 검토 | PaperQA2 또는 하이브리드 | 로컬 인덱싱과 명시적인 근거 제어가 검토에 유리함 |
| 로컬 추론이 가능한 환경에서 비용 최소화 | OpenScholar-8B; AstaBrief는 별도 테스트 | 공개된 비용 수치를 직접 비교할 수 없음 |
세 시스템 중 무엇을 선택하든 먼저 검색 범위, 인용 근거, 문헌 포괄성, 주장 범위, 코퍼스와 설정의 재현 가능성을 확인해야 합니다.
FAQ
AstaBrief 8B가 OpenScholar를 대체할 수 있나요?
아니요. AstaBrief 8B는 검색된 발췌문을 입력으로 받는 보고서 생성 모델에 가깝습니다. 반면 OpenScholar에는 과학 데이터스토어, 검색, 재순위화, 자기 피드백 워크플로가 포함돼 있습니다. AstaBrief는 생성 계층의 일부를 대체할 수 있지만, 발견과 검색을 담당하는 전체 스택을 자동으로 대체하지는 않습니다.
AstaBrief 8B가 직접 논문을 검색하나요?
공식 설명에서 AstaBrief는 연구 질문과 검색된 문헌 발췌문을 입력으로 받는 모델로 소개됩니다. 검색은 주변의 Asta/ScholarQA 워크플로가 담당하거나, 사용자가 별도의 파이프라인으로 구축해야 합니다.
인용 정확도가 가장 높은 시스템은 무엇인가요?
공개된 ScholarQABench 표에서는 PaperQA2가 OpenScholar-8B보다 인용 F1에서 근소하게 앞섭니다. 각각 48.0과 47.9입니다. 반면 Scholar-CS 루브릭에서는 OpenScholar-8B가 51.1 대 45.6으로 더 높은 점수를 기록했습니다. 해당 비교에는 동일한 벤치마크에서 측정된 AstaBrief 결과가 없습니다.
PaperQA2를 완전히 로컬에서 실행할 수 있나요?
PaperQA2는 로컬 모델 서버, 로컬 임베딩, 로컬 인덱스, 로컬 문서 컬렉션을 지원합니다. 다만 완전한 로컬 배포의 결과는 선택한 파서, 임베딩 모델, LLM 품질, 하드웨어, 설정에 따라 달라집니다.
체계적 문헌 고찰에는 무엇이 가장 적합한가요?
어느 시스템도 등록된 리뷰 프로토콜, 사람의 선별 과정, 인용 검증을 대신해서는 안 됩니다. 문헌 탐색이 목적이라면 OpenScholar가 더 나은 광범위 검색 출발점이고, 미리 정해진 근거 라이브러리를 사용한다면 PaperQA2가 코퍼스를 더 세밀하게 통제할 수 있습니다. AstaBrief는 근거 집합을 구성한 뒤 초안을 작성하는 데 유용합니다.
한 문장으로 정리하면 이렇습니다. 적합한 문헌을 찾는 일이 가장 어렵다면 OpenScholar, 이미 정해진 코퍼스를 통제하는 일이 가장 어렵다면 PaperQA2, 검색이 해결됐고 보고서 생성 지연 시간이 병목이라면 AstaBrief 8B를 선택하세요.