AstaBrief 8B, OpenScholar und PaperQA2 landen oft auf derselben Shortlist für wissenschaftliche KI-Tools. Im Forschungsprozess setzen sie aber an ganz unterschiedlichen Stellen an. OpenScholar ist die stärkste Standardwahl für breit angelegte, zitiergestützte Literatur-Synthesen. PaperQA2 eignet sich besser für einen kontrollierten Bestand an PDFs. AstaBrief 8B ist der auf Geschwindigkeit optimierte Report-Generator, den man einsetzt, sobald die Recherche bereits funktioniert. Dieser Unterschied ist wichtiger als die jeweilige Modellgröße.
Drei Systeme, drei Ausgangspunkte
| System | Startpunkt | Reichweite der Recherche | Hauptergebnis | Beste erste Anwendung |
|---|---|---|---|---|
| AstaBrief 8B | Eine Forschungsfrage plus recherchierte Auszüge | Wird vom umgebenden Asta/ScholarQA-Workflow oder der eigenen Pipeline bereitgestellt | Ein schneller Bericht mit Quellenangaben | Schnell einen Bericht erzeugen, sobald die Recherche erledigt ist |
| OpenScholar | Eine wissenschaftliche Fragestellung | OpenScholar DataStore, Retriever, Reranker und weitere Recherchequellen | Eine ausführliche, zitiergestützte Synthese | Breit recherchieren und Literatur zusammenführen |
| PaperQA2 | Eine Frage plus ein Dokumentenverzeichnis oder ein Korpus | Lokale Indizierung, Metadatensuche, Embeddings, Reranking und agentische Suche | Eine evidenzbasierte Antwort mit Inline-Zitaten | Wiederholbare Fragen über einen kontrollierten Dokumentenbestand stellen |
Größere integrierte Korpora kosten mehr Vorbereitungszeit, bieten dafür aber eine breitere Recherche. Eigene Dateien schränken die Reichweite ein, geben dafür mehr Kontrolle über die verwendete Evidenz.
AstaBrief 8B: schnelle Berichte, wenn die Recherche schon steht
AstaBrief 8B ist ein kompaktes Modell zur Berichtserstellung von Ai2. Die offizielle Ankündigung beschreibt als Eingabe eine Forschungsfrage und recherchierte Literaturauszüge – nicht etwa einen eigenständigen Dienst für die Papersuche. Das Modell steht unter einer Apache-2.0-Modelllizenz zur Verfügung. Ai2 hat außerdem Trainingsdaten und einen Beispiel-Workflow veröffentlicht, mit dem sich Berichte aus den eigenen PDFs erzeugen lassen.
Laut Ai2 benötigte die vollständige Asta-Pipeline im Fast-Modus durchschnittlich 51.1 Sekunden. Im Thinking-Modus waren es 178.5 Sekunden, also in diesem Vergleich etwa 3.5× schneller. Dabei handelt es sich um einen Messwert für die Pipeline – nicht um ein allgemeingültiges Versprechen zur Inferenzgeschwindigkeit jeder lokalen Bereitstellung.
AstaBrief passt zu Pipelines, die bereits relevante Passagen, stabile Zitat-IDs und einen Prüfschritt zur Zuordnung von Aussagen und Belegen liefern. Als eigenständiger Ersatz für OpenScholars Datastore- und Retrieval-Stack sollte man das Modell nicht verstehen: Fehlen wichtige Auszüge, kann der Report-Generator keine Papers berücksichtigen, die ihm nie übergeben wurden.
Eine ausführlichere Betrachtung der Installation und des lokalen Betriebs gibt es in unserem Test von AstaBrief 8B mit Anleitung zur lokalen Bereitstellung.
OpenScholar: Literatur über große Themenfelder hinweg synthetisieren
OpenScholar nutzt den OpenScholar DataStore mit 45 Millionen Open-Access-Papers und 236 Millionen Passage-Embeddings. Hinzu kommen trainierte Retriever, Reranker, die zitiergestützte Generierung und eine Feedbackschleife (Nature).
OpenScholar ist der beste Ausgangspunkt für Fragen wie:
- „Was sagt die Literatur über mehrere Teilgebiete hinweg?“
- „Wie lassen sich Methoden in einem großen und dynamischen Forschungsfeld vergleichen?“
- „Welche relevanten Papers gibt es, bevor ich die Synthese schreibe?“
Im Nature-Paper erreichte die kombinierte Retrieval-Konfiguration in der Informatik-Ablation 49.6 correctness und 47.6 citation F1. Damit lag sie vor der Recherche ausschließlich über das Web oder ausschließlich über Semantic Scholar. Ein großer Datastore mit Retriever, Reranker und Feedbackschleife benötigt allerdings deutlich mehr Infrastruktur als ein kleines Report-Modell. Wer lediglich einen 8B-Checkpoint ausführt, erhält deshalb nicht automatisch das vollständige System.
PaperQA2: die passende Wahl für einen kontrollierten lokalen Dokumentenbestand
PaperQA2 ist konsequent auf dokumentengestützte Recherche ausgelegt. Der Workflow kann PDFs, Markdown, HTML, Office-Dateien, Quellcode, Bilder und Tabellen verarbeiten, passende Passagen finden, kontextuelle Zusammenfassungen erstellen, Belege neu ordnen und daraus eine zitierte Antwort erzeugen. Das Paket unterstützt lokale Modelle und mit LiteLLM kompatible Anbieter. Die dokumentierten Standardeinstellungen verwenden allerdings gehostete Modelle und Embeddings.
Bei PaperQA2 lässt sich ein Verzeichnis angeben und ein wiederverwendbarer Index erstellen. Außerdem können Modell, Embedding, Anzahl der Belege und Quellenlimits angepasst werden. Das Repository nennt als Standard 10 Belegpassagen und 5 maximale Antwortquellen. Die Einstellung für höhere Qualität arbeitet mit mehr Evidenz und verursacht entsprechend höhere Kosten.
Damit eignet sich PaperQA2 besonders für:
- Private oder unveröffentlichte PDFs eines Labors.
- Ein projektspezifisches Evidenzpaket.
- Wiederkehrende Fragen über denselben Dokumentenbestand.
- Workflows, die PDF-Abbildungen, Tabellen, Metadaten oder Seitenverweise benötigen.
Der Nachteil: Anbieter und Konfiguration haben großen Einfluss auf das Ergebnis. PaperQA2 ist Open Source, aber Qualität und Kosten hängen vom gewählten LLM, Embedding-Modell, Parser, Korpus und den Einstellungen ab. Das offizielle Repository verspricht keinen festen Preis pro Frage.
„Die Standardkonfiguration verwendet OpenAI-Modelle und eine NumPy-Vektordatenbank. Das Paket ist jedoch darauf ausgelegt, alternative LLMs, Embedding-Modelle, Vektorspeicher und lokale Server zu unterstützen.“ — FutureHouse, PaperQA2-Dokumentation
Dieselbe Forschungsaufgabe, unterschiedliche Workflows
Breite Recherche in einem unbekannten Feld: OpenScholar
Starte mit OpenScholar, wenn noch nicht feststeht, welche Papers in die Antwort gehören. Der große Open-Access-Datastore und die spezialisierte Retrieval-Pipeline sind dafür ausgelegt, Belege aus vielen Veröffentlichungen zu finden und zusammenzuführen.
Private Projektbibliothek: PaperQA2
PaperQA2 ist die bessere Wahl, wenn das Projektverzeichnis die Grenze der verwendeten Evidenz bildet. Indexiere die Papers, halte den Quellenbestand stabil und passe die Zahl der Belegpassagen sowie der finalen Quellen an. So kann ein Reviewer den exakten Korpus der Antwort überprüfen.
Schneller Bericht nach der Recherche: AstaBrief 8B
Setze AstaBrief ein, nachdem eine andere Komponente die Recherche erledigt hat. Das Modell ist besonders sinnvoll, wenn Latenz, lokale Kontrolle oder hoher Berichts-Durchsatz wichtiger sind als der Aufbau eines vollständigen Literatur-Recherche-Systems.
Hybrider Stack: mit OpenScholar recherchieren, mit AstaBrief schreiben
Stelle die Evidenz mit einem wissenschaftlichen Retriever und Reranker zusammen, übergib die ausgewählten Auszüge an AstaBrief 8B und führe vor der Veröffentlichung einen separaten Check zur Belegbarkeit der Aussagen durch. So kombinierst du die Recherchefähigkeiten von OpenScholar mit AstaBriefs kompakter Generierung. Dafür entsteht allerdings eine Integrationsverantwortung, die keine einzelne Komponente abnimmt.
Was die veröffentlichten Benchmarks tatsächlich belegen
Die Versionen des OpenScholar-Papers bei Nature und PMC liefern den klarsten Vergleich von PaperQA2 und OpenScholar innerhalb desselben Benchmarks. Auf ScholarQABench lag der veröffentlichte Multi-Paper-Wert nach der Scholar-CS-Rubrik bei 51.1 für OpenScholar-8B und 45.6 für PaperQA2. Beim Citation-F1 hatte PaperQA2 in dieser Tabelle einen leichten Vorsprung: 48.0 gegenüber 47.9 für OpenScholar-8B. Die Autoren veranschlagen die Kosten für PaperQA2 auf $0.30–$2.30 pro Frage, verglichen mit $0.003 für OpenScholar-8B unter den Kostenannahmen des Papers.
| Veröffentlichtes ScholarQABench-Ergebnis | OpenScholar-8B | PaperQA2 |
|---|---|---|
| Scholar-CS-Rubrikenwert | 51.1 | 45.6 |
| Scholar-CS Citation F1 | 47.9 | 48.0 |
| Geschätzte Kosten pro Frage | $0.003 | $0.30–$2.30 |
Diese Zahlen sind keine allgemeingültige Rangliste. Die Studie testete PaperQA2 mit dem OpenScholar DataStore, weil PaperQAs eigener Datastore nicht öffentlich verfügbar war. Außerdem wurde eine bestimmte Modell- und Konfigurationsvariante verwendet. Entscheidend ist vor allem: Der veröffentlichte Vergleich enthält kein AstaBrief 8B im selben ScholarQABench-Setup. Die für AstaBrief berichteten Geschwindigkeits- und Qualitätswerte stammen aus den auf Asta ausgerichteten Evaluierungen von Ai2. Sie erlauben daher keine Einordnung gegenüber OpenScholar und PaperQA2.
Die Studie weist außerdem darauf hin, dass die Antworten von PaperQA2 eine hohe Zitiergenauigkeit erreichten, sich aber häufig nur auf ein oder wenige Papers stützten. Das begrenzte die Abdeckung und die Organisation über mehrere Papers hinweg. Zitierpräzision und Reichweite der Literaturrecherche sind zwei unterschiedliche Ziele.
Eine verlässliche Entscheidungshilfe
| Deine Anforderung | Empfehlung | Warum |
|---|---|---|
| Unbekannte Literatur in großem Umfang entdecken | OpenScholar | Recherche und Synthese sind integriert |
| Die Evidenz auf einen lokalen Ordner begrenzen | PaperQA2 | Korpus, Index und Einstellungen bleiben unter deiner Kontrolle |
| Schnell einen Bericht aus vorgegebenen Belegen erstellen | AstaBrief 8B | Kompakte, einstufige Berichtsgenerierung |
| Hinter einer Firewall mit offenen Gewichten arbeiten | AstaBrief 8B oder OpenScholar-8B | Offene Modellartefakte; der umgebende Stack bleibt trotzdem entscheidend |
| Jede Aussage anhand einer bekannten Passage prüfen | PaperQA2 oder ein hybrider Ansatz | Lokale Indizierung und explizite Evidenzkontrollen erleichtern die Prüfung |
| Kosten minimieren, wenn lokale Inferenz möglich ist | OpenScholar-8B; AstaBrief separat testen | Die veröffentlichten Kostenangaben sind nicht direkt vergleichbar |
Bevor du einem der drei Systeme vertraust, solltest du die Recherchegrenze, die Belegbarkeit der Zitate, die Literaturabdeckung, den Umfang der Aussagen sowie die Reproduzierbarkeit von Korpus und Einstellungen prüfen.
FAQ
Ist AstaBrief 8B ein Ersatz für OpenScholar?
Nein. AstaBrief 8B ist in erster Linie ein Modell zur Berichtserstellung, das recherchierte Auszüge verarbeitet. OpenScholar umfasst dagegen einen wissenschaftlichen Datastore, Retrieval, Reranking und einen Workflow mit Self-Feedback. AstaBrief kann einen Teil der Generierung ersetzen, aber nicht automatisch den vollständigen Recherche-Stack.
Findet AstaBrief 8B Papers selbst?
In der offiziellen Beschreibung wird AstaBrief als Modell dargestellt, das eine Forschungsfrage und recherchierte Literaturauszüge verarbeitet. Die Recherche übernimmt der umgebende Asta/ScholarQA-Workflow oder eine separate Pipeline, die du selbst erstellst.
Welches System bietet die beste Zitiergenauigkeit?
In der veröffentlichten ScholarQABench-Tabelle liegt PaperQA2 beim Citation F1 knapp vor OpenScholar-8B: 48.0 gegenüber 47.9. Beim Scholar-CS-Rubrikenwert erzielt OpenScholar-8B dagegen 51.1 gegenüber 45.6. Für AstaBrief gibt es in diesem Vergleich kein Ergebnis aus demselben Benchmark.
Kann PaperQA2 vollständig lokal laufen?
PaperQA2 unterstützt lokale Modellserver, lokale Embeddings, lokale Indizes und lokale Dokumentensammlungen. Wie gut eine vollständig lokale Bereitstellung funktioniert, hängt trotzdem vom Parser, Embedding-Modell, der Qualität des LLMs, der Hardware und den gewählten Einstellungen ab.
Welches System eignet sich am besten für ein systematisches Review?
Keines der drei Systeme ersetzt ein registriertes Review-Protokoll, die Prüfung durch Menschen und die Verifizierung der Zitate. Für die Recherche ist OpenScholar der bessere Ausgangspunkt bei einer breiten Suche. Für eine vorab definierte Evidenzbibliothek bietet PaperQA2 die engere Kontrolle über den Korpus. AstaBrief eignet sich für den Entwurf, sobald der Evidenzbestand zusammengestellt ist.
Die Entscheidung in einem Satz: Wähle OpenScholar, wenn das Finden der richtigen Literatur die größte Herausforderung ist, PaperQA2, wenn die Kontrolle über einen bekannten Korpus im Mittelpunkt steht, und AstaBrief 8B, wenn die Recherche bereits gelöst ist und die Berichtslatenz zum Engpass wird.