AIREITER

AstaBrief 8B vs OpenScholar vs PaperQA2: confronto dei workflow

Ultimo Aggiornamento: 2026-10-02 19:16:25

AstaBrief 8B, OpenScholar e PaperQA2 finiscono spesso nella stessa shortlist di strumenti per l’AI scientifica, ma entrano in gioco in momenti diversi del lavoro di ricerca. OpenScholar è la scelta predefinita più solida per una sintesi ampia della letteratura con citazioni; PaperQA2 è più pratico quando si lavora su una raccolta controllata di PDF; AstaBrief 8B è un generatore di report veloce da aggiungere quando il recupero delle fonti è già risolto. Questa distinzione conta più delle etichette legate alle dimensioni dei modelli.

Tre sistemi, tre punti di partenza

SistemaParte daAmbito del recuperoOutput principalePrimo utilizzo ideale
AstaBrief 8BUna domanda di ricerca più estratti già recuperatiFornito dal workflow Asta/ScholarQA circostante o dalla propria pipelineUn report rapido con citazioniGenerare velocemente un report dopo il recupero
OpenScholarUna domanda scientificaOpenScholar DataStore, retriever, reranker e altre fonti di recuperoUna sintesi estesa con citazioniCercare e sintetizzare una letteratura ampia
PaperQA2Una domanda più una directory di documenti o un corpusIndicizzazione locale, ricerca dei metadati, embedding, reranking e ricerca agenticaUna risposta fondata sulle evidenze con citazioni inlinePorre domande ripetibili su documenti controllati

I corpus integrati più ampi richiedono più tempo di preparazione, ma offrono una capacità di scoperta maggiore; i file forniti dall’utente sacrificano ampiezza in favore del controllo sulle evidenze.

AstaBrief 8B: report rapidi quando il recupero è già pronto

AstaBrief 8B è un modello compatto per la generazione di report, rilasciato da Ai2. L’annuncio ufficiale descrive come input una domanda di ricerca insieme a estratti di letteratura recuperati, non un servizio autonomo per cercare articoli. Il modello è distribuito con una licenza Apache 2.0; Ai2 ha pubblicato anche i dati di addestramento e un workflow di esempio per generare report a partire dai PDF dei ricercatori.

Ai2 riporta una media di 51.1 secondi per l’intera pipeline Asta in modalità Fast, contro 178.5 secondi in modalità Thinking, cioè circa 3.5× più veloce in quel confronto. Si tratta di una misurazione della pipeline, non di una promessa universale sulla velocità di inferenza per ogni deployment locale.

AstaBrief si inserisce bene in pipeline che forniscono già passaggi recuperati, ID di citazione stabili e una fase di verifica del supporto alle affermazioni. Non va considerato un sostituto autonomo del datastore e dello stack di retrieval di OpenScholar: se gli estratti sono incompleti, il generatore non può recuperare articoli che non gli sono mai stati forniti.

Per approfondire installazione e deployment locale, consulta la nostra recensione di AstaBrief 8B e guida al deployment locale.

OpenScholar: un workflow per sintetizzare ampie porzioni di letteratura

OpenScholar utilizza OpenScholar DataStore, un corpus composto da 45 millioni di articoli open access e 236 milioni di embedding di passaggi testuali, insieme a retriever addestrati, reranker, generazione con citazioni e un ciclo di auto-feedback (Nature).

OpenScholar è il punto di partenza migliore quando la domanda assomiglia a una di queste:

  • “Cosa dice la letteratura sull’argomento attraverso più sottocampi?”
  • “Confronta i metodi in un’area di ricerca ampia e in continua evoluzione.”
  • “Trova gli articoli rilevanti prima di scrivere la sintesi.”

L’articolo pubblicato su Nature riporta che la configurazione di retrieval combinata ha raggiunto 49.6 correctness e 47.6 citation F1 nell’ablation study di informatica, superando il recupero basato solo sul web e quello basato solo su Semantic Scholar. Un datastore ampio, retriever, reranker e ciclo di feedback richiedono più infrastruttura rispetto a un piccolo modello per la generazione di report; eseguire un checkpoint 8B senza questi componenti non equivale a ricreare l’intero sistema.

PaperQA2: la scelta più adatta per un insieme locale di documenti controllato

PaperQA2 è progettato per rispondere a domande basandosi direttamente sui documenti. Il workflow può analizzare PDF, Markdown, HTML, file Office, codice sorgente, immagini e tabelle; recuperare i passaggi candidati; creare riepiloghi contestuali; riordinare le evidenze e produrre una risposta con citazioni. Il pacchetto supporta modelli locali e provider compatibili con LiteLLM, anche se i valori predefiniti documentati utilizzano modelli ed embedding ospitati.

Con PaperQA2 puoi indicare una directory, creare un indice riutilizzabile e modificare modello, embedding, numero di evidenze e limiti sulle fonti. Il repository documenta un valore predefinito di 10 passaggi di evidenza e 5 fonti massime per risposta, mentre l’impostazione high-quality usa più evidenze e ha un costo maggiore.

PaperQA2 è quindi particolarmente interessante per:

  • I PDF privati o non pubblicati di un laboratorio.
  • Un insieme di evidenze dedicato a uno specifico progetto.
  • Domande ricorrenti sulla stessa raccolta di documenti.
  • Workflow che richiedono figure, tabelle, metadati o riferimenti alle pagine dei PDF.

Il compromesso riguarda la dipendenza dal provider e dalla configurazione. PaperQA2 è open source, ma qualità e costi finali dipendono da LLM, modello di embedding, parser, corpus e impostazioni selezionati. Il repository ufficiale non promette un unico prezzo fisso per domanda.

“La configurazione predefinita utilizza modelli OpenAI e un database vettoriale NumPy, ma il pacchetto è progettato per supportare LLM, modelli di embedding, vector store e server locali alternativi.” — FutureHouse, documentazione di PaperQA2

Stesso obiettivo di ricerca, workflow diversi

Per esplorare un campo sconosciuto: scegli OpenScholar

Inizia con OpenScholar quando non sai ancora quali articoli dovrebbero entrare nella risposta. Il suo datastore open di grandi dimensioni e la pipeline di retrieval specializzata sono pensati per trovare e sintetizzare evidenze distribuite su molti articoli.

Per la libreria privata di un progetto: scegli PaperQA2

Usa PaperQA2 quando il perimetro delle evidenze coincide con la directory del progetto. Indicizza gli articoli, mantieni stabile l’insieme delle fonti e regola il numero di passaggi di evidenza e di fonti finali. In questo modo un revisore può controllare il corpus esatto utilizzato per la risposta.

Per generare rapidamente un report dopo il retrieval: scegli AstaBrief 8B

Usa AstaBrief dopo che un altro componente ha svolto il lavoro di scoperta. È la scelta più lineare quando latenza, controllo locale o produttività nella generazione dei report contano più della costruzione di un sistema completo per la ricerca bibliografica.

Per uno stack ibrido: recupera con OpenScholar e scrivi con AstaBrief

Raccogli le evidenze con un retriever e un reranker accademici, passa gli estratti selezionati ad AstaBrief 8B ed esegui un controllo separato del supporto alle affermazioni prima della pubblicazione. Questa combinazione unisce la capacità di scoperta tipica di OpenScholar al percorso di generazione compatto di AstaBrief, ma introduce una responsabilità d’integrazione che nessun singolo componente può eliminare.

Cosa dimostra davvero il benchmark pubblicato

Le versioni dell’articolo su Nature e PMC offrono il confronto più chiaro, basato sullo stesso benchmark, tra OpenScholar e PaperQA2. Su ScholarQABench, il punteggio multi-articolo riportato per il rubric Scholar-CS è stato di 51.1 per OpenScholar-8B e 45.6 per PaperQA2. In quella tabella PaperQA2 ha ottenuto un leggero vantaggio nel citation F1, 48.0 contro 47.9 di OpenScholar-8B. L’articolo stima un costo per PaperQA2 di $0.30–$2.30 per domanda, contro $0.003 per OpenScholar-8B secondo le ipotesi di costo adottate nello studio.

Risultati pubblicati su ScholarQABenchOpenScholar-8BPaperQA2
Punteggio rubric Scholar-CS51.145.6
Scholar-CS citation F147.948.0
Costo stimato per domanda$0.003$0.30–$2.30

Questi numeri non costituiscono una classifica universale. L’articolo ha valutato PaperQA2 usando OpenScholar DataStore, perché il datastore proprietario di PaperQA2 non era pubblico. La valutazione ha inoltre utilizzato uno specifico modello e una specifica configurazione. Soprattutto, il confronto pubblicato non include AstaBrief 8B sulla stessa configurazione di ScholarQABench. I risultati di velocità e qualità riportati per AstaBrief provengono dalle valutazioni incentrate su Asta condotte da Ai2; non possono quindi stabilire il suo posizionamento rispetto a OpenScholar e PaperQA2.

L’articolo osserva inoltre che le risposte di PaperQA2 avevano un’elevata accuratezza delle citazioni, ma spesso si basavano su uno o pochi articoli, riducendo copertura e organizzazione multi-articolo. La precisione delle citazioni e l’ampiezza della copertura bibliografica sono obiettivi distinti.

Una regola semplice per scegliere

Il tuo vincoloScelta consigliataPerché
Scoprire letteratura sconosciuta su larga scalaOpenScholarRetrieval e sintesi sono integrati
Mantenere l’insieme delle evidenze dentro una cartella localePaperQA2Corpus, indice e impostazioni sono sotto il controllo dell’utente
Produrre rapidamente un report a partire da evidenze forniteAstaBrief 8BGenerazione compatta del report in un unico passaggio
Eseguire il sistema dietro un firewall con pesi apertiAstaBrief 8B o OpenScholar-8BArtefatti del modello aperti; lo stack circostante resta comunque importante
Verificare ogni affermazione rispetto a un passaggio notoPaperQA2 o uno stack ibridoIndicizzazione locale e controlli espliciti sulle evidenze facilitano la revisione
Ridurre i costi quando l’inferenza locale è praticabileOpenScholar-8B; testa AstaBrief separatamenteLe cifre di costo pubblicate non sono direttamente confrontabili

Prima di affidarti a uno dei tre, verifica il perimetro del retrieval, il supporto delle citazioni, la copertura della letteratura, l’ampiezza delle affermazioni e la riproducibilità del corpus e delle impostazioni.

FAQ

AstaBrief 8B può sostituire OpenScholar?

No. AstaBrief 8B è principalmente un modello per generare report a partire da estratti recuperati, mentre OpenScholar include un datastore scientifico, retrieval, reranking e un workflow di auto-feedback. AstaBrief può sostituire una parte del livello di generazione, ma non automaticamente l’intero stack di scoperta.

AstaBrief 8B recupera autonomamente gli articoli?

La descrizione ufficiale di AstaBrief presenta il modello come un sistema che riceve una domanda di ricerca e relativi estratti di letteratura già recuperati. Il retrieval viene fornito dal workflow Asta/ScholarQA circostante oppure da una pipeline separata costruita dall’utente.

Quale offre la migliore accuratezza delle citazioni?

La tabella pubblicata di ScholarQABench assegna a PaperQA2 un vantaggio marginale nel citation F1 rispetto a OpenScholar-8B, 48.0 contro 47.9, mentre OpenScholar-8B ottiene un punteggio più alto nel rubric Scholar-CS, 51.1 contro 45.6. In quel confronto non esiste un risultato di AstaBrief ottenuto sullo stesso benchmark.

PaperQA2 può funzionare interamente in locale?

PaperQA2 supporta server di modelli locali, embedding locali, indici locali e raccolte di documenti locali. Un deployment completamente locale dipende comunque dal parser, dal modello di embedding, dalla qualità dell’LLM, dall’hardware e dalla configurazione scelti.

Qual è il migliore per una revisione sistematica?

Nessuno dei tre dovrebbe sostituire un protocollo di revisione registrato, lo screening umano e la verifica delle citazioni. Per la fase di scoperta, OpenScholar è il punto di partenza migliore per una ricerca ampia; per una libreria di evidenze predefinita, PaperQA2 offre un controllo più stretto sul corpus; AstaBrief è utile per preparare una bozza dopo aver assemblato l’insieme delle evidenze.

In una riga: scegli OpenScholar quando la parte più difficile è trovare la letteratura giusta, PaperQA2 quando il problema principale è controllare un corpus noto e AstaBrief 8B quando il retrieval è già risolto e il collo di bottiglia è la latenza nella generazione del report.