Tenerife.click/Confronto IA

Quale IA usare nella tua attività: il confronto semplice

Né il leaderboard più tecnico né quello che ti vende un abbonamento. Prezzo reale, un dato ufficiale di ragionamento e, soprattutto, a cosa serve ogni modello in un’attività piccola.

Dati verificati il 2026-09-15. Ogni cifra porta la sua fonte. Quelle che non sono ufficiali lo dicono, non si nascondono.

Come leggere questa pagina

Dietro ogni modello c’è un’azienda che vuole che tu scelga proprio quello. Qui non ne vendiamo nessuno: mettiamo solo il prezzo e un dato di ragionamento uno accanto all’altro, con la fonte in vista, e ti diciamo a cosa serve davvero in un’attività piccola.

Vedrai due etichette: Ufficiale quando il dato viene direttamente dal produttore, e Comunità quando viene da un aggregatore indipendente perché il produttore non lo pubblica in quella forma. Nessuna cifra compare senza le due cose: da dove viene e quando l’abbiamo verificata.

In breve

Tre decisioni, in tre numeri

Più economica per il giorno per giornoGemini 3.8 Flash$0,75 / $3,75 per 1M token · ufficiale
Miglior ragionamento ufficialeGPT-6 Astra96,0% su GPQA Diamond · ufficiale
Con i dati nell’UEMistral Large 3azienda francese, non USA né Cina

Prezzo per ogni milione di token

Ingresso (quello che gli mandi) e uscita (quello che ti restituisce), in dollari. L’uscita è di solito la parte cara.

UfficialeVerificato il 2026-09-15
IngressoUscita
GPT-5.6 LunaComunitàOpenAI
$0,20
$1,20
Mistral Large 3Mistral
$0,50
$1,50
DeepSeek V4-ProDeepSeek
$0,66
$1,98
Gemini 3.8 FlashGoogle
$0,75
$3,75
Claude Haiku 4.5Anthropic
$1
$5
Gemini 3.1 ProGoogle
$2
$12
Claude Opus 5Anthropic
$5
$25
GPT-6 AstraOpenAI
$10
$50
Claude Fable 5.1Anthropic
$10
$50
Vedi come tabella
ModelloIngresso / 1MUscita / 1MFonte
GPT-5.6 Luna$0,20$1,20eesel.ai (fuente independiente)
Mistral Large 3$0,50$1,50mistral.ai/pricing
DeepSeek V4-Pro$0,66$1,98api-docs.deepseek.com
Gemini 3.8 Flash$0,75$3,75ai.google.dev/pricing
Claude Haiku 4.5$1$5claude.com/pricing
Gemini 3.1 Pro$2$12ai.google.dev/pricing
Claude Opus 5$5$25claude.com/pricing
GPT-6 Astra$10$50openai.com (anuncio oficial)
Claude Fable 5.1$10$50claude.com/pricing

Ragionamento: GPQA Diamond

Percentuale di risposte corrette su domande di livello dottorato (fisica, biologia, chimica). Il benchmark ufficiale che più produttori pubblicano in modo comparabile.

Verificato il 2026-09-15
GPT-6 AstraUfficialeOpenAI
96,0%
Gemini 3.1 ProUfficialeGoogle
94,3%
Claude Fable 5.1UfficialeAnthropic
93,7%
Claude Opus 5UfficialeAnthropic
93,2%
DeepSeek V4-ProUfficialeDeepSeek
90,1%
Mistral Large 3ComunitàMistral
43,9%
Vedi come tabella
ModelloGPQA DiamondDatoFonte
GPT-6 Astra96,0%Ufficialeopenai.com (tabla de lanzamiento)
Gemini 3.1 Pro94,3%Ufficialedeepmind.google (ficha del modelo)
Claude Fable 5.193,7%UfficialeSystem Card (Anthropic, PDF)
Claude Opus 593,2%UfficialeSystem Card (Anthropic, PDF)
DeepSeek V4-Pro90,1%UfficialeHugging Face (ficha del modelo)
Mistral Large 343,9%ComunitàVals AI (agregador independiente)

E la programmazione? Non c’è ancora un modo pulito di confrontarli: ogni produttore misura il codice con un benchmark diverso (SWE-bench Verified, LiveCodeBench, DeepSWE...) e, nei modelli più recenti, le fonti non sono nemmeno concordi tra loro — una cifra di DeepSeek, per esempio, è segnalata da un revisore indipendente come "solo rivendicazione interna, non riprodotta da terzi". Lo stesso vale per le classifiche "comunità" tipo Arena: cambiano di settimana in settimana. Prima di trasformare tutto questo in un grafico che sembri più solido di quanto sia, preferiamo dirlo così. Non includiamo nemmeno Grok (xAI) né Llama (Meta): non abbiamo trovato una cifra ufficiale di ragionamento per Grok, e a metà settembre 2026 non è chiaro quale sia oggi il modello "attuale" di Llama. Lo aggiungeremo appena ci sarà qualcosa di verificabile.

Modello per modello

A cosa serve ognuno, in una frase

Claude Fable 5.1

Il più potente tra quelli verificati. Pensato per lavoro intellettuale complesso, non per il giorno per giorno di un’attività piccola: più potenza — e prezzo — di quanto quasi nessuno qui ne abbia bisogno.

PREZZO$10/$50
GPQA93,7%

Claude Opus 5

Il punto di equilibrio di Anthropic: qualità alta a prezzo medio. Buona opzione per scrittura o assistenza clienti un po’ più impegnativa di un chatbot base.

PREZZO$5/$25
GPQA93,2%

Claude Haiku 4.5

L’opzione economica di Anthropic. Per compiti semplici e ripetitivi: classificare email, riassumere testi brevi.

PREZZO$1/$5
GPQAnessun dato ufficiale pubblicato

GPT-6 Astra

Il modello di riferimento di OpenAI in questo momento. Il miglior dato ufficiale di ragionamento che siamo riusciti a verificare. Prezzo di fascia alta.

PREZZO$10/$50
GPQA96,0%

GPT-5.6 Luna

L’opzione economica di OpenAI. Va bene per chat e assistenza di base; non per compiti che richiedono molto ragionamento.

PREZZO$0,20/$1,20
GPQAnessun dato ufficiale pubblicato

Gemini 3.1 Pro

Il generalista di Google. Prezzo medio, dati di ragionamento ufficiali solidi. Se non sai quale scegliere, è una scommessa sicura.

PREZZO$2/$12
GPQA94,3%

Gemini 3.8 Flash

La più economica di questa lista con prezzo ufficiale verificato. Per compiti ripetitivi: descrizioni prodotto, risposte alle recensioni.

PREZZO$0,75/$3,75
GPQAnessun dato ufficiale pubblicato

DeepSeek V4-Pro

Prezzo molto aggressivo. Ma con due riserve: i suoi server sono in Cina (occhio al RGPD prima di mandargli dati di clienti) e diverse delle sue cifre di prestazione non sono verificate da nessuno al di fuori dell’azienda stessa.

PREZZO$0,66/$1,98
GPQA90,1%

Mistral Large 3

L’unica europea di questa lista — azienda francese, dato rilevante se ti preoccupa dove vivono i dati dei tuoi clienti. In cambio, resta chiaramente indietro nel ragionamento.

PREZZO$0,50/$1,50
GPQA43,9%

Domande frequenti

Cosa vuol dire "ufficiale" e cosa vuol dire "comunità"?
"Ufficiale" vuol dire che il dato viene direttamente dal produttore: la sua pagina dei prezzi, la sua scheda tecnica o il suo documento di lancio. "Comunità" vuol dire che viene da un aggregatore indipendente perché il produttore non pubblica quella cifra in quella forma. Entrambi possono essere utili, ma non pesano allo stesso modo.
Perché non c’è un grafico sul codice o sull’"arena"?
Li abbiamo provati e scartati per ora: ogni produttore misura il codice con un benchmark diverso e, nei modelli più recenti, le fonti non sono nemmeno concordi. Le classifiche di comunità cambiano di settimana in settimana. Preferiamo dirlo chiaramente piuttosto che forzare un grafico che sembri più solido di quanto sia.
Ogni quanto si aggiorna questo confronto?
A mano, quando cambia qualcosa di rilevante — non c’è nessun processo automatico dietro. Ogni grafico porta la data in cui abbiamo verificato il dato; se ha già qualche mese, controlla il prezzo alla fonte prima di decidere.
Quale scelgo se ne voglio uno solo?
Se non sai da dove iniziare: Gemini 3.1 Pro, generalista solido a prezzo medio. Se il budget è molto limitato: Gemini 3.8 Flash. Se ti preoccupa dove sono i dati dei tuoi clienti: Mistral Large 3, l’unica europea di questa lista.

Da dove viene tutto questo

Ogni prezzo e ogni percentuale di questa pagina si può verificare qui. Se qualcosa cambia e non l’abbiamo aggiornato, vale la fonte.

Continua a leggere