Tenerife.click/Comparativa IA

Qué IA usar en tu negocio: la comparativa simple

Ni el leaderboard más técnico ni el que te vende una suscripción. Precio real, un dato oficial de razonamiento y, sobre todo, para qué sirve cada modelo en un negocio pequeño.

Datos verificados el 2026-09-15. Cada cifra lleva su fuente. Las que no son oficiales lo dicen, no se disimulan.

Cómo leer esta página

Cada modelo tiene detrás una empresa que quiere que lo elijas a él. Aquí no vendemos ninguno: solo ponemos el precio y un dato de razonamiento uno al lado del otro, con la fuente a la vista, y te decimos para qué sirve de verdad en un negocio pequeño.

Verás dos etiquetas: Oficial cuando el dato viene directo del fabricante, y Comunidad cuando viene de un agregador independiente porque el fabricante no lo publica de esa forma. Ninguna cifra aparece sin las dos cosas: de dónde sale y cuándo la comprobamos.

En resumen

Tres decisiones, en tres números

Más barata para el día a díaGemini 3.8 Flash$0,75 / $3,75 por 1M tokens · oficial
Mejor razonamiento oficialGPT-6 Astra96,0% en GPQA Diamond · oficial
Con los datos en la UEMistral Large 3empresa francesa, no EE. UU. ni China

Precio por cada millón de tokens

Entrada (lo que le mandas) y salida (lo que te devuelve), en dólares. La salida suele ser la parte cara.

OficialComprobado 2026-09-15
EntradaSalida
GPT-5.6 LunaComunidadOpenAI
$0,20
$1,20
Mistral Large 3Mistral
$0,50
$1,50
DeepSeek V4-ProDeepSeek
$0,66
$1,98
Gemini 3.8 FlashGoogle
$0,75
$3,75
Claude Haiku 4.5Anthropic
$1
$5
Gemini 3.1 ProGoogle
$2
$12
Claude Opus 5Anthropic
$5
$25
GPT-6 AstraOpenAI
$10
$50
Claude Fable 5.1Anthropic
$10
$50
Ver como tabla
ModeloEntrada / 1MSalida / 1MFuente
GPT-5.6 Luna$0,20$1,20eesel.ai (fuente independiente)
Mistral Large 3$0,50$1,50mistral.ai/pricing
DeepSeek V4-Pro$0,66$1,98api-docs.deepseek.com
Gemini 3.8 Flash$0,75$3,75ai.google.dev/pricing
Claude Haiku 4.5$1$5claude.com/pricing
Gemini 3.1 Pro$2$12ai.google.dev/pricing
Claude Opus 5$5$25claude.com/pricing
GPT-6 Astra$10$50openai.com (anuncio oficial)
Claude Fable 5.1$10$50claude.com/pricing

Razonamiento: GPQA Diamond

Porcentaje de aciertos en preguntas de nivel doctorado (física, biología, química). El benchmark oficial que más fabricantes publican de forma comparable.

Comprobado 2026-09-15
GPT-6 AstraOficialOpenAI
96,0%
Gemini 3.1 ProOficialGoogle
94,3%
Claude Fable 5.1OficialAnthropic
93,7%
Claude Opus 5OficialAnthropic
93,2%
DeepSeek V4-ProOficialDeepSeek
90,1%
Mistral Large 3ComunidadMistral
43,9%
Ver como tabla
ModeloGPQA DiamondDatoFuente
GPT-6 Astra96,0%Oficialopenai.com (tabla de lanzamiento)
Gemini 3.1 Pro94,3%Oficialdeepmind.google (ficha del modelo)
Claude Fable 5.193,7%OficialSystem Card (Anthropic, PDF)
Claude Opus 593,2%OficialSystem Card (Anthropic, PDF)
DeepSeek V4-Pro90,1%OficialHugging Face (ficha del modelo)
Mistral Large 343,9%ComunidadVals AI (agregador independiente)

¿Y en programación? Todavía no hay una manera limpia de compararlos: cada fabricante mide el código con un benchmark distinto (SWE-bench Verified, LiveCodeBench, DeepSWE...) y, en los modelos más recientes, ni siquiera coinciden entre fuentes — alguna cifra de DeepSeek, por ejemplo, está marcada por un revisor independiente como "solo reivindicación interna, sin reproducir por terceros". Lo mismo pasa con los rankings de "comunidad" tipo Arena: cambian de semana en semana. Antes de convertir eso en un gráfico que parezca más sólido de lo que es, preferimos decirlo así. Tampoco incluimos Grok (xAI) ni Llama (Meta): no encontramos una cifra oficial de razonamiento para Grok, y a mediados de septiembre de 2026 no está claro cuál es hoy el modelo "actual" de Llama. Lo añadiremos en cuanto haya algo verificable.

Modelo a modelo

Para qué sirve cada uno, en una frase

Claude Fable 5.1

El más potente de los que hemos comprobado. Pensado para trabajo intelectual complejo, no para el día a día de un negocio pequeño: más precio y potencia de la que casi nadie necesita aquí.

PRECIO$10/$50
GPQA93,7%

Claude Opus 5

El punto de equilibrio de Anthropic: calidad alta a precio medio. Buena opción para redacción o atención al cliente algo más exigente que un chatbot básico.

PRECIO$5/$25
GPQA93,2%

Claude Haiku 4.5

La opción económica de Anthropic. Para tareas simples y repetitivas: clasificar correos, resumir textos cortos.

PRECIO$1/$5
GPQAsin dato oficial publicado

GPT-6 Astra

El modelo de referencia de OpenAI ahora mismo. El mejor dato oficial de razonamiento que hemos podido verificar. Precio de gama alta.

PRECIO$10/$50
GPQA96,0%

GPT-5.6 Luna

La opción barata de OpenAI. Bien para chat y soporte básico; no para tareas que exijan razonar mucho.

PRECIO$0,20/$1,20
GPQAsin dato oficial publicado

Gemini 3.1 Pro

El generalista de Google. Precio medio, datos de razonamiento oficiales sólidos. Si no sabes cuál elegir, es una apuesta segura.

PRECIO$2/$12
GPQA94,3%

Gemini 3.8 Flash

La más barata de esta lista con precio oficial verificado. Para tareas repetitivas: descripciones de producto, respuestas a reseñas.

PRECIO$0,75/$3,75
GPQAsin dato oficial publicado

DeepSeek V4-Pro

Precio muy agresivo. Pero con dos reservas: sus servidores están en China (mira el RGPD antes de mandarle datos de clientes) y varias de sus cifras de rendimiento no están verificadas por nadie fuera de la propia empresa.

PRECIO$0,66/$1,98
GPQA90,1%

Mistral Large 3

La única europea de esta lista — empresa francesa, dato relevante si te preocupa dónde viven los datos de tus clientes. A cambio, va claramente por detrás en razonamiento.

PRECIO$0,50/$1,50
GPQA43,9%

Preguntas frecuentes

¿Qué significa "oficial" y qué significa "comunidad"?
"Oficial" quiere decir que el dato viene directamente del fabricante: su página de precios, su ficha técnica o su documento de lanzamiento. "Comunidad" quiere decir que viene de un agregador independiente porque el fabricante no publica esa cifra de esa forma. Los dos pueden ser útiles, pero no pesan igual.
¿Por qué no hay un gráfico de código o de "arena"?
Los probamos y los descartamos por ahora: cada fabricante mide el código con un benchmark distinto y, en los modelos más recientes, ni siquiera coinciden entre fuentes. Los rankings de comunidad cambian de semana en semana. Preferimos decirlo así de claro que forzar un gráfico que parezca más sólido de lo que es.
¿Cada cuánto se actualiza esta comparativa?
A mano, cuando cambia algo relevante — no hay ningún proceso automático detrás. Cada gráfico lleva la fecha en la que comprobamos el dato; si tiene ya varios meses, comprueba el precio en la fuente antes de decidir.
¿Cuál elijo si solo quiero uno?
Si no sabes por dónde empezar: Gemini 3.1 Pro, generalista sólido a precio medio. Si el presupuesto es muy ajustado: Gemini 3.8 Flash. Si te preocupa dónde están los datos de tus clientes: Mistral Large 3, la única europea de esta lista.

De dónde sale todo esto

Cada precio y cada porcentaje de esta página se puede comprobar aquí. Si algo cambia y no lo hemos actualizado, la fuente manda.

Seguir leyendo