Imagen destacada para Los mejores modelos de Ollama para el día a día (guía 2026)

Los mejores modelos de Ollama para el día a día (guía 2026)

Publicado el:

Tiempo de lectura: 17 min

Tema: Tecnologia

Autor: Leandro Valencia

#ollama#modelos de ia#ia local#llm#qwen#gemma 4#gpt-oss#qwen coder#glm-ocr#embeddings#cuantizacion#privacidad#inteligencia artificial#ia gratis

Guía 2026 para elegir modelos de Ollama: tabla comparativa de Qwen 3.5, Gemma 4, gpt-oss, qwen3-coder y más, con cuantización, RAM necesaria y qué instalar según tu equipo.

Tabla de Contenidos

La tabla comparativa

Modelo (tag) Tamaño descarga Contexto RAM recomendada Multimodal Herramientas / razonamiento Mejor para
qwen3.5:2b 2.7 GB 256K 8 GB Texto + imagen Sí / Sí El todoterreno mínimo. Resúmenes, reescritura, clasificación
llama3.2:3b 2.0 GB 128K 8 GB Solo texto Sí / No Respuestas instantáneas, autocompletado, tareas simples en CPU
qwen3.5:4b 3.4 GB 256K 8–12 GB Texto + imagen Sí / Sí El mejor punto de partida para la mayoría de la gente
gemma4:e2b-it-qat 4.3 GB 128K 8–12 GB Texto + imagen Sí / Sí Redacción y tono natural en equipos modestos
qwen3.5:9b 6.6 GB 256K 16 GB Texto + imagen Sí / Sí El mejor equilibrio calidad/peso de toda la lista
gemma4:12b 7.6 GB 256K 16 GB Texto + imagen Sí / Sí Escritura larga, análisis de documentos, multilingüe
gpt-oss:20b 14 GB 128K 16–24 GB Solo texto Sí / Sí (ajustable) Razonamiento explícito y flujos agénticos
qwen3-coder:30b 19 GB 256K 24 GB Solo texto Sí / No Programación a escala de repositorio (MoE, 3.3B activos)
qwen3.5:27b 17 GB 256K 24 GB Texto + imagen Sí / Sí Calidad tipo "asistente serio" sin depender de la nube
qwen3.6:35b 24 GB 256K 32 GB+ Texto + imagen Sí / Sí Lo mejor que puedes correr en consumo alto
gemma4:31b-it-qat 19 GB 256K 24–32 GB Texto + imagen Sí / Sí Alternativa a Qwen con licencia y tono distintos
glm-ocr 2.2 GB 128K 8 GB Imagen → texto Sí / No OCR de facturas, tablas y documentos escaneados
embeddinggemma:300m 622 MB 2K 8 GB Embeddings Búsqueda semántica y RAG sobre tus archivos
nomic-embed-text 274 MB 8K 8 GB Embeddings El clásico de RAG, rápido y probado

La columna "RAM recomendada" no es el tamaño del archivo: incluye el espacio que necesita el contexto activo y el margen para que tu sistema operativo siga respirando. Más sobre eso en un momento.


Cómo leer esta tabla sin equivocarte

Hay tres números que la gente confunde constantemente, y confundirlos es la razón número uno por la que alguien descarga un modelo y concluye que "los modelos locales son basura".

El tamaño de descarga no es la RAM que consume. Un modelo de 6.6 GB ocupa esos 6.6 GB en memoria más la caché de atención (KV cache), que crece con la longitud de la conversación. Una regla de trabajo razonable: suma un 20–30 % al tamaño del archivo para uso normal, y deja al menos 2 GB libres para el sistema. Si vas a usar contextos muy largos, el margen debe ser mayor.

El número de parámetros ya no predice la velocidad. Un qwen3-coder:30b tiene 30 mil millones de parámetros totales pero solo activa 3.3 mil millones por token, porque es una arquitectura mixture of experts (MoE). Genera texto a velocidad de modelo pequeño y responde con criterio de modelo grande. El precio lo pagas en RAM, no en tiempo de espera. Lo mismo aplica a qwen3.5:35b-a3b y a gemma4:26b-a4b.

La ventana de contexto anunciada no es gratis. Que un modelo soporte 256K tokens no significa que puedas usar 256K en tu laptop. Ese contexto se materializa en memoria. En la práctica, en un equipo de 16 GB trabajarás cómodo entre 8K y 32K tokens, que es más que suficiente para casi cualquier tarea cotidiana.


Qué hace "eficiente" a un modelo en 2026

Vale la pena entender por qué la lista de arriba se ve tan distinta a la de hace dos años.

El cambio más grande es la cuantización consciente del entrenamiento (QAT). En vez de entrenar un modelo en precisión completa y después comprimirlo —perdiendo calidad en el proceso—, los laboratorios ahora entrenan el modelo sabiendo que va a correr en 4 bits. Google publica variantes -it-qat de Gemma 4 que pesan sustancialmente menos que las Q4 tradicionales: gemma4:e4b-it-qat ocupa 6.1 GB frente a los 9.6 GB de la versión estándar, con una degradación mucho menor de la que esperarías. Si vas a usar Gemma 4, empieza siempre por el tag QAT.

El segundo cambio es MXFP4, el formato que OpenAI usa en gpt-oss. Los pesos MoE están cuantizados a 4.25 bits por parámetro desde el post-entrenamiento, y Ollama los ejecuta nativamente sin conversiones adicionales. Es la razón por la que un modelo de 20B cabe en 14 GB y funciona en un equipo de 16 GB de memoria.

El tercero es la proliferación de tamaños intermedios. Qwen 3.5 se publica en 0.8B, 2B, 4B, 9B, 27B, 35B y 122B. Esa granularidad importa: en vez de elegir entre "demasiado tonto" y "no me cabe", puedes encontrar el escalón exacto de tu hardware.

Y el cuarto, en Mac: los tags MLX y nvfp4. Si tienes Apple Silicon, las variantes -mlx están compiladas para el motor de Apple y suelen darte mejor rendimiento por vatio que los GGUF genéricos. qwen3.5:9b-mlx (8.9 GB) es una opción excelente en un MacBook con 16 GB de memoria unificada.


Los modelos, uno por uno

Qwen 3.5 — la familia que deberías instalar primero

Si solo vas a leer un párrafo de esta guía, que sea este. La familia Qwen 3.5 cubre desde 0.8B hasta 122B, todos con 256K de contexto nativo y todos con entrada de texto e imagen. Es multimodal, soporta llamada a herramientas y tiene modo de razonamiento. En la práctica, es el modelo que resuelve el 80 % de lo que la gente le pide a un asistente local.

ollama pull qwen3.5:4b     # 3.4 GB — el punto de entrada
ollama pull qwen3.5:9b     # 6.6 GB — el punto dulce
ollama pull qwen3.5:27b    # 17 GB  — si tu GPU aguanta

El 9b es probablemente la mejor relación calidad/tamaño de todo el catálogo en este momento. Cabe en 16 GB con espacio para trabajar, entiende imágenes, y la diferencia con el 27b en tareas cotidianas —redactar, resumir, traducir, explicar— es notablemente menor de lo que sugiere la diferencia de peso.

Cuándo no usarlo: si tu tarea principal es escribir código agéntico sobre un repositorio grande, qwen3-coder:30b está específicamente entrenado para eso.

Gemma 4 — la alternativa de Google, con audio

Gemma 4 es la respuesta de Google y trae algo que Qwen no tiene: entrada de audio, además de visión, herramientas y razonamiento. Los tamaños van de e2b a 31b, donde las variantes "e" son modelos de parámetros efectivos —diseñados para que el costo computacional real sea menor que el nominal.

ollama pull gemma4:e2b-it-qat   # 4.3 GB
ollama pull gemma4:12b          # 7.6 GB, 256K de contexto
ollama pull gemma4:31b-it-qat   # 19 GB

El gemma4:12b merece atención especial: 7.6 GB para 256K de contexto es una densidad excelente, y Gemma tiende a escribir en un registro más natural y menos "de manual" que otras familias. Para correos, artículos y textos que va a leer un humano, muchos lo prefieren.

Cuándo no usarlo: en tareas de razonamiento matemático o código, Qwen y gpt-oss suelen ir por delante.

gpt-oss:20b — razonamiento con el esfuerzo ajustable

Los modelos de pesos abiertos de OpenAI llegaron con dos características que los hacen distintos: cadena de pensamiento completa y visible, y esfuerzo de razonamiento configurable en tres niveles (bajo, medio, alto). Puedes pedirle que piense poco cuando quieres velocidad, y mucho cuando el problema lo justifica.

ollama pull gpt-oss:20b   # 14 GB, 128K de contexto

Licencia Apache 2.0, sin restricciones copyleft, apto para uso comercial. Es la opción por defecto si tu caso de uso involucra agentes, llamadas a funciones, salidas estructuradas o depuración de razonamiento —porque puedes leer exactamente cómo llegó a su conclusión.

Cuándo no usarlo: no procesa imágenes. Si necesitas multimodalidad, vuelve a Qwen o Gemma.

qwen3-coder:30b — el especialista en código

30B totales, 3.3B activos, 256K de contexto nativo (extrapolable a 1M). Entrenado con 7.5 billones de tokens con 70 % de proporción de código, y con aprendizaje por refuerzo dirigido a la ejecución real de código. Está diseñado para tareas de ingeniería a escala de repositorio, no para autocompletar líneas sueltas.

ollama pull qwen3-coder:30b   # 19 GB
ollama launch opencode --model qwen3-coder

En una GPU de 24 GB es la mejor opción de programación local que existe hoy. Al ser MoE, genera a velocidad de modelo pequeño pese a su tamaño.

Cuándo no usarlo: para preguntas generales es un desperdicio de RAM. Ten un modelo de propósito general cargado en paralelo.

Qwen 3.6 — el escalón de arriba

La generación más reciente de Qwen, disponible en 27b (17 GB) y 35b (24 GB). Sus mejoras se concentran en codificación agéntica —flujos de frontend y razonamiento a nivel de repositorio— y en preservación del razonamiento, una opción que retiene el contexto de pensamiento de mensajes anteriores para no repetir trabajo en conversaciones iterativas.

ollama pull qwen3.6:27b

Si tienes 32 GB o más y quieres lo mejor que puede correr en hardware de consumo, esto es. Si tienes 16 GB, quédate con qwen3.5:9b y no sufras.

Llama 3.2 (1B y 3B) — el peso pluma

Llama 3.2 ya no es lo más nuevo, pero sigue siendo relevante por una razón concreta: 1.3 GB y 2.0 GB con soporte de herramientas y 128K de contexto. Es el modelo que dejas cargado permanentemente en una máquina modesta o en un servidor pequeño, el que responde en menos de un segundo, el que corre bien incluso sin GPU.

ollama pull llama3.2:3b   # 2.0 GB
ollama pull llama3.2:1b   # 1.3 GB

Para reescribir un párrafo, clasificar un texto, extraer entidades o generar una respuesta corta, es perfectamente adecuado. Para razonar sobre un problema, no.

glm-ocr — el especialista que casi nadie conoce

Solo 0.9B de parámetros, 2.2 GB de descarga, y hace una cosa extraordinariamente bien: convertir documentos en texto estructurado. Tablas complejas, fórmulas, sellos, documentos con mucho código, layouts difíciles. Tiene modos específicos que se invocan en el propio prompt:

ollama run glm-ocr Text Recognition: ./factura.png
ollama run glm-ocr Table Recognition: ./reporte.png
ollama run glm-ocr Figure Recognition: ./diagrama.png

Si digitalizas facturas, recibos o documentos escaneados con regularidad, este modelo por sí solo justifica tener Ollama instalado.

Los modelos de embeddings — invisibles pero necesarios

Si quieres buscar entre tus propios documentos —"¿dónde mencioné el presupuesto de marzo?"— necesitas un modelo de embeddings, no un chatbot. Son diminutos y hacen un trabajo distinto: convertir texto en vectores para poder compararlo por significado.

ollama pull embeddinggemma:300m      # 622 MB, de Google
ollama pull nomic-embed-text         # 274 MB, el estándar de facto
ollama pull qwen3-embedding:0.6b     # si ya usas la familia Qwen

Ojo con la ventana de contexto aquí: embeddinggemma acepta 2K tokens y nomic-embed-text llega a 8K. Eso condiciona cómo trocear tus documentos —fragmentos de 500 a 1000 tokens funcionan bien con cualquiera de los dos.

Para contenido en español o multilingüe, nomic-embed-text-v2-moe y snowflake-arctic-embed2 están específicamente entrenados para retrieval multilingüe y suelen dar mejores resultados que las versiones solo-inglés.


Qué instalar según tu equipo

8 GB de RAM (sin GPU dedicada o con GPU pequeña)

Este es el escenario más común y el más malinterpretado. Sí funciona, pero tienes que ser disciplinado: un modelo cargado a la vez, cuantización Q4, contexto moderado.

ollama pull qwen3.5:4b       # 3.4 GB — tu modelo principal
ollama pull llama3.2:3b      # 2.0 GB — para respuestas instantáneas
ollama pull glm-ocr          # 2.2 GB — documentos e imágenes
ollama pull nomic-embed-text # embeddings para búsqueda local

La regla de oro en 8 GB: un modelo pequeño en Q4 siempre supera a un modelo grande en Q2. La tentación de forzar un 14B comprimido al extremo termina en respuestas incoherentes. No lo hagas.

16 GB de RAM

Aquí es donde la experiencia empieza a sentirse cómoda de verdad. Puedes correr un modelo de 9–12B con contexto amplio, o mantener dos modelos pequeños cargados simultáneamente para compararlos.

ollama pull qwen3.5:9b       # 6.6 GB — tu caballo de batalla
ollama pull gemma4:12b       # 7.6 GB — para escritura larga
ollama pull gpt-oss:20b      # 14 GB — para razonamiento (uno a la vez)
ollama pull embeddinggemma:300m

Con 16 GB también puedes permitirte subir a cuantización Q5 o Q8 en modelos pequeños, lo que recupera algo de fidelidad de razonamiento a cambio de poca velocidad.

24 GB de VRAM (RTX 4090 / 5090 o similar)

El rango donde los modelos locales dejan de sentirse como un compromiso.

ollama pull qwen3.5:27b      # 17 GB — asistente general serio
ollama pull qwen3-coder:30b  # 19 GB — programación
ollama pull gemma4:31b-it-qat # 19 GB — alternativa multimodal

32 GB o más (incluida memoria unificada en Mac)

ollama pull qwen3.6:35b      # 24 GB — el tope práctico de consumo
ollama pull qwen3.5:35b-a3b  # 24 GB — MoE, más rápido de lo que su tamaño sugiere

En Apple Silicon, prueba primero los tags MLX: qwen3.6:35b-mlx (22 GB) y qwen3.5:27b-mlx (20 GB) están optimizados para el hardware de Apple.


Cuantización, en dos minutos

La cuantización reduce la precisión de los pesos del modelo para que ocupe menos memoria. Es la palanca más importante que tienes, y es donde más gente se equivoca.

Q4_K_M es el estándar. Reduce el consumo alrededor de un 70 % frente a precisión completa con una pérdida de calidad que en tareas cotidianas es difícil de percibir. Si dudas, elige esto. En equipos de 8 GB, no es una opción: es la única opción sensata.

Q8_0 duplica aproximadamente el tamaño frente a Q4 y recupera fidelidad en razonamiento y matemáticas. Tiene sentido en modelos pequeños cuando te sobra memoria —qwen3.5:4b-q8_0 pesa 5.3 GB y es notablemente más sólido que la versión Q4 en tareas de lógica.

QAT (los tags -it-qat de Gemma) es cuantización entrenada, no comprimida a posteriori. Cuando exista, prefiérela sobre la Q4 equivalente.

MXFP4 es el formato nativo de gpt-oss. No tienes que elegir nada: el modelo ya viene así.

MLX / nvfp4 son variantes para Apple Silicon y para GPUs NVIDIA con soporte FP4. Si tu hardware califica, dan mejor rendimiento con el mismo o menor consumo.

La jerarquía práctica de decisión es simple: elige primero el tamaño de modelo que cabe en tu memoria con Q4, y solo después considera subir la cuantización si te sobra espacio. Nunca al revés.


Errores frecuentes que arruinan la experiencia

Poner el contexto al máximo "por si acaso". Configurar 256K de contexto en un equipo de 16 GB llena la memoria con caché vacía y te deja sin espacio para el modelo. Empieza en 8K y sube solo si lo necesitas.

Juzgar un modelo por la primera respuesta. La primera generación incluye el tiempo de carga del modelo en memoria. La segunda es la que representa la velocidad real.

Usar un modelo de chat para búsqueda semántica. Son herramientas distintas. Si quieres buscar en tus documentos, necesitas un modelo de embeddings más una base vectorial, no un chatbot con el documento pegado en el prompt.

Ignorar los tags específicos. ollama pull gemma4 te trae latest, que es e4b a 9.6 GB. gemma4:e4b-it-qat hace prácticamente lo mismo en 6.1 GB. Vale la pena mirar la lista de tags antes de descargar.

No limpiar modelos viejos. Cada experimento deja gigabytes en disco. ollama list te muestra lo que tienes y ollama rm <modelo> lo borra.


Un stack recomendado para empezar hoy

Si quieres una configuración que funcione bien desde el primer día sin pensarlo demasiado, en un equipo de 16 GB:

# Modelo principal: conversación, resúmenes, redacción, imágenes
ollama pull qwen3.5:9b

# Respuestas rápidas y tareas simples
ollama pull llama3.2:3b

# Documentos escaneados, facturas, tablas
ollama pull glm-ocr

# Búsqueda semántica sobre tus archivos
ollama pull embeddinggemma:300m

Son unos 10 GB en disco y cubren la práctica totalidad de lo que una persona hace con un asistente: escribir, resumir, traducir, explicar, leer documentos y encontrar cosas. Cuando alguna de esas tareas se te quede corta, ya sabrás exactamente qué modelo añadir y por qué.


Preguntas frecuentes

¿Cuánta RAM necesito para correr Ollama?

Como mínimo práctico, 8 GB con un modelo de 4B en cuantización Q4 y contexto moderado. Para una experiencia cómoda y sin compromiso, 16 GB te permiten correr modelos de 9–12B. Para uso serio de código o un asistente general de calidad, apunta a 24 GB de VRAM. Recuerda sumar al tamaño del modelo un 20–30 % extra para el contexto y dejar 2 GB libres para el sistema.

¿Cuál es el mejor modelo de Ollama para una laptop de 16 GB?

qwen3.5:9b (6.6 GB). Es multimodal, tiene 256K de contexto, soporta herramientas y razonamiento, y deja suficiente memoria libre para trabajar. Es la mejor relación calidad/peso del catálogo en este momento.

¿Ollama es gratis?

Sí. Ollama es software libre y los modelos que recomienda esta guía tienen licencias permisivas (Apache 2.0, Apache 2.0 derivadas y similares aptas para uso comercial). Lo único que pagas es la electricidad y el hardware.

¿Puedo usar Ollama sin conexión a internet?

Sí. Una vez descargado el modelo con ollama pull, todo el procesamiento ocurre localmente. No se envía nada a la nube, lo que lo hace ideal para datos sensibles, contratos, facturas o trabajo sin conexión.

¿Cuál es la diferencia entre un modelo de chat y uno de embeddings?

Un modelo de chat (como qwen3.5:9b) genera texto a partir de una instrucción. Un modelo de embeddings (como nomic-embed-text o embeddinggemma:300m) convierte texto en vectores numéricos para comparar documentos por significado. Si quieres buscar "¿dónde hablé del presupuesto de marzo?" en tus archivos, necesitas embeddings, no un chatbot.


Lo que realmente cambió

Hace dos años, correr un modelo en local significaba aceptar un asistente claramente inferior a cambio de privacidad. Hoy la ecuación es distinta: para las tareas cotidianas —redactar, resumir, reescribir, clasificar, extraer, traducir— un qwen3.5:9b de 6.6 GB hace un trabajo que la mayoría de la gente no distinguiría del de un servicio en la nube.

La brecha sigue existiendo, pero se ha desplazado hacia arriba: está en razonamiento profundo, en tareas de código muy complejas y en conocimiento del mundo muy actualizado. Todo lo demás ya cabe en tu laptop, funciona sin conexión y no le cuenta nada a nadie.


Todos los tamaños, tags y ventanas de contexto citados provienen del catálogo oficial de Ollama, consultado en agosto de 2026. Los modelos se actualizan con frecuencia: verifica los tags actuales en ollama.com antes de descargar.

Posts Relacionados

Continúa explorando contenido similar que te puede interesar

Los mejores modelos de Ollama para el día a día (guía 2026)