Tutorial de compra y puesta en marcha

Qué PC necesitas para Ollama: RAM, GPU, modelos y sistema operativo

Esta guía parte del modelo que quieres ejecutar y termina en una configuración comprensible. Evita comprar por el nombre de la GPU: primero comprueba cuánto ocupa el modelo, qué contexto usarás y si Ollama debe atender a una persona o a toda la oficina.

Windows y LinuxModelos de 4B a 120BRuta directa a hardware
Ollamamodelo → memoria → equipo
Decisión rápida

Qué hacer antes de comprar un PC para Ollama

Instala una variante concreta, ejecuta tus prompts y mira con «ollama ps» cuánto se descarga a CPU. Compra cuando la memoria o el tiempo de respuesta bloqueen el uso.

Paso 1

Empieza por una variante concreta, no por “quiero una IA potente”

La misma familia puede incluir modelos que ocupan 5 GB y otros que superan 100 GB. Para una pyme, el mejor primer modelo es el menor que resuelve la tarea con calidad suficiente.

Uso inicialModelo razonable para probarTamaño habitual en OllamaHardware de partida
Resumir, clasificar, redactarQwen3 8B o Gemma 3 4B3,3–5,2 GBEquipo actual con suficiente RAM o GPU de 8–16 GB
Documentos y razonamiento intermedioQwen3 14B, Gemma 3 12B8,1–9,3 GBGPU de 16 GB o más
Código, análisis y más calidadQwen3 30B/32B, DeepSeek-R1 32B19–20 GBGPU de 24/32 GB con contexto prudente
70B en localLlama 3.3 70B o DeepSeek-R1 70B43 GBGPU profesional de gran VRAM o GB10
Razonamiento grandegpt-oss 120B65 GBRTX PRO 6000 96 GB o GB10 128 GB

Tamaños de modelo tomados de la biblioteca oficial de Ollama. La recomendación de hardware es editorial y se apoya en capacidad de memoria, contexto y margen de ejecución; valida siempre con una prueba real y la estimador de memoria.

Paso 2

Deja margen para el contexto y no llenes la memoria al cien por cien

El archivo del modelo no incluye toda la memoria de ejecución. Ollama necesita caché para la conversación, buffers y procesos auxiliares. Dos usuarios no duplican necesariamente los pesos, pero sí aumentan caché y carga.

Paso 3

Windows para empezar; Linux cuando quieras convertirlo en servicio

Windows

Es la ruta más directa para una persona que quiere instalar, descargar un modelo y probarlo. Mantén los controladores NVIDIA actualizados y comprueba que el modelo utiliza la GPU.

Linux

Encaja mejor en un equipo dedicado, acceso remoto, Docker y servicio permanente. Los sistemas GB10 utilizan Linux Arm64, por lo que debes validar las extensiones y contenedores.

Pasos 4 a 7

Instala, ejecuta y mide antes de comprar

  1. Instala Ollama desde la descarga oficial y reinicia si el instalador lo solicita.
  2. Descarga un modelo manejable: ollama run qwen3:8b.
  3. Prueba una tarea real con un texto representativo de la empresa.
  4. Revisa memoria y aceleración. En NVIDIA, usa nvidia-smi en sistemas compatibles.
  5. Aumenta el contexto solo si lo necesitas. No configures 128K por defecto.
  6. Repite diez veces y registra tiempo de primera respuesta, generación y fallos.
  7. Prueba el siguiente tamaño solo si la calidad no es suficiente.
  8. Compra cuando aparezca un límite medido: memoria, latencia, usuarios o servicio continuo.
Hardware relacionado

Equipos que cubren los saltos habituales de Ollama

Empieza con una GPU si el modelo cabe. Pasa a 96 GB o 128 GB cuando los pesos, el contexto y el margen ya no entran.

Comprobación final

La ficha que debes guardar antes de decidir el equipo

Modelo y formato

Nombre exacto, etiqueta, tamaño de descarga y cuantización.

Carga

Tokens de entrada, salida, contexto configurado y usuarios simultáneos.

Resultado

Memoria máxima, tiempo hasta la primera palabra, velocidad de generación y calidad.

Fuentes técnicas y criterio editorial

Las especificaciones, funciones y límites descritos se contrastan con documentación primaria de Ollama y modelos. Las recomendaciones de compra, el orden de los pasos y los márgenes de planificación son criterios editoriales de AI Supercomputers: deben confirmarse con la versión instalada y una prueba real.

Documentación oficial de Ollama · Biblioteca oficial de modelos · Contexto y comprobación de offload

Preguntas frecuentes

Respuestas directas antes de elegir hardware

¿Cuánta RAM necesita un PC para Ollama?

Depende del modelo y de cuánto quieras descargar en la GPU. Para una primera prueba, 16 GB de RAM permiten modelos pequeños; para trabajo habitual, 32 o 64 GB dan más margen. Los modelos grandes requieren mucha más memoria o una GPU/plataforma dedicada.

¿Es mejor Windows o Linux para Ollama?

Windows es más sencillo para un puesto individual. Linux suele facilitar Docker, servicio continuo, acceso remoto y automatización. La elección cambia cuando el equipo pasa de prueba personal a servicio compartido.

¿Una RTX 5090 ejecuta Llama 3.3 70B?

La RTX 5090 dispone de 32 GB de VRAM y la descarga habitual de Llama 3.3 70B ocupa 43 GB, antes de contexto y buffers. Puede usar offload parcial, pero no cabe completamente en su VRAM en esa configuración.

¿Qué equipo elegir para gpt-oss 120B?

La descarga de Ollama ocupa 65 GB. Una RTX PRO 6000 de 96 GB o un sistema GB10 de 128 GB ofrecen margen; la decisión entre ambos depende de velocidad, formato y software.

Hardware relacionado

Pasa de la estimación a una ficha real

Compara capacidad, velocidad y formato. La cifra de memoria es un filtro inicial; la carga real termina de decidir.