Windows
Es la ruta más directa para una persona que quiere instalar, descargar un modelo y probarlo. Mantén los controladores NVIDIA actualizados y comprueba que el modelo utiliza la GPU.
Esta guía parte del modelo que quieres ejecutar y termina en una configuración comprensible. Evita comprar por el nombre de la GPU: primero comprueba cuánto ocupa el modelo, qué contexto usarás y si Ollama debe atender a una persona o a toda la oficina.
Instala una variante concreta, ejecuta tus prompts y mira con «ollama ps» cuánto se descarga a CPU. Compra cuando la memoria o el tiempo de respuesta bloqueen el uso.
La misma familia puede incluir modelos que ocupan 5 GB y otros que superan 100 GB. Para una pyme, el mejor primer modelo es el menor que resuelve la tarea con calidad suficiente.
| Uso inicial | Modelo razonable para probar | Tamaño habitual en Ollama | Hardware de partida |
|---|---|---|---|
| Resumir, clasificar, redactar | Qwen3 8B o Gemma 3 4B | 3,3–5,2 GB | Equipo actual con suficiente RAM o GPU de 8–16 GB |
| Documentos y razonamiento intermedio | Qwen3 14B, Gemma 3 12B | 8,1–9,3 GB | GPU de 16 GB o más |
| Código, análisis y más calidad | Qwen3 30B/32B, DeepSeek-R1 32B | 19–20 GB | GPU de 24/32 GB con contexto prudente |
| 70B en local | Llama 3.3 70B o DeepSeek-R1 70B | 43 GB | GPU profesional de gran VRAM o GB10 |
| Razonamiento grande | gpt-oss 120B | 65 GB | RTX PRO 6000 96 GB o GB10 128 GB |
Tamaños de modelo tomados de la biblioteca oficial de Ollama. La recomendación de hardware es editorial y se apoya en capacidad de memoria, contexto y margen de ejecución; valida siempre con una prueba real y la estimador de memoria.
El archivo del modelo no incluye toda la memoria de ejecución. Ollama necesita caché para la conversación, buffers y procesos auxiliares. Dos usuarios no duplican necesariamente los pesos, pero sí aumentan caché y carga.
Es la ruta más directa para una persona que quiere instalar, descargar un modelo y probarlo. Mantén los controladores NVIDIA actualizados y comprueba que el modelo utiliza la GPU.
Encaja mejor en un equipo dedicado, acceso remoto, Docker y servicio permanente. Los sistemas GB10 utilizan Linux Arm64, por lo que debes validar las extensiones y contenedores.
ollama run qwen3:8b.nvidia-smi en sistemas compatibles.Empieza con una GPU si el modelo cabe. Pasa a 96 GB o 128 GB cuando los pesos, el contexto y el margen ya no entran.
Entrada a GB10 con 128 GB unificados y varias capacidades de SSD.
Compra enietres informática
GPU profesional de servidor para velocidad, concurrencia e imagen cuando la carga cabe en 96 GB.
Compra enietres informática
128 GB de memoria unificada para modelos que superan la VRAM habitual.
Compra entienda ietres
Dos unidades en una ficha comercial para cargas distribuidas compatibles.
Compra entienda ietres
Nombre exacto, etiqueta, tamaño de descarga y cuantización.
Tokens de entrada, salida, contexto configurado y usuarios simultáneos.
Memoria máxima, tiempo hasta la primera palabra, velocidad de generación y calidad.
Las especificaciones, funciones y límites descritos se contrastan con documentación primaria de Ollama y modelos. Las recomendaciones de compra, el orden de los pasos y los márgenes de planificación son criterios editoriales de AI Supercomputers: deben confirmarse con la versión instalada y una prueba real.
Documentación oficial de Ollama · Biblioteca oficial de modelos · Contexto y comprobación de offload
Depende del modelo y de cuánto quieras descargar en la GPU. Para una primera prueba, 16 GB de RAM permiten modelos pequeños; para trabajo habitual, 32 o 64 GB dan más margen. Los modelos grandes requieren mucha más memoria o una GPU/plataforma dedicada.
Windows es más sencillo para un puesto individual. Linux suele facilitar Docker, servicio continuo, acceso remoto y automatización. La elección cambia cuando el equipo pasa de prueba personal a servicio compartido.
La RTX 5090 dispone de 32 GB de VRAM y la descarga habitual de Llama 3.3 70B ocupa 43 GB, antes de contexto y buffers. Puede usar offload parcial, pero no cabe completamente en su VRAM en esa configuración.
La descarga de Ollama ocupa 65 GB. Una RTX PRO 6000 de 96 GB o un sistema GB10 de 128 GB ofrecen margen; la decisión entre ambos depende de velocidad, formato y software.
Compara capacidad, velocidad y formato. La cifra de memoria es un filtro inicial; la carga real termina de decidir.
Entrada a GB10 con 128 GB unificados y varias capacidades de SSD.
Compra enietres informática
128 GB de memoria unificada para modelos que superan la VRAM habitual.
Compra entienda ietres
GPU profesional de servidor para velocidad, concurrencia e imagen cuando la carga cabe en 96 GB.
Compra enietres informática
Dos unidades en una ficha comercial para cargas distribuidas compatibles.
Compra entienda ietres