1. Mira cuánto ocupa el modelo
La biblioteca de Ollama publica el tamaño de cada variante. Ese es el dato inicial que utiliza la herramienta.
Elige el modelo, la longitud de los textos y cuántas personas lo usarán. El resultado te indica con qué capacidad merece la pena empezar a probar, sin prometer que una cifra exacta sirva para todos los equipos.
La descarga del modelo ocupa una cantidad conocida. La herramienta compara ese tamaño con varias capacidades habituales y te dice por dónde empezar. Los textos largos y varios usuarios pueden necesitar memoria adicional, por eso la comprobación final siempre se hace ejecutando el modelo.
La biblioteca de Ollama publica el tamaño de cada variante. Ese es el dato inicial que utiliza la herramienta.
Los textos largos y varias peticiones simultáneas pueden aumentar el consumo. Se muestran para que no los olvides, pero no se convierten a una cifra inventada.
El resultado no asegura que todo quepa. Te indica el primer tamaño de memoria que conviene probar antes de mirar equipos mayores.
No sabe cuántos tokens por segundo obtendrás ni puede garantizar que un modelo funcione igual en todos los programas. La comprobación definitiva consiste en ejecutar tu modelo y tu tarea real.
Las familias y los GB mostrados proceden de las etiquetas de la biblioteca oficial de Ollama. La biblioteca puede cambiar; comprueba siempre la etiqueta que vas a instalar.
Gemma 3 · Qwen3 · Llama 3.3 · DeepSeek-R1 · gpt-oss
Ollama documenta que ampliar el contexto consume más memoria y que la RAM necesaria escala con OLLAMA_NUM_PARALLEL × OLLAMA_CONTEXT_LENGTH.
La correspondencia con capacidades de memoria de 16, 24, 32, 96, 128 o 256 GB es un criterio de clasificación de AI Supercomputers. No suma una cantidad inventada por contexto y no sustituye una medición del modelo con ollama ps.
| Familia y variante | Tamaño de la descarga | Lectura práctica |
|---|---|---|
| Gemma 3 4B | 3,3 GB | Pruebas ligeras, visión y asistentes sencillos. |
| Qwen3 14B | 9,3 GB | La etiqueta publicada es menor que 16 GB, pero el encaje completo depende del contexto, la caché y el backend. |
| gpt-oss 20B | 14 GB | La etiqueta publicada ocupa 14 GB. Comprueba el consumo real antes de asociarla a una capacidad de 16 GB. |
| Llama 3.3 70B | 43 GB | La etiqueta publicada ocupa 43 GB, por encima de 24 y 32 GB antes de sumar el consumo del programa que ejecuta el modelo y el contexto. |
| gpt-oss 120B | 65 GB | La etiqueta publicada ocupa 65 GB. Ese dato permite descartar 24 o 32 GB, pero no garantiza por sí solo el encaje completo en 80, 96 o 128 GB. |
| Qwen3 235B | 142 GB | La etiqueta publicada ocupa 142 GB, por encima de la capacidad de memoria de una unidad GB10 de 128 GB antes de sumar contexto y programa que ejecuta el modelo. |
| DeepSeek-R1 671B | 404 GB | No es el DeepSeek que debe elegir una pyme para empezar; usa una variante destilada. |
Fuentes de tamaños: Llama 3.3, DeepSeek-R1, Qwen3, Gemma 3 y gpt-oss.
Las especificaciones, funciones y límites descritos se contrastan con documentación primaria de Ollama y modelos. Las recomendaciones de compra, el orden de los pasos y los márgenes de planificación son criterios editoriales de AI Supercomputers: deben confirmarse con la versión instalada y una prueba real.
Documentación oficial de Ollama · Biblioteca oficial de modelos · Contexto y comprobación de offload
No. Es una orientación para elegir el primer equipo que merece una prueba. El programa utilizado, la longitud de los textos y el número de usuarios pueden aumentar la memoria necesaria.
Porque una proporción fija puede producir una cifra falsa. Selecciona la etiqueta concreta que vas a instalar y copia su tamaño desde la biblioteca de Ollama o desde «ollama list».
No necesariamente. El programa, el contexto y otros datos de trabajo también ocupan memoria. Carga el modelo y revisa el consumo con «ollama ps».
No. Utiliza la longitud que necesite tu tarea. Un contexto mayor puede consumir más memoria y no mejora por sí solo la respuesta.
Sí, el uso simultáneo puede aumentar la memoria necesaria, aunque el modelo se comparta. Prueba el número real de personas antes de decidir el equipo.
Cuando la carga deja de caber en la VRAM disponible y la capacidad es el límite principal. Si cabe en VRAM y prima la velocidad, una GPU suele ser la primera opción que debes medir.
Compara capacidad, velocidad y formato. La cifra de memoria es un filtro inicial; la carga real termina de decidir.
Entrada a GB10 con 128 GB unificados y varias capacidades de SSD.
Compra enietres informática
128 GB de memoria unificada para modelos que superan la VRAM habitual.
Compra entienda ietres
GPU profesional de servidor para velocidad, concurrencia e imagen cuando la carga cabe en 96 GB.
Compra enietres informática
Dos unidades en una ficha comercial para cargas distribuidas compatibles.
Compra entienda ietres