Calculadora local · no envía datos

¿Cuánta memoria necesito para ejecutar un modelo de IA?

Elige el modelo, la longitud de los textos y cuántas personas lo usarán. El resultado te indica con qué capacidad merece la pena empezar a probar, sin prometer que una cifra exacta sirva para todos los equipos.

Modelos de Ollama verificadosCálculo en el navegadorSin precios ni stock estático
Memoriaorientación inicial para elegir qué equipo probar
Paso 1

Selecciona el modelo que quieres utilizar

La descarga del modelo ocupa una cantidad conocida. La herramienta compara ese tamaño con varias capacidades habituales y te dice por dónde empezar. Los textos largos y varios usuarios pueden necesitar memoria adicional, por eso la comprobación final siempre se hace ejecutando el modelo.

Explicación sencilla

Cómo obtiene la herramienta la orientación

1. Mira cuánto ocupa el modelo

La biblioteca de Ollama publica el tamaño de cada variante. Ese es el dato inicial que utiliza la herramienta.

2. Tiene en cuenta cómo lo vas a usar

Los textos largos y varias peticiones simultáneas pueden aumentar el consumo. Se muestran para que no los olvides, pero no se convierten a una cifra inventada.

3. Propone la primera capacidad que merece una prueba

El resultado no asegura que todo quepa. Te indica el primer tamaño de memoria que conviene probar antes de mirar equipos mayores.

Qué no puede prometer la herramienta.

No sabe cuántos tokens por segundo obtendrás ni puede garantizar que un modelo funcione igual en todos los programas. La comprobación definitiva consiste en ejecutar tu modelo y tu tarea real.

Fuentes primarias

Qué datos son oficiales y qué parte es una regla editorial

Tamaños y contextos publicados

Las familias y los GB mostrados proceden de las etiquetas de la biblioteca oficial de Ollama. La biblioteca puede cambiar; comprueba siempre la etiqueta que vas a instalar.

Gemma 3 · Qwen3 · Llama 3.3 · DeepSeek-R1 · gpt-oss

Contexto y solicitudes paralelas

Ollama documenta que ampliar el contexto consume más memoria y que la RAM necesaria escala con OLLAMA_NUM_PARALLEL × OLLAMA_CONTEXT_LENGTH.

Context length · Concurrencia

Resultado editorial

La correspondencia con capacidades de memoria de 16, 24, 32, 96, 128 o 256 GB es un criterio de clasificación de AI Supercomputers. No suma una cantidad inventada por contexto y no sustituye una medición del modelo con ollama ps.

Comprobar contexto y offload

Tamaños de referencia

Ejemplos que explican por qué el nombre del modelo no basta

Familia y varianteTamaño de la descargaLectura práctica
Gemma 3 4B3,3 GBPruebas ligeras, visión y asistentes sencillos.
Qwen3 14B9,3 GBLa etiqueta publicada es menor que 16 GB, pero el encaje completo depende del contexto, la caché y el backend.
gpt-oss 20B14 GBLa etiqueta publicada ocupa 14 GB. Comprueba el consumo real antes de asociarla a una capacidad de 16 GB.
Llama 3.3 70B43 GBLa etiqueta publicada ocupa 43 GB, por encima de 24 y 32 GB antes de sumar el consumo del programa que ejecuta el modelo y el contexto.
gpt-oss 120B65 GBLa etiqueta publicada ocupa 65 GB. Ese dato permite descartar 24 o 32 GB, pero no garantiza por sí solo el encaje completo en 80, 96 o 128 GB.
Qwen3 235B142 GBLa etiqueta publicada ocupa 142 GB, por encima de la capacidad de memoria de una unidad GB10 de 128 GB antes de sumar contexto y programa que ejecuta el modelo.
DeepSeek-R1 671B404 GBNo es el DeepSeek que debe elegir una pyme para empezar; usa una variante destilada.

Fuentes de tamaños: Llama 3.3, DeepSeek-R1, Qwen3, Gemma 3 y gpt-oss.

Fuentes técnicas y criterio editorial

Las especificaciones, funciones y límites descritos se contrastan con documentación primaria de Ollama y modelos. Las recomendaciones de compra, el orden de los pasos y los márgenes de planificación son criterios editoriales de AI Supercomputers: deben confirmarse con la versión instalada y una prueba real.

Documentación oficial de Ollama · Biblioteca oficial de modelos · Contexto y comprobación de offload

Preguntas frecuentes

Respuestas directas antes de elegir hardware

¿El resultado es una cifra exacta?

No. Es una orientación para elegir el primer equipo que merece una prueba. El programa utilizado, la longitud de los textos y el número de usuarios pueden aumentar la memoria necesaria.

¿Por qué ya no calcula Q8 o BF16 con un multiplicador?

Porque una proporción fija puede producir una cifra falsa. Selecciona la etiqueta concreta que vas a instalar y copia su tamaño desde la biblioteca de Ollama o desde «ollama list».

¿Un modelo de 43 GB cabe siempre en 48 GB de memoria?

No necesariamente. El programa, el contexto y otros datos de trabajo también ocupan memoria. Carga el modelo y revisa el consumo con «ollama ps».

¿Debo usar siempre el contexto máximo?

No. Utiliza la longitud que necesite tu tarea. Un contexto mayor puede consumir más memoria y no mejora por sí solo la respuesta.

¿Varios usuarios necesitan más memoria?

Sí, el uso simultáneo puede aumentar la memoria necesaria, aunque el modelo se comparta. Prueba el número real de personas antes de decidir el equipo.

¿Cuándo conviene GB10 frente a una GPU?

Cuando la carga deja de caber en la VRAM disponible y la capacidad es el límite principal. Si cabe en VRAM y prima la velocidad, una GPU suele ser la primera opción que debes medir.

Hardware relacionado

Pasa de la estimación a una ficha real

Compara capacidad, velocidad y formato. La cifra de memoria es un filtro inicial; la carga real termina de decidir.