8K
Conversaciones, resúmenes y documentos moderados. Es el punto inicial más fácil de medir.
La descarga habitual de Ollama ocupa 43 GB. Esa cifra ya supera la VRAM de una RTX 4090 o RTX 5090 y todavía faltan contexto, buffers y margen. El objetivo es comprobar si necesitas una GPU de 96 GB o un sistema GB10 de 128 GB.
La etiqueta publicada ronda decenas de GB, pero contexto, caché y programa que ejecuta el modelo añaden consumo. Compara una GPU de gran memoria o GB10 con la misma prueba.
Ollama publica Llama 3.3 70B con una descarga aproximada de 43 GB y un contexto máximo de 128K. No debes reservar el contexto máximo por defecto: la caché aumenta con la longitud efectiva y con cada sesión.
| Componente | Qué consume | Decisión práctica |
|---|---|---|
| Pesos | Alrededor de 43 GB en la etiqueta habitual | No caben completos en 24 o 32 GB de VRAM. |
| Contexto | Caché KV según tokens y sesiones | Empieza con 8K o 16K. |
| Programa que ejecuta el modelo | Buffers y memoria de la aplicación | Deja margen; no planifiques al 100 %. |
| Concurrencia | Caché y cálculo por usuario | Prueba uno, después varios. |
Consulta la ficha vigente en la biblioteca oficial de Ollama.
ollama run llama3.3Empieza con una tarea que puedas corregir: resumir un contrato, clasificar incidencias o responder preguntas sobre un texto. No uses información sensible hasta definir permisos y tratamiento.
Conversaciones, resúmenes y documentos moderados. Es el punto inicial más fácil de medir.
Documentos más largos y RAG con varios fragmentos. Observa memoria y primera respuesta.
Solo cuando el caso lo exige y la calidad mejora. El contexto largo no sustituye una buena recuperación documental.
| Plataforma | Encaje | Qué comprobar |
|---|---|---|
| RTX 4090 · 24 GB | No contiene los 43 GB completos | Offload y pérdida de velocidad. |
| RTX 5090 · 32 GB | Tampoco contiene el modelo completo habitual | Puede mejorar frente a 24 GB, pero sigue existiendo offload. |
| RTX PRO 6000 · 96 GB | Capacidad suficiente en una GPU | Servidor/chasis compatible, backend y rendimiento real. |
| GB10 · 128 GB | Capacidad unificada suficiente | Linux Arm64, programa que ejecuta el modelo y velocidad frente a GPU. |
Una RTX de 24 o 32 GB no contiene el modelo completo habitual. Mide una GPU profesional de 96 GB y un sistema GB10 de 128 GB con la misma tarea.

El modelo de 43 GB cabe íntegramente con margen para contexto en una GPU profesional compatible.
Compra enietres informática

Entrada a 128 GB unificados; valida Linux Arm64 y el programa que ejecuta el modelo que utilizarás.
Compra enietres informática

Plataforma de referencia NVIDIA con capacidad suficiente para Llama 70B cuantizado.
Compra entienda ietres

Alternativa GB10 de Lenovo con distintas capacidades de almacenamiento.
Compra enietres informática
Las especificaciones, funciones y límites descritos se contrastan con documentación primaria de Ollama y modelos. Las recomendaciones de compra, el orden de los pasos y los márgenes de planificación son criterios editoriales de AI Supercomputers: deben confirmarse con la versión instalada y una prueba real.
Documentación oficial de Ollama · Biblioteca oficial de modelos · Contexto y comprobación de offload
La etiqueta habitual publicada en la biblioteca de Ollama ocupa 43 GB. La ejecución necesita además caché KV, buffers y margen para el sistema.
No en la configuración habitual de 43 GB: la RTX 5090 dispone de 32 GB. Puede utilizar offload a RAM, pero una parte del trabajo sale de la GPU y el rendimiento cambia.
Ambas ofrecen capacidad suficiente para una cuantización de 43 GB con margen. La RTX PRO 6000 prioriza el trabajo íntegro en una GPU de 96 GB; GB10 aporta 128 GB unificados y exige validar Linux Arm64 y el software.
No. Una sola unidad de 128 GB tiene capacidad suficiente para este tamaño. La pareja se reserva para cargas compatibles mayores, más servicio o pruebas distribuidas.
Sí, pero debes añadir una capa RAG que recupere documentos autorizados. El modelo no conoce automáticamente los archivos, precios o procedimientos internos.