None
Llama 70B en local, sin comprar a ciegas

Qué PC necesitas para ejecutar Llama 3.3 70B en local

La descarga habitual de Ollama ocupa 43 GB. Esa cifra ya supera la VRAM de una RTX 4090 o RTX 5090 y todavía faltan contexto, buffers y margen. El objetivo es comprobar si necesitas una GPU de 96 GB o un sistema GB10 de 128 GB.

43 GB de descarga128K máximo publicadoPrueba antes de comprar
70Bcapacidad antes que marketing
Decisión rápida

Llama 70B es una decisión de memoria

La etiqueta publicada ronda decenas de GB, pero contexto, caché y programa que ejecuta el modelo añaden consumo. Compara una GPU de gran memoria o GB10 con la misma prueba.

Paso 1

El archivo ocupa 43 GB; la ejecución necesita más

Ollama publica Llama 3.3 70B con una descarga aproximada de 43 GB y un contexto máximo de 128K. No debes reservar el contexto máximo por defecto: la caché aumenta con la longitud efectiva y con cada sesión.

ComponenteQué consumeDecisión práctica
PesosAlrededor de 43 GB en la etiqueta habitualNo caben completos en 24 o 32 GB de VRAM.
ContextoCaché KV según tokens y sesionesEmpieza con 8K o 16K.
Programa que ejecuta el modeloBuffers y memoria de la aplicaciónDeja margen; no planifiques al 100 %.
ConcurrenciaCaché y cálculo por usuarioPrueba uno, después varios.

Consulta la ficha vigente en la biblioteca oficial de Ollama.

Paso 2

Instala Llama 3.3 y limita la primera prueba

ollama run llama3.3

Empieza con una tarea que puedas corregir: resumir un contrato, clasificar incidencias o responder preguntas sobre un texto. No uses información sensible hasta definir permisos y tratamiento.

Paso 3

No configures 128K si el trabajo utiliza 8K

8K

Conversaciones, resúmenes y documentos moderados. Es el punto inicial más fácil de medir.

16K–32K

Documentos más largos y RAG con varios fragmentos. Observa memoria y primera respuesta.

64K–128K

Solo cuando el caso lo exige y la calidad mejora. El contexto largo no sustituye una buena recuperación documental.

Pasos 4 y 5

Mide la misma carga en cada candidato

  1. Guarda el prompt, el texto de entrada y la salida esperada.
  2. Registra memoria máxima y si existe offload a RAM.
  3. Mide tiempo hasta la primera palabra y velocidad de generación.
  4. Repite con 8K y 16K de contexto.
  5. Prueba uno y varios usuarios.
  6. Valora la calidad antes de comprar solo por velocidad.
Paso 6

Qué hardware tiene sentido para Llama 70B

PlataformaEncajeQué comprobar
RTX 4090 · 24 GBNo contiene los 43 GB completosOffload y pérdida de velocidad.
RTX 5090 · 32 GBTampoco contiene el modelo completo habitualPuede mejorar frente a 24 GB, pero sigue existiendo offload.
RTX PRO 6000 · 96 GBCapacidad suficiente en una GPUServidor/chasis compatible, backend y rendimiento real.
GB10 · 128 GBCapacidad unificada suficienteLinux Arm64, programa que ejecuta el modelo y velocidad frente a GPU.
Hardware para Llama 70B

Compara 96 GB de VRAM con 128 GB unificados

Una RTX de 24 o 32 GB no contiene el modelo completo habitual. Mide una GPU profesional de 96 GB y un sistema GB10 de 128 GB con la misma tarea.

RTX PRO 6000 Server Edition
NVIDIA · 96 GB GDDR7

RTX PRO 6000

El modelo de 43 GB cabe íntegramente con margen para contexto en una GPU profesional compatible.

Compra enietres informática

Fuentes técnicas y criterio editorial

Las especificaciones, funciones y límites descritos se contrastan con documentación primaria de Ollama y modelos. Las recomendaciones de compra, el orden de los pasos y los márgenes de planificación son criterios editoriales de AI Supercomputers: deben confirmarse con la versión instalada y una prueba real.

Documentación oficial de Ollama · Biblioteca oficial de modelos · Contexto y comprobación de offload

Preguntas frecuentes

Respuestas antes de elegir el equipo

¿Cuánta memoria ocupa Llama 3.3 70B en Ollama?

La etiqueta habitual publicada en la biblioteca de Ollama ocupa 43 GB. La ejecución necesita además caché KV, buffers y margen para el sistema.

¿Llama 3.3 70B cabe completo en una RTX 5090?

No en la configuración habitual de 43 GB: la RTX 5090 dispone de 32 GB. Puede utilizar offload a RAM, pero una parte del trabajo sale de la GPU y el rendimiento cambia.

¿RTX PRO 6000 o NVIDIA GB10 para Llama 70B?

Ambas ofrecen capacidad suficiente para una cuantización de 43 GB con margen. La RTX PRO 6000 prioriza el trabajo íntegro en una GPU de 96 GB; GB10 aporta 128 GB unificados y exige validar Linux Arm64 y el software.

¿Necesito dos DGX Spark para Llama 70B?

No. Una sola unidad de 128 GB tiene capacidad suficiente para este tamaño. La pareja se reserva para cargas compatibles mayores, más servicio o pruebas distribuidas.

¿Puedo usar Llama 70B con documentos de mi empresa?

Sí, pero debes añadir una capa RAG que recupere documentos autorizados. El modelo no conoce automáticamente los archivos, precios o procedimientos internos.