Ver equipos

AI Supercomputers es el portal de IA local del Grupo Ietres.La compra se realiza en nuestras tiendas oficiales. Si una referencia no aparece con stock, consulta la posibilidad de reserva y la siguiente entrada prevista.

Análisis técnico · NVIDIA GB10

NVIDIA DGX Spark: análisis, especificaciones, rendimiento y compra

DGX Spark combina el superchip GB10 Grace Blackwell, 128 GB de memoria unificada coherente y el ecosistema CUDA en un formato compacto. Su valor no consiste en sustituir siempre a una GPU rápida, sino en ejecutar cargas que dejan de caber en la VRAM convencional.

128 GB de memoria unificadaHasta 200B en una unidadEmparejamiento de dos unidades hasta 405B
Compra en nuestras tiendas oficiales

AI Supercomputers te ayuda a elegir; el pedido se completa en una tienda del grupo Ietres

Esta web publica las guías, comparativas y recomendadores. La ficha comercial, la disponibilidad, la reserva y la compra se gestionan en una de nuestras dos tiendas oficiales.

Disponibilidad y reservas. La disponibilidad cambia por referencia. Si una ficha aparece sin stock, consulta la tienda: algunas unidades pueden reservarse o pedirse sobre una próxima entrada. El plazo y las condiciones se confirman antes de comprar.

Ruta de montaje

Qué necesitas antes y cómo sabrás que has terminado

Ejecuta la guía sobre un entorno de prueba. No avances a producción hasta obtener la salida verificable y documentar la reversión.

Antes de empezar

El modelo o workflow que deseas probar, su formato y una medida de memoria en tu equipo actual.

Resultado verificable

Saber si Spark aporta capacidad útil frente a una GPU convencional y qué debes medir antes de comprar.

Hardware relacionado

Compara DGX Spark con ASUS, Lenovo y una GPU de 96 GB

La capacidad coherente es la ventaja central; la velocidad debe medirse con la misma carga.

Dos NVIDIA DGX Spark en el bundle x2
NVIDIA · Bundle x2

DGX Spark Bundle x2

Dos unidades Founders Edition en una única ficha comercial para preparar una pareja compatible. Comprueba en la ficha el contenido exacto y añade el cable QSFP adecuado cuando corresponda.

Compra enTienda Ietres

1 petaFLOPmáximo FP4 para IA, con las condiciones del fabricante
273 GB/sancho de banda de memoria
10 GbEred Ethernet integrada
1,2 kgequipo compacto de sobremesa
Categoría

Qué es DGX Spark y qué problema resuelve

DGX Spark pertenece a la categoría de superordenadores personales de IA: equipos concebidos para desarrollar, ajustar y ejecutar modelos cerca del usuario, con una reserva de memoria superior a la habitual en una tarjeta gráfica de consumo. CPU y GPU comparten un espacio coherente de 128 GB mediante NVLink-C2C, lo que reduce la necesidad de copiar datos entre memorias separadas.

La memoria unificada puede entenderse como una mesa de trabajo común. CPU y GPU acceden al mismo conjunto de datos, aunque eso no convierte toda la memoria en VRAM idéntica a GDDR o HBM. El ancho de banda de 273 GB/s es notable para el formato, pero está por debajo del de muchas GPU discretas. Por eso una GPU con suficiente VRAM suele mantener ventaja de velocidad; Spark prioriza capacidad, coherencia y compatibilidad con CUDA.

La plataforma resulta relevante para RAG con contextos amplios, agentes que mantienen varios componentes residentes, modelos grandes cuantizados, prototipos CUDA y determinados procesos de ajuste. Para modelos pequeños, una estación con GPU puede ser más sencilla y rápida.

Ficha verificada

Especificaciones que cambian la decisión

ElementoConfiguraciónInterpretación práctica
SuperchipNVIDIA GB10 Grace BlackwellGPU Blackwell y CPU Arm de 20 núcleos en un módulo coherente
CPU10 núcleos Cortex-X925 y 10 Cortex-A725Procesamiento de datos, orquestación y tareas de sistema junto a la GPU
Memoria128 GB LPDDR5X, 273 GB/sCapacidad para modelos y contextos que exceden la VRAM de consumo
CómputoHasta 1 petaFLOP FP4 con dispersiónMétrica de IA de baja precisión; no equivale a FP64 científico
GPU6.144 núcleos CUDA y Tensor Cores BlackwellCompatibilidad con CUDA y bibliotecas optimizadas de NVIDIA
AlmacenamientoUnidad NVMe autocifrada; la Founders Edition comercializada incorpora 4 TBEspacio local para modelos, índices y conjuntos de trabajo
Red10 GbE, Wi-Fi 7, Bluetooth 5.4 y ConnectX-7Conectividad de oficina y enlace de alta velocidad entre dos unidades
PuertosCuatro USB-C y HDMI 2.1aPeriféricos, almacenamiento y salida de vídeo
Formato150 × 150 × 50,5 mm; 1,2 kgInstalación directa en un puesto de trabajo
AlimentaciónFuente externa de 240 W; TDP del GB10 de 140 WLa potencia de la fuente no equivale a consumo continuo del sistema

Valores contrastados con la ficha oficial y la documentación técnica de NVIDIA. Las URLs y la fecha de comprobación se incluyen en INFORME-INVESTIGACION.md.

Mediciones publicadas

Rendimiento: separar prefill y generación

En palabras sencillas

Prefill es leer; generación es escribir. En términos cotidianos: el equipo lee del orden de cien páginas en menos de un minuto y escribe una página de respuesta en unos quince segundos con un modelo de 120.000 millones de parámetros — por encima de la velocidad a la que cualquier persona lee. Ejemplo real: pegas un contrato de 40 páginas y la respuesta empieza a aparecer casi de inmediato.

NVIDIA ha publicado mediciones controladas con tamaño de lote uno, entrada de 2.048 tokens y salida de 128 tokens. El prefill mide la lectura inicial del contexto; la generación mide la producción posterior de tokens. Son fases distintas y sus cifras no deben sumarse.

Modelo y configuraciónMotorPrefillGeneración
gpt-oss 20B, MXFP4, una unidadllama.cpp3.670,42 tok/s82,74 tok/s
gpt-oss 120B, MXFP4, una unidadllama.cpp1.725,47 tok/s55,37 tok/s
Qwen 235B, NVFP4, dos unidadesTensorRT-LLM23.477,03 tok/s11,73 tok/s

Estas cifras describen configuraciones concretas. Cambian con el motor, la cuantización, la longitud de contexto, la temperatura, el tamaño de lote, la versión del software y la proporción de capas residentes en el acelerador. Sirven para establecer un orden de magnitud, no como garantía universal.

Las optimizaciones de software también importan. NVIDIA ha documentado mejoras para modelos dispersos, decodificación especulativa y motores adaptados a GB10. La conclusión prudente es que el mismo hardware puede rendir mejor con una pila actualizada y una configuración adecuada, no que cualquier aplicación reciba automáticamente la misma mejora.

Capacidad frente a velocidad

Cuándo 128 GB son la ventaja decisiva

En palabras sencillas

La memoria es el tamaño de la mesa de trabajo, y el modelo debe estar entero encima para trabajar. Una gráfica de 32 GB tiene una mesa excelente pero pequeña; este equipo tiene una mesa de 128 GB. Ejemplo: el modelo abierto de 120B sencillamente no cabe en la gráfica — en el Spark trabaja a diario.

Spark encaja

El modelo ya no cabe en VRAM

Modelos cuantizados grandes, contexto amplio, índices auxiliares y procesos simultáneos pueden necesitar bastante más de 32 o 48 GB. Spark permite mantener una porción mayor del trabajo en memoria coherente.

GPU discreta encaja

El modelo cabe con margen

Cuando pesos, caché KV y contexto caben íntegramente en una GPU rápida, su ancho de banda suele proporcionar menor latencia y mayor generación.

Desarrollo

Necesitas CUDA y un entorno reproducible

DGX OS, contenedores y bibliotecas NVIDIA facilitan prototipos cercanos a una futura infraestructura de producción. Aun así, el despliegue final debe validarse; no es necesariamente idéntico.

Imagen y vídeo

Prioriza VRAM y el flujo concreto

Para ComfyUI, la resolución, el modelo, el lote y los nodos determinan la memoria. Una GPU discreta con suficiente VRAM puede ser más rápida que Spark.

Escala oficial

Dos DGX Spark para modelos de hasta 405B

NVIDIA destaca la conexión de dos sistemas DGX Spark mediante ConnectX para trabajar con modelos de hasta 405.000 millones de parámetros. Este es el límite que debe comunicarse para un único modelo en el emparejamiento oficial.

Más unidades sí pueden aportar capacidad de servicio, pero mediante otras arquitecturas: réplicas para más usuarios, colas de trabajos, evaluación en paralelo, procesamiento por lotes o marcos distribuidos específicos. No es correcto presentar una fila extensa de equipos como si un único modelo se repartiera automáticamente entre todos.

Dos NVIDIA DGX Spark incluidos en el bundle x2Bundle x2

Dos DGX Spark en una ficha

Opción comercial para adquirir la pareja. Confirma el contenido exacto del bundle y el cable QSFP necesario para la receta soportada.

Abrir el bundle x2
NVIDIA DGX SparkUnidad

DGX Spark Founders Edition

Consulta la configuración comercial y el precio cerrado en la ficha.

Abrir la ficha
Cable DAC QSFP para DGX SparkInterconexión

Cable DAC QSFP

Enlace físico para el emparejamiento de dos unidades compatibles.

Abrir la ficha del cable
Planificación

Más capacidad de servicio

Para réplicas, colas y varios equipos, revisa la arquitectura de despliegue horizontal.

Ver clústeres
Comparativa de decisión

DGX Spark frente a otras opciones

PlataformaVentaja principalCondición que debes validar
DGX Spark128 GB coherentes, CUDA y formato integradoAncho de banda inferior al de una GPU discreta rápida
ASUS Ascent GX10La misma base GB10 en otra configuración de fabricanteAlmacenamiento, conexiones, soporte y canal concretos
RTX PRO 6000 96 GBGran ancho de banda y rendimiento de GPU profesionalEl modelo completo y la caché deben caber en 96 GB
GPU de consumoAlta velocidad en modelos que caben en VRAMCapacidad de memoria, refrigeración y límites de uso
DGX Station748 GB coherentes y GB300 Blackwell UltraProyecto, alimentación, operación y presupuesto de otra escala

La comparación directa entre las dos implementaciones GB10 está en DGX Spark frente a ASUS Ascent GX10. Para una carga que supera claramente Spark, consulta el análisis de DGX Station.

Puesta en marcha

De la caja a una estación de IA reproducible

La primera configuración debe producir un inventario, no solo una demostración. Registra referencia, firmware, versión de DGX OS, red, almacenamiento y usuarios. Después valida CUDA y una carga conocida antes de añadir aplicaciones de terceros.

  1. Revisa ubicación y alimentación. Deja ventilación y evita conectar periféricos o adaptadores no previstos durante el diagnóstico inicial.
  2. Completa la configuración del sistema. Crea una cuenta administrativa separada del uso diario y aplica las actualizaciones recomendadas.
  3. Configura red. Utiliza una dirección conocida, DNS y segmentación. No publiques servicios de modelo en Internet.
  4. Comprueba almacenamiento. Separa espacio para modelos, contenedores, datos y copias. Define un umbral de capacidad.
  5. Valida el entorno NVIDIA. Confirma que el sistema reconoce el acelerador y ejecuta un contenedor o ejemplo oficial.
  6. Prueba un modelo pequeño. Mide carga, prefill y generación, y verifica que el proceso utiliza la GPU.
  7. Versiona la configuración. Guarda sistema, runtime, modelo, cuantización y resultados.

Arquitectura ARM64: DGX Spark utiliza una CPU Grace basada en ARM. El software debe disponer de paquetes o contenedores compatibles. Revisa binarios nativos y extensiones CUDA antes de dar por hecho que un entorno x86 se trasladará sin cambios.

128 GB unificados

Calcular qué aporta la memoria coherente a una carga concreta

La ventaja principal es la capacidad: CPU y GPU comparten 128 GB. Esto permite mantener pesos y contexto que superan la VRAM habitual. No significa que toda la memoria esté disponible para el modelo ni que tenga el mismo ancho de banda que una GPU discreta de gama alta.

CargaQué consume memoriaQué medir
Chat LLMPesos, caché KV y runtimeContexto máximo, TTFT y tokens/s
RAGModelo, contexto recuperado y sesionesPrefill, calidad y usuarios simultáneos
AgenteEsquemas, historial y resultados de herramientasPasos, memoria por sesión y latencia total
ImagenCheckpoint, VAE, latentes y nodosPico por resolución y tiempo por imagen
Fine-tuning ligeroPesos, adaptadores, optimizador y activacionesLote, secuencia, tiempo y estabilidad

Cuándo una GPU discreta sigue siendo preferible

Si el modelo y el contexto caben con margen en VRAM, una GPU discreta con mayor ancho de banda suele generar más rápido. Spark no sustituye automáticamente una estación RTX; resuelve otra frontera: capacidad local compacta con CUDA y un entorno integrado.

Cuándo Spark cambia la viabilidad

Cuando una variante necesita más memoria de la disponible en una GPU convencional, la alternativa suele ser descargar a RAM, cuantizar más, reducir contexto o pasar a infraestructura de mayor capacidad. Spark permite mantener una carga mayor dentro del espacio coherente y evita parte de esos compromisos.

Software y contenedores

Reducir incompatibilidades mediante entornos fijados

Utiliza contenedores o entornos virtuales por proyecto. Fija imagen, dependencias y modelo. No instales bibliotecas globales para cada prueba; un cambio de CUDA, PyTorch o extensión puede romper otras cargas.

Para Ollama, confirma que el modelo es local, la ventana efectiva y el procesador mediante ollama ps. Para Open WebUI, deja Ollama en una red interna. Para ComfyUI, separa modelos y nodos personalizados y registra snapshots.

Rendimiento medible

Crear una ficha de benchmark que se pueda comparar

Las cifras publicadas solo son útiles si indican modelo, precisión, motor, contexto y versión. Prefill y generación son fases distintas. Una optimización puede acelerar una de ellas sin cambiar la otra.

  1. Descarga una variante identificable y registra su tamaño.
  2. Reinicia o libera memoria para medir carga en frío.
  3. Ejecuta un prompt corto y otro con el contexto objetivo.
  4. Conserva número de tokens de entrada y salida.
  5. Registra tiempo de carga, prefill, generación y total.
  6. Repite con el modelo residente y calcula variación.
  7. Añade sesiones concurrentes y percentiles.
  8. Comprueba memoria, temperatura y errores durante una prueba sostenida.
Ficha mínima
- equipo y versión de sistema
- motor y versión
- familia, variante y cuantización
- contexto solicitado y efectivo
- tokens de entrada y salida
- tiempo de carga
- tokens/s de prefill y generación
- pico de memoria
- concurrencia y percentil de latencia

No compares el petaFLOP FP4 con FLOPS FP64 científicos. Son precisiones y cargas diferentes. Para una compra, compara el trabajo real que debe terminar el equipo.

Dos unidades

Preparar el emparejamiento para modelos de hasta 405B

NVIDIA destaca el enlace de dos DGX Spark mediante ConnectX para cargas distribuidas y modelos de hasta 405B. Necesitas dos sistemas compatibles, un cable DAC QSFP adecuado y software que reparta el modelo. No es una suma automática para cualquier aplicación.

Hardware

Enlace directo

Comprueba referencia, longitud, puertos y topología. La ficha del cable QSFP para DGX Spark cierra el componente físico.

Software

Motor distribuido

Alinea sistema, contenedor, pesos y configuración en ambos nodos. Utiliza una receta compatible y mide comunicación.

Más de dos unidades se plantean normalmente como flota: réplicas, colas, embeddings, lotes o modelos por función. La guía de clústeres de DGX Spark separa estos patrones.

Uso compartido

Convertir Spark en un servicio interno sin exponer la consola

Usuarios → HTTPS / SSO → aplicación → cola → servidor de modelo
                                      ↘ métricas y límites

Un único Spark puede servir a varias personas si el modelo y la latencia lo permiten. Cuando el problema es cola, añade réplicas o separa cargas; un modelo más grande puede empeorar el servicio.

Decisión de compra

Datos que convierten una consulta comercial en una recomendación técnica

DatoEjemplo de precisión necesaria
ModeloFamilia, tamaño, cuantización y formato
ContextoPrompt, documentos, historial y máximo real
UsuariosSimultáneos, pico y tolerancia de cola
AplicaciónOllama, RAG, agentes, ComfyUI o desarrollo CUDA
RendimientoTiempo hasta respuesta y duración total
DatosUbicación, privacidad, tamaño y actualizaciones
OperaciónEstación individual o servicio administrado
Referencia disponible

NVIDIA DGX Spark Founders Edition

Consulta la referencia exacta y el precio cerrado en la ficha. Para validar el encaje, adjunta modelo, contexto y usuarios.

Ver la ficha de DGX Spark

Una compra técnica requiere una carga concreta

Indica familia de modelo, cuantización, longitud de contexto, número de usuarios y herramientas previstas. Con esos datos se puede decidir entre una GPU, Spark, dos Spark o una estación de mayor capacidad.

Contacto y compra
Del tutorial a la compra

Valida la carga y pasa a la ficha de producto adecuada

Parte del modelo, el contexto, la concurrencia y la latencia que necesitas. Después compara capacidad, velocidad y formato antes de abrir una ficha comercial.

  1. 01

    Define la carga

    Concreta tarea, familia de modelo, contexto, lote y usuarios simultáneos.

    Aclarar el caso de uso →
  2. 02

    Dimensiona memoria

    Compara VRAM, memoria coherente, velocidad y margen de crecimiento.

    Usar el recomendador de hardware →
  3. 03

    Compra en la tienda

    Abre la ficha comercial para consultar configuración, precio cerrado, disponibilidad y condiciones vigentes.

    Contacto y disponibilidad →
Si la carga cabe en VRAM

RTX PRO 6000 · 96 GB

Prioriza una GPU profesional para inferencia, imagen, vídeo o serving cuando el modelo y el contexto caben en sus 96 GB de VRAM.

Ver ficha profesional →
Si todavía no tienes medidas

Recomendador de hardware

Responde cinco preguntas y compara el equipo actual, una GPU NVIDIA, la RTX PRO 6000 y sistemas GB10 como DGX Spark, ASUS Ascent GX10 o Lenovo ThinkStation PGX.

Comparar opciones →

aisupercomputers.es aporta guías y herramientas de decisión. La compra, el precio cerrado en la ficha y el soporte comercial desde España se gestionan en las tiendas del grupo Ietres.

Las reglas de conexión · ¿2, 4, 50, 500 unidades?
Preguntas frecuentes

Respuestas directas

¿Cuántos parámetros admite un DGX Spark?

NVIDIA posiciona una unidad para modelos de hasta 200.000 millones de parámetros. Dos unidades conectadas oficialmente amplían la capacidad hasta modelos de 405.000 millones, siempre que el formato, la precisión y el software utilizado sean compatibles.

¿Un DGX Spark es más rápido que una GPU de sobremesa?

No necesariamente. Una GPU discreta puede generar más rápido cuando el modelo cabe en su VRAM. DGX Spark aporta 128 GB de memoria unificada y empieza a ser especialmente útil cuando el modelo, el contexto o la concurrencia superan esa VRAM.

¿El petaFLOP FP4 equivale al rendimiento científico FP64?

No. La cifra anunciada corresponde a operaciones de IA en FP4 y con las condiciones indicadas por el fabricante. No debe compararse con FLOPS FP64 de cálculo científico.

¿Ollama viene instalado de fábrica?

DGX Spark incorpora DGX OS y el ecosistema de software de NVIDIA. Ollama puede instalarse y utilizarse en el equipo, pero no debe presentarse como una aplicación garantizada de fábrica en todas las imágenes del sistema.

¿Se pueden unir más de dos unidades para un único modelo?

El emparejamiento oficial destacado para un único modelo es de dos unidades, hasta 405B. A partir de ahí, la arquitectura habitual es escalar horizontalmente con réplicas, colas y trabajos distribuidos, no prometer un único modelo repartido de forma transparente entre muchas cajas.

¿Dónde se consulta el precio?

El importe actualizado y las condiciones comerciales se muestran en la ficha de DGX Spark en tienda.ietres, con precio cerrado en la ficha.