Una sola unidad medida y una razón concreta para duplicar capacidad o réplicas.
Clústeres de DGX Spark: dos unidades para un modelo y flotas para más trabajo
Dos DGX Spark conectados forman el emparejamiento oficial para modelos de hasta 405B. Una flota mayor se diseña para escalar servicio, colas y trabajos distribuidos; no debe venderse como un único modelo repartido de manera automática entre numerosas unidades.
AI Supercomputers te ayuda a elegir; el pedido se completa en una tienda del grupo Ietres
Esta web publica las guías, comparativas y recomendadores. La ficha comercial, la disponibilidad, la reserva y la compra se gestionan en una de nuestras dos tiendas oficiales.
Disponibilidad y reservas. La disponibilidad cambia por referencia. Si una ficha aparece sin stock, consulta la tienda: algunas unidades pueden reservarse o pedirse sobre una próxima entrada. El plazo y las condiciones se confirman antes de comprar.
Qué necesitas antes y cómo sabrás que has terminado
Ejecuta la guía sobre un entorno de prueba. No avances a producción hasta obtener la salida verificable y documentar la reversión.
Distinguir el emparejamiento oficial de dos unidades del escalado horizontal de servicios.
Continúa con la etapa relacionada y conserva comandos, versiones, métricas y responsables.
Abrir el siguiente paso →Equipos y cables para una pareja soportada
Elige la plataforma y el cable correspondiente; más unidades se diseñan como servicio distribuido.
NVIDIA DGX Spark
Referencia NVIDIA con 128 GB coherentes para modelos y contextos que exceden la VRAM habitual.
Compra enTienda Ietres
DGX Spark Bundle x2
Dos unidades Founders Edition en una única ficha comercial para preparar una pareja compatible. Comprueba en la ficha el contenido exacto y añade el cable QSFP adecuado cuando corresponda.
Compra enTienda Ietres
ASUS Ascent GX10
La misma clase de capacidad GB10 con tres escalones de almacenamiento y chasis ASUS.
Lenovo ThinkStation PGX
Plataforma GB10 de Lenovo con varias referencias; el almacenamiento es la diferencia principal verificada.
RTX PRO 6000 Blackwell
Prioriza velocidad y concurrencia cuando la carga completa cabe en la VRAM disponible.
Compra enIetres Informática
Bundle x2 de NVIDIA DGX Spark
La ficha agrupa dos unidades Founders Edition para quienes ya han validado la necesidad de una pareja. El bundle simplifica el pedido de los dos equipos, pero la conexión de un único modelo compatible sigue necesitando la receta de software soportada y un cable QSFP adecuado.
- Dos unidades DGX Spark Founders Edition.
- 128 GB de memoria coherente por unidad.
- Comprueba en la ficha qué accesorios están incluidos.
- El cable QSFP se consulta por separado cuando no forme parte del paquete.

Dos unidades: un modelo de hasta 405B
Piensa en dos cocineros compartiendo una única receta gigante: solo funciona entre dos, pasándose los ingredientes por una ventanilla rapidísima (el cable QSFP). Es el único caso en el que varios Spark "suman su memoria" para un solo modelo. Ejemplo real: un laboratorio une dos unidades con el cable de medio metro y ejecuta un modelo de 405.000 millones de parámetros sobre una mesa.
NVIDIA documenta la conexión de dos DGX Spark mediante ConnectX-7 para trabajar con modelos de hasta 405.000 millones de parámetros. La capacidad efectiva depende del formato, la cuantización, el contexto y el motor. La interconexión reduce el coste de mover datos entre ambos sistemas, pero no elimina la sobrecarga de distribuir la ejecución.
Esta pareja debe tratarse como una configuración concreta: mismas versiones de sistema y contenedores, modelo compatible, enlace validado, memoria reservada y pruebas de recuperación. El cable DAC QSFP es una parte física; el resultado también depende del software.
Cuatro arquitecturas que sí escalan
A partir de dos unidades no se construye un cocinero gigante: se abren más cocinas iguales. Ocho Sparks son ocho cocinas completas con la misma carta, y un recepcionista (el repartidor de peticiones) va asignando cada cliente a la que está libre. Si una cierra por avería, las otras siete siguen sirviendo. Ejemplo real: una asesoría de 60 personas pregunta a "la IA de la empresa" sin saber — ni necesitar saber — cuál de las ocho unidades le responde.
Más usuarios con el mismo modelo
Cada nodo mantiene una copia del modelo y un balanceador dirige solicitudes. Aumenta capacidad de servicio y tolerancia a fallos, no el tamaño máximo de una sesión.
Trabajos largos y previsibles
Un coordinador asigna lotes de documentos, evaluaciones, embeddings o imágenes al siguiente nodo disponible. La cola permite aplicar prioridades y límites.
Un modelo por función
Una unidad puede servir embeddings, otra razonamiento, otra código y otra visión. El orquestador compone el flujo sin exigir que todos los modelos residan en un solo sistema.
Frameworks explícitos
Entrenamiento o inferencia distribuida requieren un marco que conozca la topología, divida tensores o expertos y gestione comunicaciones. Debe validarse para GB10 y la carga concreta.
¿Cuántos DGX Spark se pueden conectar: 2, 4, 8, 50, 500? Las reglas, claras
1. Para fusionar memoria (un solo modelo más grande): dos unidades como máximo. Se unen entre sí con su cable directo QSFP y alcanzan 405B. Conectar 3 o 4 "en serie" para sumar memoria no existe: la pareja es el límite del emparejamiento oficial.
2. Para sumar capacidad (más usuarios, más trabajo): las unidades que quieras. 4, 8, 50 o 500 — cada una con el modelo completo, conectadas en estrella a un switch (nunca en cadena), con un repartidor delante que publica una sola dirección.
3. La regla para recordar: dos se funden; los demás se suman.
- Un cable de red por unidad. Cada Spark trae un puerto de red estándar (10 GbE): de cada unidad sale un cable de red normal hasta el switch — en estrella, nunca encadenados. N unidades, N cables.
- El switch, a tu red. El switch se conecta al router o a la red de la empresa. Desde ese momento todas las unidades se ven entre sí y son accesibles para los empleados.
- El mismo modelo en cada una. En cada Spark se carga con Ollama el mismo modelo (o distintos modelos por función): copias completas e independientes, listas para responder.
- Un repartidor con una sola dirección. Un pequeño servicio repartidor (por ejemplo LiteLLM, instalado en una de las unidades o en un mini PC) publica una única dirección para toda la empresa y envía cada petición a la unidad más libre. Si una se apaga, reparte entre las restantes y el servicio no se interrumpe.
- El cable QSFP, solo para parejas. La unión especial por QSFP sirve exclusivamente para que dos unidades ejecuten un único modelo de hasta 405B. No se usa para la flota de ocho: la flota va por red normal.
La misma receta en todas las escalas
| Unidades | Cómo se conectan | Qué consiguen | Instalación necesaria |
|---|---|---|---|
| 2 | Cable QSFP directo entre ambas (la única unión "especial") | Un solo modelo de hasta 405B | Una mesa. ~0,5 kW |
| 4 | En estrella a un switch, con repartidor | 4 réplicas: decenas de usuarios con redundancia | Una balda. ~1 kW, enchufe normal |
| 8 | Igual: estrella + repartidor | Servicio de empresa mediana; tolera averías sin corte | Una estantería. ~1,9 kW — menos que un horno doméstico |
| 20 | Estrella a 1-2 switches, mismo repartidor | Aula completa o servicio a cientos de usuarios | Un armario. ~4,8 kW: circuitos dedicados |
| 50 | Varios switches de acceso hacia uno central; colas de trabajos | Granja de procesado masivo y servicio a gran escala | Un rack. ~12 kW: sala con ventilación y SAI serios |
| 500 | El mismo patrón repetido por armarios (topología de centro de datos) | Escala de proveedor de servicios | ~120 kW: instalación profesional de datacenter |
Honestidad de arquitecto: a partir de varias decenas de unidades conviene comparar la flota de Sparks con DGX Station o servidores GPU — más capacidad por caja y menos puntos de gestión. Distribuimos ambas vías y calculamos los dos escenarios con tus cifras.
Ejemplo real: una asesoría de 60 personas monta la flota de ocho. Cada empleado usa el chat de empresa desde su navegador con una única dirección interna; en hora punta las ocho unidades responden en paralelo; un martes falla una, se aparta para revisión y nadie en la oficina lo nota.
La topología no se improvisa
Una pareja directa y una flota tienen necesidades diferentes. Para una flota, la red de gestión, la red de servicio y las interconexiones de cómputo deben diseñarse por separado cuando el proyecto lo requiera. También hay que definir DNS, direcciones, sincronización de tiempo, almacenamiento de modelos y una ruta de actualización.
El balanceador debe conocer la salud del servicio y, si hay conversaciones con estado, mantener afinidad o externalizar ese estado. Los modelos y sus hashes deben estar versionados para que una réplica no responda con una revisión distinta.
Calcula servicio, no solo memoria
| Métrica | Qué mide | Por qué importa |
|---|---|---|
| Tiempo de cola | Espera antes de empezar | Revela falta de réplicas o una prioridad mal definida |
| Prefill | Lectura del contexto | Domina en documentos, código y RAG con entradas largas |
| Generación | Tokens de salida por segundo | Determina la sensación de respuesta durante la producción |
| Concurrencia | Sesiones activas | Puede reducir el rendimiento por usuario aunque aumente el total |
| Memoria libre | Margen tras cargar pesos y caché | Evita fallos al crecer el contexto o el lote |
| Errores y reinicios | Estabilidad por versión | Permite detener despliegues defectuosos |
Empieza con una prueba de carga representativa: distribución real de prompts, contexto, salidas y usuarios. El promedio no basta; utiliza percentiles de latencia y contempla picos.
Seguridad, actualización y recuperación
- Identidad y autorización: ningún endpoint de modelos debe quedar abierto por conveniencia. Aplica autenticación, roles, límites y segmentación de red.
- Versionado: fija imágenes, motores, modelos y configuraciones. Actualiza por etapas y conserva una ruta de reversión.
- Datos: separa modelos, índices, documentos y registros; define copia, cifrado y retención para cada conjunto.
- Secretos: no introduzcas credenciales en prompts ni variables visibles. Utiliza un gestor y permisos mínimos.
- Observabilidad: correlaciona solicitud, modelo, versión, nodo, tiempos y errores sin registrar más datos personales de los necesarios.
- Continuidad: comprueba qué ocurre si cae un nodo, la red, el almacenamiento o el coordinador.
Para una interfaz de equipo, consulta Open WebUI. Para automatizaciones con revisión humana, consulta n8n, Ollama y Outlook. Para tratamiento de datos personales, revisa IA local y RGPD.
Qué significa conectar dos DGX Spark para un modelo de hasta 405B
Dos unidades pueden conectarse mediante la interfaz ConnectX con un cable QSFP compatible para ejecutar cargas distribuidas admitidas por el software. Esto no crea un único espacio de memoria compartida transparente para cualquier aplicación. El framework divide o coordina el trabajo y ambas unidades deben utilizar una configuración compatible.
DGX Spark A ⇄ enlace ConnectX / QSFP ⇄ DGX Spark B
↘ red de gestión y usuarios ↙
almacenamiento / servicio
- Iguala versiones. Sistema, controladores, contenedores, runtime y modelo deben estar alineados.
- Instala el enlace dedicado. Utiliza el puerto y cable compatibles; no lo sustituyas por una red convencional y esperes el mismo comportamiento.
- Configura direccionamiento y prueba conectividad. Verifica enlace, MTU cuando corresponda, latencia y ancho de banda antes del modelo.
- Distribuye el artefacto. Ambos nodos necesitan acceso coherente a pesos y configuración.
- Utiliza un motor que soporte el patrón. La división del modelo depende del framework y de la receta concreta.
- Mide memoria y comunicación. El enlace puede convertirse en parte de la latencia.
- Prueba recuperación. Define qué ocurre si un nodo se reinicia o pierde el enlace.
El límite citado por NVIDIA es una capacidad de plataforma, no una garantía universal. Formato, cuantización, caché, contexto y motor determinan si una variante concreta funciona y con qué velocidad.
Distinguir paralelismo de modelo, réplicas, lotes y funciones especializadas
| Patrón | Qué reparte | Cuándo utilizarlo |
|---|---|---|
| Paralelismo de modelo en dos nodos | Partes de un único modelo | Cuando una unidad no tiene capacidad suficiente y el motor lo soporta |
| Réplicas | Solicitudes entre copias completas | Más usuarios, disponibilidad y menor cola |
| Cola de trabajos | Tareas completas por nodo | Embeddings, transcripción, imagen, vídeo o procesos largos |
| Modelo por función | Chat, embeddings, reranker o visión | Aislar recursos y ciclos de actualización |
| Laboratorio | Entornos por proyecto o equipo | Evitar conflictos de dependencias y modelos |
| Framework distribuido explícito | Cómputo y datos según la aplicación | Solo cuando la carga y el software se han validado |
A partir de dos unidades, la afirmación prudente es escalado horizontal: más réplicas, colas o trabajos. No prometas que diez cajas suman su memoria para un único modelo sin una arquitectura distribuida específica, probada y mantenible.
Separar tráfico de modelo, gestión, datos y usuarios
Un enlace directo entre dos Spark sirve al patrón emparejado. Una flota necesita además red de gestión y servicio. Dibuja cada flujo: sincronización de pesos, consultas de usuarios, acceso a RAG, métricas, copias y administración.
Pesos e índices
Distribuye artefactos desde un repositorio controlado y verifica hashes. Evita que cada nodo descargue variantes diferentes.
API y balanceo
El balanceador conoce salud, cola y modelo cargado. Una respuesta de puerto abierto no prueba que la réplica esté lista.
Administración separada
Limita SSH y consolas a una red de administración con identidad y registros.
Métricas y logs
Recoge telemetría sin mezclarla con prompts o datos sensibles salvo necesidad documentada.
- Diagrama con interfaces, subredes y reglas
- DNS o inventario estable de nodos
- Sin puertos de inferencia expuestos a Internet
- Pruebas de latencia y rendimiento sostenido
- Rutas de copia y actualización separadas
- Capacidad de aislar un nodo sin detener toda la flota
Encolar, enrutar y limitar trabajos según el modelo que está residente
Un balanceador genérico puede distribuir HTTP, pero no conoce memoria, modelo, contexto ni tiempo de carga. Añade una capa que anuncie capacidad y salud. Evita descargar y cargar modelos en cada petición; agrupa trabajos o dedica nodos a modelos estables.
Cliente → autenticación → router de modelos → cola
↘ réplica A
↘ réplica B
↘ lote / trabajo largo
- Identifica el modelo solicitado. Solo rutas aprobadas y variantes existentes.
- Calcula prioridad y límites. Usuario, tamaño de contexto, tipo de carga y cuota.
- Selecciona una réplica saludable. Considera cola, memoria, versión y modelo residente.
- Asigna un identificador. Permite cancelación, seguimiento e idempotencia.
- Establece tiempo máximo. Un trabajo bloqueado no ocupa el nodo indefinidamente.
- Devuelve errores claros. Cola llena, modelo no disponible, contexto excesivo o servicio temporalmente no preparado.
Para lotes, utiliza una cola persistente y trabajadores. Para chat, conserva streaming y límites de sesión. Mezclar vídeo largo con conversación interactiva en la misma cola produce una experiencia impredecible.
Calcular nodos por demanda y nivel de servicio
Empieza por mediciones de una unidad o pareja: tiempo de carga, prefill, generación y memoria. Después utiliza el volumen y la concurrencia. Una media diaria baja puede ocultar un pico que satura el servicio.
trabajos por hora por réplica ≈ 3600 / tiempo medio del trabajo capacidad útil = capacidad medida × factor de margen réplicas necesarias = demanda pico / capacidad útil
| Dato | Por qué importa |
|---|---|
| Distribución de contexto | El prefill y la memoria no crecen igual en todas las consultas |
| Longitud de salida | Determina ocupación del nodo durante generación |
| Usuarios simultáneos | Crea cachés y cola, aunque el total diario sea moderado |
| Modelo residente | Cambiar de modelo añade carga y puede fragmentar capacidad |
| Percentil alto de latencia | Representa la experiencia en picos |
| Disponibilidad requerida | Puede exigir capacidad de reserva y actualizaciones por rotación |
Reserva capacidad para mantenimiento y fallos. Si la carga necesita todas las unidades para cumplir en condiciones normales, no existe tolerancia a una actualización o avería.
Versionar, monitorizar y recuperar una flota homogénea
- Imagen base, controladores y contenedores registrados
- Repositorio único de modelos con hashes
- Inventario de nodo, función, red y versión
- Actualización por grupos, no de toda la flota a la vez
- Pruebas de carga y calidad antes de promover
- Métricas de memoria, temperatura, cola, prefill y generación
- Alertas de diferencia de versión o artefacto
- Copias de configuración, índices y secretos cifrados
- Procedimiento para retirar un nodo comprometido
- Simulación de fallo de red, almacenamiento y modelo
La seguridad debe cubrir los nodos y la capa de acceso. Usa identidades de servicio, credenciales por función y segmentación. Un modelo no necesita permisos para administrar la infraestructura.
Datos necesarios para configurar dos unidades o una flota
| Área | Información |
|---|---|
| Modelo | Familia, variante, cuantización, formato y motor |
| Contexto | Medio, máximo y datos RAG o herramientas |
| Servicio | Usuarios, pico, latencia y disponibilidad |
| Patrón | Pareja para un modelo, réplicas, lotes o funciones |
| Datos | Ubicación, tamaño, permisos y actualización |
| Red | Topología, acceso, segmentación y enlace entre unidades |
| Operación | Monitorización, copias, mantenimiento y soporte |
La pareja oficial necesita el enlace correcto
La ficha del cable QSFP compatible y la del DGX Spark permiten cerrar referencias concretas. Una flota adicional se diseña según servicio, no como una cadena de memoria improvisada.
Qué trabajo puede repartirse entre una flota sin fingir un único modelo gigante
| Carga | Patrón de escala | Unidad de reparto | Métrica principal |
|---|---|---|---|
| Inferencia privada | Réplicas del mismo modelo | Petición o sesión | Latencia, colas y disponibilidad |
| Procesado documental | Trabajadores especializados | Documento o lote | Documentos por hora y reintentos |
| Transcripción | Cola de ficheros de audio | Archivo o segmento | Horas de audio por hora |
| Laboratorio o aula | Asignación por usuario o proyecto | Sesión, contenedor o modelo | Espera y aislamiento |
| Agentes | Servicios por función | Trayectoria o herramienta | Tiempo total, errores y pasos |
| Banco de pruebas | Ejecuciones paralelas reproducibles | Modelo, prompt o checkpoint | Comparabilidad y utilización |
Estas cargas escalan horizontalmente porque cada trabajo puede asignarse a un nodo o servicio. No implican que un modelo cualquiera se reparta de forma transparente entre muchas unidades. Para un solo modelo, el emparejamiento oficial documentado se limita a dos DGX Spark y necesita un motor compatible.
Las capas que convierten varios equipos en un servicio operable
| Capa | Función | Pregunta de aceptación |
|---|---|---|
| Runtime de modelo | Carga pesos, contexto y backend distribuido cuando procede | ¿La variante y la arquitectura están soportadas? |
| Cola y planificador | Asigna trabajos, prioridades, límites y reintentos | ¿Evita duplicados y conserva estado? |
| Enrutador | Selecciona modelo, réplica o función | ¿Conoce capacidad y salud de cada destino? |
| Almacenamiento | Distribuye pesos, índices, entradas y resultados | ¿Versiona y evita copiar datos innecesarios? |
| Identidad y secretos | Autoriza usuarios y servicios | ¿Las credenciales quedan fuera de prompts y contenedores? |
| Observabilidad | Mide GPU, memoria, cola, errores y calidad | ¿Permite relacionar una respuesta con modelo y nodo? |
| Configuración | Reproduce imágenes, variables y despliegues | ¿Puede reinstalarse un nodo sin configuración manual? |
| Recuperación | Retira nodos, revierte y restaura datos | ¿Existe una prueba de fallo y vuelta al servicio? |
Empieza con una pareja o una pequeña flota y fuerza fallos: modelo que no carga, nodo fuera de red, trabajo duplicado, cola saturada y actualización fallida. Un clúster es útil cuando mantiene el servicio bajo estas condiciones, no cuando todos los nodos aparecen en un panel.
Diseña la flota a partir del nivel de servicio
Usuarios, distribución de contexto, modelos, latencia objetivo, ventanas de mantenimiento y recuperación definen el número de nodos y la topología.
Consultar compra y disponibilidadValida la carga y pasa a la ficha de producto adecuada
Parte del modelo, el contexto, la concurrencia y la latencia que necesitas. Después compara capacidad, velocidad y formato antes de abrir una ficha comercial.
- 01
Define la carga
Concreta tarea, familia de modelo, contexto, lote y usuarios simultáneos.
Aclarar el caso de uso → - 02
Dimensiona memoria
Compara VRAM, memoria coherente, velocidad y margen de crecimiento.
Usar el recomendador de hardware → - 03
Compra en la tienda
Abre la ficha comercial para consultar configuración, precio cerrado, disponibilidad y condiciones vigentes.
Contacto y disponibilidad →
RTX PRO 6000 · 96 GB
Prioriza una GPU profesional para inferencia, imagen, vídeo o serving cuando el modelo y el contexto caben en sus 96 GB de VRAM.
Ver ficha profesional →NVIDIA DGX Spark · 128 GB
Considera memoria unificada para desarrollo CUDA y cargas que superan la VRAM de una GPU, aceptando que capacidad no equivale siempre a más velocidad.
Ver ficha y comprar →Recomendador de hardware
Responde cinco preguntas y compara el equipo actual, una GPU NVIDIA, la RTX PRO 6000 y sistemas GB10 como DGX Spark, ASUS Ascent GX10 o Lenovo ThinkStation PGX.
Comparar opciones →aisupercomputers.es aporta guías y herramientas de decisión. La compra, el precio cerrado en la ficha y el soporte comercial desde España se gestionan en las tiendas del grupo Ietres.
Respuestas directas
¿Cuántos DGX Spark pueden ejecutar un único modelo?
El emparejamiento oficial destacado por NVIDIA es de dos unidades para modelos de hasta 405B. Más equipos no implican que un único modelo se reparta automáticamente entre todos.
¿Para qué sirve entonces un clúster con más unidades?
Para réplicas de inferencia, más usuarios, colas de trabajos, evaluación paralela, procesamiento por lotes, laboratorios, aulas y marcos distribuidos que se hayan validado expresamente.
¿Necesito un cable QSFP por pareja?
La topología y el número de enlaces dependen de la arquitectura. Para el emparejamiento directo de dos Spark se utiliza un enlace ConnectX compatible; una flota mayor requiere diseño de red, no una cadena improvisada.
¿Un balanceador sustituye a la memoria compartida?
No. Un balanceador distribuye solicitudes entre réplicas. No suma la memoria de todos los nodos para una única sesión o modelo.
¿Qué debe monitorizarse?
Latencia de cola, prefill, generación, memoria, temperatura, errores, disponibilidad de modelos, versión de contenedores y capacidad de red, además de seguridad y registros.