Ver equipos

AI Supercomputers es el portal de IA local del Grupo Ietres.La compra se realiza en nuestras tiendas oficiales. Si una referencia no aparece con stock, consulta la posibilidad de reserva y la siguiente entrada prevista.

Guía fundacional

Superordenador personal y mini PC para IA: qué es y cómo elegir

La categoría reúne equipos de sobremesa concebidos para modelos locales, ajuste, RAG y agentes. Su rasgo decisivo suele ser la combinación de memoria amplia, aceleración de IA, interconexión y software, no una única cifra de cómputo.

IA junto al usuarioMemoria como requisito centralDesarrollo y despliegue local
Ruta de montaje

Qué necesitas antes y cómo sabrás que has terminado

Ejecuta la guía sobre un entorno de prueba. No avances a producción hasta obtener la salida verificable y documentar la reversión.

Antes de empezar

Una carga real definida: modelo, contexto, número de usuarios y tiempo objetivo.

Resultado verificable

Poder traducir la carga a memoria, aceleración y tipo de plataforma sin comprar por una cifra aislada.

Hardware relacionado

Ejemplos actuales de superordenador personal para IA

Compara sistemas GB10 y una GPU profesional después de calcular memoria y velocidad.

Definición

Un equipo construido alrededor de la carga de IA

En palabras sencillas

No es "el PC más rápido", igual que una furgoneta no es el coche más rápido: es el vehículo capaz de cargar el paquete completo. Aquí el paquete es el modelo de IA, y esta categoría de equipo existe para que quepan los grandes.

Un superordenador personal de IA es una estación compacta que acerca capacidades antes reservadas a servidores o centros de datos. Su finalidad es ejecutar, adaptar y evaluar modelos junto al usuario o dentro de la red de la organización. Esto reduce transferencias de datos y acelera la iteración, aunque no elimina las obligaciones de seguridad, gobierno y mantenimiento.

La palabra «superordenador» no convierte el equipo en un sustituto de un clúster científico. Describe una nueva categoría comercial y técnica centrada en aceleradores de IA, memoria amplia y herramientas de desarrollo. Por eso hay que leer las precisiones: un petaFLOP en FP4 para IA no equivale a un petaFLOP FP64 de simulación científica.

El ejemplo compacto es NVIDIA DGX Spark, con 128 GB coherentes y GB10. En una escala superior, DGX Station incorpora GB300 y hasta 748 GB coherentes.

Principio central

La memoria es la mesa de trabajo del modelo

Los pesos del modelo, la caché KV, el contexto, los adaptadores, los índices y el propio motor ocupan memoria. Cuando todo cabe en la VRAM de una GPU rápida, esa GPU suele proporcionar el mejor tiempo de respuesta. Cuando deja de caber, aparecen transferencias a RAM o CPU que pueden reducir mucho la velocidad.

La memoria unificada amplía la mesa de trabajo y permite que CPU y GPU compartan un espacio coherente. Esa capacidad no debe confundirse con un ancho de banda ilimitado: LPDDR5X, GDDR7 y HBM3e tienen perfiles distintos. El dimensionamiento correcto considera ambos ejes.

Pesos

Tamaño del modelo

Un mismo modelo ocupa cantidades diferentes según precisión y cuantización. La etiqueta de parámetros no basta para calcular la memoria total.

Contexto

Caché KV

Las conversaciones largas, el código y los documentos reservan memoria adicional. El consumo crece con el contexto y la concurrencia.

Servicio

Usuarios y lote

Varios usuarios simultáneos o un lote mayor elevan la demanda de memoria y cambian el equilibrio entre latencia y capacidad.

Decisión técnica

Seis criterios antes de comprar

  1. Define la familia y el formato del modelo. No dimensionas igual Qwen, Llama, Gemma, DeepSeek-R1 o gpt-oss; tampoco una cuantización ligera y otra de mayor precisión.
  2. Fija el contexto útil. El límite anunciado por una aplicación no implica que resulte eficiente utilizarlo al máximo.
  3. Separa prefill y generación. Leer un documento y producir una respuesta son fases distintas y pueden tener cuellos de botella diferentes.
  4. Cuenta usuarios y procesos. Una sesión individual no representa una oficina, un aula ni una API con trabajos simultáneos.
  5. Comprueba la pila de software. CUDA, controladores, contenedores, Ollama, TensorRT-LLM, llama.cpp o PyTorch deben ser compatibles con la arquitectura.
  6. Incluye operación y seguridad. Copias, actualización, monitorización, permisos, red, retención y recuperación forman parte de la solución.
Familias de hardware

Cuatro formas de ejecutar IA cerca del usuario

TipoPunto fuerteLímite habitual
CPU o equipo existenteValidar el caso con poca inversión inicialMenor velocidad y modelos pequeños o muy cuantizados
GPU de consumo o profesionalGran ancho de banda y baja latenciaLa VRAM marca el tamaño máximo eficiente
Memoria unificada sin CUDACapacidad amplia y facilidad de usoCompatibilidad y rendimiento dependen del ecosistema
Superordenador personal NVIDIAMemoria amplia, CUDA y plataforma integradaEl ancho de banda y el presupuesto deben justificarse por la carga

El recomendador interactivo conserva una regla importante: desarrollo con CUDA no termina en un mini PC sin CUDA, e imagen o vídeo priorizan memoria de GPU.

Aplicaciones

Qué puedes construir

RAG con documentación interna

Busca fragmentos relevantes y los entrega al modelo para responder con contexto. Consulta la guía de RAG para empresa.

Agentes con herramientas

El modelo propone acciones, pero los permisos, validadores y registros deben limitar lo que puede ejecutar. Consulta agentes en local.

Asistentes multiusuario

Open WebUI añade una interfaz compartida, usuarios, permisos y conexión a Ollama u otros proveedores. Consulta la arquitectura propuesta.

Imagen y vídeo por nodos

ComfyUI organiza modelos y operaciones en flujos reproducibles. La memoria necesaria depende de resolución, lote y nodos. Consulta la guía de ComfyUI.

Fundamentos de hardware

Entender CPU, GPU, memoria, almacenamiento y red como un único sistema

La inferencia no depende de una sola cifra. Los pesos deben llegar al acelerador, el contexto se procesa, los tokens se generan y los resultados se sirven a una aplicación. Un cuello de botella en memoria, CPU, disco o red puede ocultar la capacidad de la GPU.

CPU. Prepara datos, ejecuta conectores y coordina el proceso. En RAG y agentes puede dedicar más tiempo a extracción, búsqueda o herramientas que a inferencia.
GPU. Ejecuta operaciones paralelas del modelo. Si los pesos y la caché caben en VRAM, una GPU discreta de gran ancho de banda suele ofrecer la mejor velocidad interactiva.
VRAM. Memoria unida a una GPU discreta. Es rápida y limitada. Cuando falta, parte del modelo puede descargarse a RAM con una pérdida importante de rendimiento.
Memoria unificada. CPU y GPU comparten un espacio coherente. Amplía el tamaño práctico de la carga y evita copias, aunque su rendimiento no se compara solo por capacidad.
Almacenamiento. Guarda modelos, índices, datasets y contenedores. La lectura afecta sobre todo a carga y cambio de modelo; capacidad, IOPS y fiabilidad importan.
Red. Une usuarios, datos y nodos. Para dos sistemas o un servicio multiusuario, latencia, ancho de banda, segmentación y redundancia forman parte del diseño.
Refrigeración. Determina si el equipo mantiene rendimiento durante cargas largas. Un benchmark corto no revela limitaciones térmicas sostenidas.
Software. Controladores, CUDA, framework, cuantización y motor pueden cambiar compatibilidad y velocidad tanto como el hardware.

Por eso «cuántos TOPS» o «cuántos petaFLOPS» no resuelve la compra. Primero define el modelo, la precisión, el contexto y la carga; después comprueba qué componente limita.

Cálculo de memoria

Estimar cuánto cabe y reservar margen para servirlo

pesos aproximados = parámetros × bits / 8
memoria total = pesos + caché KV + buffers + activaciones + margen

La fórmula de pesos es una primera aproximación. El fichero y el runtime añaden metadatos y buffers. La caché KV crece con longitud de contexto, arquitectura, lote y sesiones simultáneas. Una variante que entra en memoria con un prompt corto puede dejar de entrar cuando se añade historial, documentos o herramientas.

PreguntaDato necesarioImpacto
¿Qué modelo?Familia, variante y parámetrosTamaño de pesos y compatibilidad
¿Qué precisión?FP, BF o cuantización exactaMemoria, calidad y velocidad
¿Qué contexto?Tokens reales de entradaCaché KV y tiempo de prefill
¿Cuántos usuarios?Sesiones simultáneas y colaCachés, memoria y latencia
¿Qué salida?Tokens o imágenes por trabajoTiempo de generación
¿Qué herramientas?RAG, visión, agentes, vídeoComponentes y contexto adicionales

Margen operativo

No dimensionas para que una demostración termine una vez. Reserva memoria para el sistema, la interfaz, el runtime y variaciones de carga. Si la configuración funciona solo con todo lo demás cerrado, no está preparada para usuarios ni actualizaciones.

Tipos de carga

Dimensionar de forma distinta chat, RAG, agentes, imagen y ajuste

LLM

Chat y generación

Dominan los pesos, la caché KV y la velocidad por token. Mide prefill y generación por separado.

RAG

Documentos y fuentes

Añade embeddings, búsqueda, reranking y contexto. La calidad de recuperación puede importar más que aumentar el modelo.

Agentes

Herramientas y varios pasos

El contexto crece con esquemas y resultados. La latencia total incluye cada llamada externa.

Imagen

Difusión y nodos

Modelo, resolución, lote, VAE y ControlNet determinan picos de VRAM. Una GPU rápida suele ser prioritaria si el flujo cabe.

Vídeo

Secuencias largas

Fotogramas, resolución y duración elevan memoria y tiempo. Prueba el workflow final, no una imagen aislada.

Fine-tuning

Entrenamiento y adaptadores

Optimizador, activaciones, lote y longitud consumen más que inferencia. LoRA reduce parámetros entrenables, pero no elimina la necesidad de medir.

Mapa de plataformas

Elegir entre equipo actual, GPU discreta, memoria unificada y estación de gran escala

PlataformaFortalezaLímite que debes comprobar
Equipo existenteValidar utilidad sin inversión dedicadaMemoria, velocidad y compatibilidad del acelerador
GPU NVIDIA de consumoBuen rendimiento cuando el modelo cabeVRAM, refrigeración, soporte y uso continuo
RTX PRO 6000 BlackwellGran VRAM, ancho de banda y entorno profesionalConfiguración del servidor, consumo y carga concreta
NVIDIA DGX Spark128 GB unificados, CUDA y formato compactoVelocidad frente a una GPU discreta y compatibilidad ARM64
Dos DGX SparkEmparejamiento oficial para modelos de hasta 405BSoftware compatible y enlace ConnectX
NVIDIA DGX StationHasta 748 GB coherentes y operación de mayor escalaProyecto, alimentación, soporte y carga multiusuario
Flota o servidorRéplicas, colas y alta disponibilidadOrquestación, red, almacenamiento y operación

Capacidad y velocidad son ejes diferentes. Una GPU discreta puede ser claramente más rápida cuando el modelo cabe. DGX Spark empieza a aportar valor donde la VRAM convencional se agota. DGX Station aumenta la escala de memoria y servicio, no convierte todas las cargas en más rápidas por definición.

Prueba de compra

Ejecutar un benchmark que represente el trabajo real

  1. Fija el artefacto. Modelo, cuantización, versión de runtime, prompt, contexto y parámetros.
  2. Separa carga, prefill y generación. El primer arranque, la lectura del contexto y los tokens de salida son fases distintas.
  3. Calienta el sistema. Repite después de que el modelo esté residente y conserva también la medición en frío.
  4. Prueba concurrencia. Uno, varios usuarios y el pico previsto. Registra cola y percentiles, no solo media.
  5. Ejecuta durante suficiente tiempo. Comprueba temperatura, frecuencia, memoria y estabilidad sostenida.
  6. Mide calidad. Una cuantización más rápida no sirve si falla el contrato de la tarea.
  7. Documenta energía y ruido. Forman parte del entorno de uso, especialmente en oficina.
MétricaQué explicaError habitual
Tiempo de cargaCambio o primera apertura del modeloMezclarlo con generación
Tiempo hasta primer tokenExperiencia inicial y prefillComparar prompts de longitud distinta
Tokens por segundoVelocidad de salidaIgnorar cuantización y longitud
Latencia por trabajoTiempo de negocio completoMedir solo la GPU
Pico de memoriaMargen y capacidadMedir sin contexto ni usuarios
Percentil altoExperiencia bajo cargaUtilizar solo promedio
Operación

Diseñar red, almacenamiento, acceso y continuidad antes de compartir el equipo

Un superordenador personal puede ser una estación o un servidor para el equipo. En el segundo caso necesita identidad, HTTPS, segmentación, límites, copias y monitorización. No publiques Ollama, ComfyUI o una consola de administración directamente en Internet.

Si varias aplicaciones comparten el equipo, asigna cuotas y horarios. Un fine-tuning puede expulsar un modelo de chat de memoria; una generación de vídeo puede bloquear la cola interactiva. Separa servicios o planifica recursos.

Árbol de decisión

Una secuencia de compra que evita empezar por la marca del equipo

  1. Demuestra la tarea. Ejecuta un modelo pequeño en el equipo disponible.
  2. Aprueba una familia y variante. Utiliza tus casos, licencia y formato de salida.
  3. Fija contexto y usuarios. Son parte de la memoria, no un detalle posterior.
  4. Mide si cabe. Si entra en VRAM con margen, prioriza una GPU rápida.
  5. Escala memoria. Si no cabe, compara 128 GB de DGX Spark, gran VRAM profesional o la escala de DGX Station.
  6. Escala servicio. Si el problema son usuarios, estudia réplicas y colas en vez de un modelo más grande.
  7. Valida el conjunto. Software, red, almacenamiento, soporte y recuperación.
Recomendación técnica

Trae modelo, contexto, usuarios y tiempo objetivo

Con esos datos se puede comparar una GPU, DGX Spark, dos unidades, RTX PRO o DGX Station sin depender de una cifra comercial aislada.

Empezar el dimensionamiento
Evolución de la categoría

Cómo pasó la IA de una plataforma de centro de datos a un equipo de sobremesa

  1. Plataformas integradas. Las primeras familias DGX reunieron GPU, interconexión y software en sistemas preparados para centros de datos.
  2. Modelos abiertos descargables. La disponibilidad de pesos permitió ejecutar, evaluar y adaptar modelos fuera de servicios cerrados.
  3. Memoria como límite principal. El tamaño de pesos y caché convirtió la capacidad accesible por el acelerador en una decisión tan importante como el cómputo.
  4. Superchips CPU+GPU. La conexión coherente y la memoria compartida hicieron viable una clase de equipos compactos con un entorno CUDA completo.
  5. Escala de estación. DGX Station amplía el mismo objetivo hacia cargas multiusuario y una reserva de memoria muy superior.

La denominación «superordenador personal de IA» describe este cambio de integración y capacidad. No significa que un petaFLOP FP4 sea comparable directamente con el rendimiento FP64 de un superordenador científico. Son precisiones y cargas diferentes.

Mapa de hardware

GPU, memoria unificada y estación: territorios distintos

PlataformaVentajaLímite que debes comprobarUso típico
Equipo actualCoste de entrada mínimo y validación inmediataMemoria, aceleración y estabilidadPrueba de modelo y flujo
GPU NVIDIA discretaGran velocidad cuando todo cabe en VRAMPesos, caché, lote y otros procesosInferencia, imagen, vídeo y entrenamiento
DGX Spark128 GB coherentes, CUDA y formato compactoRendimiento de la carga y compatibilidad ARM64Modelos y contextos que superan la VRAM habitual
ASUS Ascent GX10Mismo superchip GB10 en otra configuración de fabricanteReferencia, almacenamiento, conexiones, soporte y canalAlternativa dentro de la clase GB10
DGX Station748 GB coherentes y administración de estación compartidaProyecto, infraestructura y nivel de servicioCargas grandes, varios usuarios y partición de recursos
Memoria unificada sin CUDACapacidad amplia para runtimes compatiblesSoftware, kernels y herramientas que exigen CUDAChat, experimentación y flujos no dependientes de CUDA

La decisión correcta empieza con una variante de modelo, longitud de contexto, número de usuarios, latencia objetivo y software. Continúa con la guía de DGX Spark, la comparativa con ASUS GX10 o el análisis de DGX Station.

Dimensiona desde el flujo, no desde el nombre del equipo

El modelo, la precisión, el contexto, la concurrencia y el software permiten calcular una plataforma defendible y evitar capacidad insuficiente o sobredimensionada.

Abrir el recomendador
Del tutorial a la compra

Valida la carga y pasa a la ficha de producto adecuada

Parte del modelo, el contexto, la concurrencia y la latencia que necesitas. Después compara capacidad, velocidad y formato antes de abrir una ficha comercial.

  1. 01

    Define la carga

    Concreta tarea, familia de modelo, contexto, lote y usuarios simultáneos.

    Aclarar el caso de uso →
  2. 02

    Dimensiona memoria

    Compara VRAM, memoria coherente, velocidad y margen de crecimiento.

    Usar el recomendador de hardware →
  3. 03

    Compra en la tienda

    Abre la ficha comercial para consultar configuración, precio cerrado, disponibilidad y condiciones vigentes.

    Contacto y disponibilidad →
Si la carga cabe en VRAM

RTX PRO 6000 · 96 GB

Prioriza una GPU profesional para inferencia, imagen, vídeo o serving cuando el modelo y el contexto caben en sus 96 GB de VRAM.

Ver ficha profesional →
Si todavía no tienes medidas

Recomendador de hardware

Responde cinco preguntas y compara el equipo actual, una GPU NVIDIA, la RTX PRO 6000 y sistemas GB10 como DGX Spark, ASUS Ascent GX10 o Lenovo ThinkStation PGX.

Comparar opciones →

aisupercomputers.es aporta guías y herramientas de decisión. La compra, el precio cerrado en la ficha y el soporte comercial desde España se gestionan en las tiendas del grupo Ietres.

Las reglas de conexión · ¿2, 4, 50, 500 unidades?
Preguntas frecuentes

Respuestas directas

¿Qué es un superordenador personal de IA?

Es un equipo de puesto de trabajo diseñado para desarrollar y ejecutar cargas de IA localmente, con gran capacidad de memoria, aceleración especializada y una pila de software orientada a modelos.

¿Es lo mismo que un PC con una GPU potente?

No siempre. Un PC con GPU puede ser más rápido cuando el modelo cabe en VRAM. Un superordenador personal prioriza memoria disponible, coherencia, interconexión y una plataforma integrada para cargas mayores.

¿La memoria unificada es igual que la VRAM?

No. CPU y GPU comparten un espacio coherente, pero la tecnología y el ancho de banda pueden diferir de GDDR o HBM. Debes valorar capacidad y velocidad por separado.

¿Cuánta memoria necesito para IA local?

Depende del tamaño y formato del modelo, la cuantización, el contexto, la caché KV, el lote, los usuarios y los procesos auxiliares. Es recomendable medir el conjunto completo y reservar margen.

¿Un petaFLOP indica cuántos tokens por segundo obtendré?

No. La cifra de cómputo depende de la precisión y otras condiciones. Los tokens por segundo también dependen de memoria, motor, contexto, lote, arquitectura del modelo y software.