Ver equipos

AI Supercomputers es el portal de IA local del Grupo Ietres.La compra se realiza en nuestras tiendas oficiales. Si una referencia no aparece con stock, consulta la posibilidad de reserva y la siguiente entrada prevista.

Guía de aplicación gráfica

LM Studio: modelos locales, chat con documentos y servidor privado

LM Studio reúne descarga de modelos, chat, documentos y un servidor de API en una aplicación de escritorio. Es una vía cómoda para evaluar IA local, siempre que se controle la variante, la memoria y cualquier exposición a la red.

Operación sin conexión tras descargarServidor localInterfaz para probar modelos
Ruta de montaje

Qué necesitas antes y cómo sabrás que has terminado

Ejecuta la guía sobre un entorno de prueba. No avances a producción hasta obtener la salida verificable y documentar la reversión.

Antes de empezar

Un equipo con memoria suficiente y un caso de prueba que permita comparar modelos.

Resultado verificable

Cargar un modelo, medirlo y exponer una API local sin confundir una prueba de escritorio con un servicio empresarial.

Hardware relacionado

Equipos para LM Studio y modelos locales

La interfaz no elimina el límite de memoria: mide pesos, contexto y velocidad antes de elegir.

Posicionamiento

Una interfaz de escritorio para explorar modelos

En palabras sencillas

LM Studio es la versión "con ventanas y botones" de la IA local: todo con ratón — buscar el modelo, descargarlo, conversar — sin escribir un solo comando. Ideal para la primera semana y para quien no quiere terminal; cuando toque servir la IA a más personas, el relevo natural es Ollama.

LM Studio permite buscar y descargar modelos, cargar una variante cuantizada, conversar, adjuntar documentos y levantar un servidor local. Para una persona que empieza, concentra varias tareas en una interfaz. Para desarrollo, expone APIs y herramientas de línea de comandos.

Puede operar completamente sin conexión una vez que la aplicación, los modelos y los recursos necesarios están disponibles. Esto incluye chat, conversación con documentos y servidor local. La privacidad efectiva depende además de no activar integraciones externas y de proteger los archivos, el historial y la red.

LM Studio no debe describirse como un proyecto de código abierto de forma general. Sus condiciones vigentes permiten uso personal e interno de empresa; revisa siempre las condiciones de la aplicación y la licencia de los pesos que descargues.

Proceso

De la descarga a una prueba reproducible

  1. Instala desde el canal oficial. Verifica el origen y conserva la versión utilizada en tu inventario.
  2. Elige una variante que quepa con margen. Considera pesos, caché, contexto y memoria del sistema.
  3. Revisa la ficha del modelo. Familia, cuantización, contexto recomendado y licencia.
  4. Carga el modelo. Observa la estimación de memoria y evita utilizar toda la capacidad disponible.
  5. Fija una prueba. Mismo prompt, parámetros y conjunto de documentos para comparar variantes.
  6. Comprueba el procesador. Asegúrate de que la aceleración y la descarga a CPU coinciden con lo previsto.
API local

Servir un modelo en localhost

Desde el área de desarrollo, LM Studio puede iniciar un servidor en el propio equipo. También dispone de comandos para arrancarlo y definir puerto. Mantén el enlace en 127.0.0.1 durante las pruebas.

lms server start --port 1234

LM Studio ofrece endpoints compatibles con OpenAI y Anthropic, además de sus propias bibliotecas. «Compatible» no significa que todas las operaciones, esquemas de herramientas, eventos de streaming o códigos de error sean idénticos. Crea pruebas de contrato para la integración.

curl http://127.0.0.1:1234/v1/models

Si necesitas acceso desde la red, la documentación permite enlazar a otra dirección, pero recomienda habilitar autenticación. Añade además TLS mediante una capa frontal, segmentación, límites de entrada y reglas de cortafuegos.

Documentos

Conversar con archivos no sustituye un RAG gobernado

La función de documentos es útil para pruebas individuales. En una empresa hay que distinguir una conversación con archivos de un sistema RAG con permisos, versionado, eliminación, evaluación y fuentes. Un documento cargado por un usuario no debería quedar disponible para otro por defecto.

Prueba personal

Pocos archivos y un usuario

Comprueba extracción, fragmentación, respuesta y citas antes de ampliar.

Producción

Repositorio y permisos

Utiliza una arquitectura con autorización previa a la recuperación, inventario y borrado propagado. Consulta RAG para empresa.

Herramientas

LM Studio, Ollama y Open WebUI

HerramientaPunto fuerteUso habitual
LM StudioAplicación gráfica y servidor local en el puestoEvaluación, demostraciones y desarrollo individual
OllamaServicio, terminal, gestión sencilla e integracionesBackends locales, automatización y despliegues compactos
Open WebUIInterfaz web, usuarios, permisos y conocimiento compartidoAcceso de equipos sobre Ollama u otros proveedores

Las tres herramientas pueden convivir, pero evita duplicar repositorios y modelos sin control. Define cuál gestiona los pesos, cuál expone la API y cuál conserva conversaciones.

Producción

Controles mínimos

Puesta en marcha

Instalar LM Studio y preparar una primera prueba limpia

LM Studio está pensado para explorar modelos desde una aplicación gráfica, pero la facilidad de uso no elimina las decisiones técnicas. La primera sesión debe dejar registrados el sistema, la memoria disponible, la variante exacta, el backend, el contexto y los parámetros. Así podrás repetir el resultado y distinguir una mejora real de un cambio de configuración.

  1. Descarga desde el canal oficial. Verifica el origen del instalador y conserva la versión en tu inventario técnico.
  2. Instala en un perfil controlado. Decide qué usuarios pueden descargar modelos y dónde se almacenarán.
  3. Revisa la detección de hardware. Confirma que la aplicación reconoce el acelerador y el runtime adecuado.
  4. Busca una familia, no solo una etiqueta. Filtra por tarea y elige un tamaño que deje margen para contexto y sistema.
  5. Comprueba licencia y formato. La disponibilidad de un archivo no concede automáticamente derechos de uso comercial.
  6. Carga el modelo con ajustes conservadores. Empieza con contexto moderado, una sola sesión y parámetros reproducibles.
  7. Ejecuta una batería corta. Usa ejemplos propios con respuesta verificable y guarda los resultados.
Antes de cargar

Pesos y cuantización

El tamaño del archivo orienta, pero la memoria de ejecución incluye estructura, contexto y buffers. Compara Q4, Q6 o Q8 con la misma tarea si la calidad es crítica.

Durante la carga

Descarga a CPU

Si el modelo no cabe en el acelerador, parte de la carga puede desplazarse a memoria del sistema. Esto amplía capacidad, pero suele aumentar mucho la latencia.

Durante la prueba

Contexto útil

No selecciones el máximo anunciado por defecto. Elige la ventana mínima que cubra tu caso y mide cómo cambia la memoria.

Interfaz

Qué significa cada ajuste antes de pulsar «cargar»

Modelo local. Archivo de pesos que reside en tu equipo. Su familia, variante y licencia deben quedar identificadas.
GGUF. Formato habitual para inferencia local con runtimes derivados de llama.cpp. Puede contener distintas cuantizaciones.
MLX. Ecosistema optimizado para Apple Silicon. La disponibilidad depende de la variante y del runtime.
GPU offload. Capas o trabajo enviados al acelerador. Más offload suele mejorar velocidad si existe memoria suficiente.
Context length. Máximo de tokens de entrada, historial y salida. Aumentarlo eleva el consumo de caché KV.
Flash Attention. Implementación optimizada de atención disponible en combinaciones compatibles. Debe medirse, no darse por supuesta.
JIT loading. Carga de modelos bajo demanda desde el servidor. Facilita el uso, pero la primera petición puede incluir tiempo de carga.
TTL y auto-evict. Políticas para descargar modelos inactivos y recuperar memoria. Son importantes cuando se prueban varias familias.
Structured output. Respuesta condicionada por un esquema. La aplicación debe validar de nuevo el JSON antes de actuar.
Tool use. Propuesta de llamadas a funciones. El modelo no debe recibir autoridad directa sobre sistemas externos.
Selección de modelos

Buscar, descargar y comparar variantes con un método repetible

El buscador facilita acceder a repositorios de modelos, pero una lista ordenada por popularidad no equivale a una recomendación para tu empresa. Define primero idioma, tarea, longitud de contexto, necesidad de visión o herramientas y licencia aceptable.

FiltroPregunta correctaQué registrar
Familia¿Está orientada a chat, razonamiento, código, visión o embeddings?Nombre de familia y proveedor
Tamaño¿Cabe con margen junto al contexto y al sistema?Parámetros y tamaño de archivo
Cuantización¿La reducción de memoria mantiene la calidad exigida?Formato exacto y resultado de evaluación
Contexto¿El runtime y el modelo sostienen la ventana que utilizarás?Valor cargado y memoria durante la prueba
Licencia¿Permite tu uso, distribución y tratamiento previsto?Texto y versión revisados internamente
Procedencia¿El repositorio y el archivo corresponden al modelo esperado?Autor, hash o identificador disponible
  1. Elige dos o tres candidatos. No descargues una colección completa sin una hipótesis de uso.
  2. Usa el mismo conjunto de prompts. Incluye casos válidos, ambiguos, negativos y adversarios.
  3. Fija parámetros. Temperatura, contexto y formato deben ser equivalentes.
  4. Mide la primera y las siguientes respuestas. Separa carga del modelo, prefill y generación.
  5. Comprueba estabilidad. Repite, cambia el contexto y prueba una segunda sesión.
  6. Elige el menor que cumpla. El margen de memoria suele aportar más valor operativo que un modelo mayor al límite.

Para una selección más amplia por familias y memoria, consulta la guía de modelos de IA local.

Tutorial de documentos

Conversar con archivos: cómo probarlo sin confundirlo con un RAG empresarial

La conversación con documentos permite validar si un modelo entiende tu tipo de contenido. El procedimiento correcto comprueba extracción, fragmentación, recuperación, citas y rechazo. Si la aplicación responde bien a un documento pequeño, todavía falta resolver permisos, versiones, borrado y aislamiento entre usuarios.

  1. Empieza con un documento limpio. Utiliza texto seleccionable y una estructura conocida. Evita comenzar con un escaneo complejo.
  2. Formula preguntas de control. Incluye respuestas presentes, ausentes y repartidas en varias secciones.
  3. Exige evidencia. Pide fragmento, sección o referencia que sustente cada respuesta.
  4. Prueba la negativa. El sistema debe indicar que no encuentra la información en lugar de completarla con conocimiento general.
  5. Cambia la versión del archivo. Comprueba si el contenido anterior sigue influyendo y cómo se elimina.
  6. Revisa el historial. Determina dónde queda guardado y qué usuario puede acceder.
Adecuado

Evaluación individual

Un usuario, pocos archivos, finalidad de prueba, contenido no sensible y eliminación manual controlada.

Necesita arquitectura

Conocimiento de empresa

Múltiples usuarios, repositorio vivo, permisos por documento, auditoría, fuentes y derechos. En ese caso utiliza el patrón descrito en RAG para empresa.

El documento también es entrada no confiable. Puede contener instrucciones dirigidas al modelo. Trátalo como datos, no como autoridad, especialmente si la respuesta puede activar herramientas.

Servidor local

Levantar una API, probar el contrato y decidir quién puede acceder

LM Studio puede servir modelos desde la pestaña de desarrollo o mediante la CLI lms. El servidor local suele escuchar en el puerto 1234. Mantén la interfaz en localhost para las primeras pruebas y solo amplía el acceso cuando exista una capa de seguridad definida.

lms server start --port 1234
curl http://127.0.0.1:1234/v1/models

Probar una conversación compatible con OpenAI

curl http://127.0.0.1:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "<identificador-visible-en-v1-models>",
    "messages": [
      {"role": "system", "content": "Responde con precisión."},
      {"role": "user", "content": "Explica el resultado de la prueba."}
    ],
    "temperature": 0.2
  }'

La respuesta puede incluir métricas de tiempo hasta el primer token y tokens por segundo según el endpoint. Registra además si el modelo estaba cargado. Una primera petición no es comparable con otra que reutiliza pesos residentes.

Lista de controles antes de permitir acceso de red

API compatible no significa idéntica. Valida los campos que utiliza tu aplicación, los formatos de error y el comportamiento ante herramientas. La compatibilidad parcial es suficiente para muchas integraciones, pero debe probarse.

Decisión de arquitectura

Cuándo elegir LM Studio, Ollama u Open WebUI

CasoElección inicialMotivo
Comparar modelos desde un puestoLM StudioInterfaz gráfica, descarga, parámetros y métricas en un solo lugar
Ejecutar un backend compactoOllamaServicio sencillo, CLI, API e integración con automatizaciones
Dar chat a varios usuariosOpen WebUI sobre un proveedorIdentidad, roles, historial, conocimiento y administración
Integrar una aplicación propiaLM Studio u OllamaDepende del contrato de API, runtime, operación y plataforma
RAG con permisos empresarialesArquitectura dedicadaLa interfaz por sí sola no resuelve autorización previa a la recuperación
Automatización de procesosOllama o API de LM Studio más orquestadorEl orquestador controla herramientas, reintentos, permisos y aprobación

No ejecutes varios gestores de modelos por inercia. Puedes duplicar almacenamiento, cargar dos copias del mismo modelo y crear conflictos de puertos. Define cuál es la fuente de inferencia de cada aplicación.

Solución de problemas

Diagnóstico: modelo que no carga, servidor inaccesible o respuestas lentas

SíntomaQué comprobarQué cambiar
El modelo no cargaMemoria estimada, formato y runtimeElige una cuantización menor o reduce contexto
La GPU no se utilizaBackend, controlador y offloadSelecciona el runtime compatible y confirma memoria libre
Primera respuesta muy lentaTiempo de carga del modeloMantén el modelo residente si la memoria lo permite
Las siguientes respuestas empeoranHistorial, contexto y cachéRecorta contexto y reinicia una conversación limpia
/v1/models no respondeServidor iniciado, puerto y direcciónArranca el servidor y prueba desde localhost
Otra máquina no conectaEnlace, cortafuegos y autenticaciónNo abras el puerto sin proxy, TLS y control de origen
JSON no cumple el esquemaModelo, prompt y validaciónSolicita salida estructurada y valida de nuevo en código
Un documento produce respuestas falsasExtracción, fragmentos y recuperaciónPrueba preguntas con fuente y separa problema de RAG y generación
De la evaluación al despliegue

El modelo que apruebes determina el equipo que necesitas

LM Studio es especialmente útil para descubrir la carga real. Si el modelo aprobado cabe en la VRAM de una GPU, esa GPU suele ofrecer la mejor velocidad. Si necesita más memoria, DGX Spark amplía la capacidad hasta 128 GB coherentes con CUDA. Para cargas que caben en 96 GB y buscan alto rendimiento, RTX PRO 6000 es la alternativa profesional.

Antes de comprar

Recomendador de hardware

Relaciona tarea, usuarios, privacidad y nivel de inversión para descartar opciones que no encajan.

Abrir el recomendador
NVIDIA DGX Spark128 GB coherentes

NVIDIA DGX Spark

Para modelos y contextos que superan la VRAM convencional y necesitan un entorno NVIDIA integrado.

Ver ficha y precio cerrado
NVIDIA RTX PRO 6000 Blackwell96 GB GDDR7

RTX PRO 6000 Blackwell

Para acelerar inferencia y creación cuando el conjunto de pesos y contexto cabe en la VRAM disponible.

Abrir la ficha profesional

Utiliza LM Studio para comparar antes de desplegar

Prueba varias familias con el mismo conjunto de tareas y conserva la variante más pequeña que cumpla calidad, contexto y licencia.

Elegir modelos
Del tutorial a la compra

Mide esta carga y elige el equipo con datos

Ejecuta una prueba representativa, registra memoria y tiempo, y utiliza el recomendador para comparar una GPU rápida con una plataforma de memoria coherente.

  1. 01

    Define la carga

    Concreta tarea, familia de modelo, contexto, lote y usuarios simultáneos.

    Aclarar el caso de uso →
  2. 02

    Dimensiona memoria

    Compara VRAM, memoria coherente, velocidad y margen de crecimiento.

    Usar el recomendador de hardware →
  3. 03

    Compra en la tienda

    Abre la ficha comercial para consultar configuración, precio cerrado, disponibilidad y condiciones vigentes.

    Contacto y disponibilidad →
Si la carga cabe en VRAM

RTX PRO 6000 · 96 GB

Prioriza una GPU profesional para inferencia, imagen, vídeo o serving cuando el modelo y el contexto caben en sus 96 GB de VRAM.

Ver ficha profesional →
Si todavía no tienes medidas

Recomendador de hardware

Responde cinco preguntas y compara el equipo actual, una GPU NVIDIA, la RTX PRO 6000 y sistemas GB10 como DGX Spark, ASUS Ascent GX10 o Lenovo ThinkStation PGX.

Comparar opciones →

aisupercomputers.es aporta guías y herramientas de decisión. La compra, el precio cerrado en la ficha y el soporte comercial desde España se gestionan en las tiendas del grupo Ietres.

Preguntas frecuentes

Respuestas directas

¿LM Studio puede funcionar sin conexión?

Sí. Después de descargar los modelos y dependencias necesarias, sus funciones principales de chat, documentos y servidor local pueden funcionar sin Internet.

¿LM Studio es lo mismo que Ollama?

No. LM Studio ofrece una aplicación gráfica, gestión de modelos y servidor local. Ollama está más orientado a servicio, terminal e integraciones. Pueden cubrir usos similares con experiencias distintas.

¿Puedo utilizar LM Studio en una empresa?

Sus condiciones vigentes permiten uso personal e interno de empresa. Debes revisar las condiciones, la licencia de cada modelo y las funciones que actives.

¿La API es compatible con OpenAI y Anthropic?

LM Studio ofrece endpoints compatibles, pero cada integración debe validarse. No presupongas paridad completa en todos los campos, herramientas y errores.

¿Es seguro publicar el servidor en la red?

Solo con autenticación, TLS, cortafuegos, límites y segmentación. La propia documentación advierte que enlazar fuera de 127.0.0.1 expone el servidor.

¿Qué hardware necesita?

Depende del modelo y de su cuantización. Como referencia práctica, conviene disponer de memoria suficiente para pesos, contexto y sistema, y de una GPU compatible cuando se busca mayor velocidad.