Un equipo con memoria suficiente y un caso de prueba que permita comparar modelos.
LM Studio: modelos locales, chat con documentos y servidor privado
LM Studio reúne descarga de modelos, chat, documentos y un servidor de API en una aplicación de escritorio. Es una vía cómoda para evaluar IA local, siempre que se controle la variante, la memoria y cualquier exposición a la red.
Qué necesitas antes y cómo sabrás que has terminado
Ejecuta la guía sobre un entorno de prueba. No avances a producción hasta obtener la salida verificable y documentar la reversión.
Cargar un modelo, medirlo y exponer una API local sin confundir una prueba de escritorio con un servicio empresarial.
Continúa con la etapa relacionada y conserva comandos, versiones, métricas y responsables.
Abrir el siguiente paso →Equipos para LM Studio y modelos locales
La interfaz no elimina el límite de memoria: mide pesos, contexto y velocidad antes de elegir.
NVIDIA DGX Spark
Referencia NVIDIA con 128 GB coherentes para modelos y contextos que exceden la VRAM habitual.
Compra enTienda Ietres
ASUS Ascent GX10
La misma clase de capacidad GB10 con tres escalones de almacenamiento y chasis ASUS.
Lenovo ThinkStation PGX
Plataforma GB10 de Lenovo con varias referencias; el almacenamiento es la diferencia principal verificada.
RTX PRO 6000 Blackwell
Prioriza velocidad y concurrencia cuando la carga completa cabe en la VRAM disponible.
Compra enIetres Informática
Una interfaz de escritorio para explorar modelos
LM Studio es la versión "con ventanas y botones" de la IA local: todo con ratón — buscar el modelo, descargarlo, conversar — sin escribir un solo comando. Ideal para la primera semana y para quien no quiere terminal; cuando toque servir la IA a más personas, el relevo natural es Ollama.
LM Studio permite buscar y descargar modelos, cargar una variante cuantizada, conversar, adjuntar documentos y levantar un servidor local. Para una persona que empieza, concentra varias tareas en una interfaz. Para desarrollo, expone APIs y herramientas de línea de comandos.
Puede operar completamente sin conexión una vez que la aplicación, los modelos y los recursos necesarios están disponibles. Esto incluye chat, conversación con documentos y servidor local. La privacidad efectiva depende además de no activar integraciones externas y de proteger los archivos, el historial y la red.
LM Studio no debe describirse como un proyecto de código abierto de forma general. Sus condiciones vigentes permiten uso personal e interno de empresa; revisa siempre las condiciones de la aplicación y la licencia de los pesos que descargues.
De la descarga a una prueba reproducible
- Instala desde el canal oficial. Verifica el origen y conserva la versión utilizada en tu inventario.
- Elige una variante que quepa con margen. Considera pesos, caché, contexto y memoria del sistema.
- Revisa la ficha del modelo. Familia, cuantización, contexto recomendado y licencia.
- Carga el modelo. Observa la estimación de memoria y evita utilizar toda la capacidad disponible.
- Fija una prueba. Mismo prompt, parámetros y conjunto de documentos para comparar variantes.
- Comprueba el procesador. Asegúrate de que la aceleración y la descarga a CPU coinciden con lo previsto.
Servir un modelo en localhost
Desde el área de desarrollo, LM Studio puede iniciar un servidor en el propio equipo. También dispone de comandos para arrancarlo y definir puerto. Mantén el enlace en 127.0.0.1 durante las pruebas.
lms server start --port 1234
LM Studio ofrece endpoints compatibles con OpenAI y Anthropic, además de sus propias bibliotecas. «Compatible» no significa que todas las operaciones, esquemas de herramientas, eventos de streaming o códigos de error sean idénticos. Crea pruebas de contrato para la integración.
curl http://127.0.0.1:1234/v1/models
Si necesitas acceso desde la red, la documentación permite enlazar a otra dirección, pero recomienda habilitar autenticación. Añade además TLS mediante una capa frontal, segmentación, límites de entrada y reglas de cortafuegos.
Conversar con archivos no sustituye un RAG gobernado
La función de documentos es útil para pruebas individuales. En una empresa hay que distinguir una conversación con archivos de un sistema RAG con permisos, versionado, eliminación, evaluación y fuentes. Un documento cargado por un usuario no debería quedar disponible para otro por defecto.
Pocos archivos y un usuario
Comprueba extracción, fragmentación, respuesta y citas antes de ampliar.
Repositorio y permisos
Utiliza una arquitectura con autorización previa a la recuperación, inventario y borrado propagado. Consulta RAG para empresa.
LM Studio, Ollama y Open WebUI
| Herramienta | Punto fuerte | Uso habitual |
|---|---|---|
| LM Studio | Aplicación gráfica y servidor local en el puesto | Evaluación, demostraciones y desarrollo individual |
| Ollama | Servicio, terminal, gestión sencilla e integraciones | Backends locales, automatización y despliegues compactos |
| Open WebUI | Interfaz web, usuarios, permisos y conocimiento compartido | Acceso de equipos sobre Ollama u otros proveedores |
Las tres herramientas pueden convivir, pero evita duplicar repositorios y modelos sin control. Define cuál gestiona los pesos, cuál expone la API y cuál conserva conversaciones.
Controles mínimos
- Versionar la aplicación, los modelos y la configuración de carga.
- Revisar licencia de cada modelo y uso permitido.
- Mantener el servidor en localhost salvo necesidad documentada.
- Habilitar autenticación antes de enlazar a la red.
- No activar CORS amplio sin una aplicación y orígenes concretos.
- Limitar contexto, concurrencia y tamaño de archivos.
- Definir copia y borrado para historial, documentos y modelos.
- Separar datos personales de pruebas técnicas cuando sea posible.
Instalar LM Studio y preparar una primera prueba limpia
LM Studio está pensado para explorar modelos desde una aplicación gráfica, pero la facilidad de uso no elimina las decisiones técnicas. La primera sesión debe dejar registrados el sistema, la memoria disponible, la variante exacta, el backend, el contexto y los parámetros. Así podrás repetir el resultado y distinguir una mejora real de un cambio de configuración.
- Descarga desde el canal oficial. Verifica el origen del instalador y conserva la versión en tu inventario técnico.
- Instala en un perfil controlado. Decide qué usuarios pueden descargar modelos y dónde se almacenarán.
- Revisa la detección de hardware. Confirma que la aplicación reconoce el acelerador y el runtime adecuado.
- Busca una familia, no solo una etiqueta. Filtra por tarea y elige un tamaño que deje margen para contexto y sistema.
- Comprueba licencia y formato. La disponibilidad de un archivo no concede automáticamente derechos de uso comercial.
- Carga el modelo con ajustes conservadores. Empieza con contexto moderado, una sola sesión y parámetros reproducibles.
- Ejecuta una batería corta. Usa ejemplos propios con respuesta verificable y guarda los resultados.
Pesos y cuantización
El tamaño del archivo orienta, pero la memoria de ejecución incluye estructura, contexto y buffers. Compara Q4, Q6 o Q8 con la misma tarea si la calidad es crítica.
Descarga a CPU
Si el modelo no cabe en el acelerador, parte de la carga puede desplazarse a memoria del sistema. Esto amplía capacidad, pero suele aumentar mucho la latencia.
Contexto útil
No selecciones el máximo anunciado por defecto. Elige la ventana mínima que cubra tu caso y mide cómo cambia la memoria.
Qué significa cada ajuste antes de pulsar «cargar»
Buscar, descargar y comparar variantes con un método repetible
El buscador facilita acceder a repositorios de modelos, pero una lista ordenada por popularidad no equivale a una recomendación para tu empresa. Define primero idioma, tarea, longitud de contexto, necesidad de visión o herramientas y licencia aceptable.
| Filtro | Pregunta correcta | Qué registrar |
|---|---|---|
| Familia | ¿Está orientada a chat, razonamiento, código, visión o embeddings? | Nombre de familia y proveedor |
| Tamaño | ¿Cabe con margen junto al contexto y al sistema? | Parámetros y tamaño de archivo |
| Cuantización | ¿La reducción de memoria mantiene la calidad exigida? | Formato exacto y resultado de evaluación |
| Contexto | ¿El runtime y el modelo sostienen la ventana que utilizarás? | Valor cargado y memoria durante la prueba |
| Licencia | ¿Permite tu uso, distribución y tratamiento previsto? | Texto y versión revisados internamente |
| Procedencia | ¿El repositorio y el archivo corresponden al modelo esperado? | Autor, hash o identificador disponible |
- Elige dos o tres candidatos. No descargues una colección completa sin una hipótesis de uso.
- Usa el mismo conjunto de prompts. Incluye casos válidos, ambiguos, negativos y adversarios.
- Fija parámetros. Temperatura, contexto y formato deben ser equivalentes.
- Mide la primera y las siguientes respuestas. Separa carga del modelo, prefill y generación.
- Comprueba estabilidad. Repite, cambia el contexto y prueba una segunda sesión.
- Elige el menor que cumpla. El margen de memoria suele aportar más valor operativo que un modelo mayor al límite.
Para una selección más amplia por familias y memoria, consulta la guía de modelos de IA local.
Conversar con archivos: cómo probarlo sin confundirlo con un RAG empresarial
La conversación con documentos permite validar si un modelo entiende tu tipo de contenido. El procedimiento correcto comprueba extracción, fragmentación, recuperación, citas y rechazo. Si la aplicación responde bien a un documento pequeño, todavía falta resolver permisos, versiones, borrado y aislamiento entre usuarios.
- Empieza con un documento limpio. Utiliza texto seleccionable y una estructura conocida. Evita comenzar con un escaneo complejo.
- Formula preguntas de control. Incluye respuestas presentes, ausentes y repartidas en varias secciones.
- Exige evidencia. Pide fragmento, sección o referencia que sustente cada respuesta.
- Prueba la negativa. El sistema debe indicar que no encuentra la información en lugar de completarla con conocimiento general.
- Cambia la versión del archivo. Comprueba si el contenido anterior sigue influyendo y cómo se elimina.
- Revisa el historial. Determina dónde queda guardado y qué usuario puede acceder.
Evaluación individual
Un usuario, pocos archivos, finalidad de prueba, contenido no sensible y eliminación manual controlada.
Conocimiento de empresa
Múltiples usuarios, repositorio vivo, permisos por documento, auditoría, fuentes y derechos. En ese caso utiliza el patrón descrito en RAG para empresa.
El documento también es entrada no confiable. Puede contener instrucciones dirigidas al modelo. Trátalo como datos, no como autoridad, especialmente si la respuesta puede activar herramientas.
Levantar una API, probar el contrato y decidir quién puede acceder
LM Studio puede servir modelos desde la pestaña de desarrollo o mediante la CLI lms. El servidor local suele escuchar en el puerto 1234. Mantén la interfaz en localhost para las primeras pruebas y solo amplía el acceso cuando exista una capa de seguridad definida.
lms server start --port 1234 curl http://127.0.0.1:1234/v1/models
Probar una conversación compatible con OpenAI
curl http://127.0.0.1:1234/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "<identificador-visible-en-v1-models>",
"messages": [
{"role": "system", "content": "Responde con precisión."},
{"role": "user", "content": "Explica el resultado de la prueba."}
],
"temperature": 0.2
}'
La respuesta puede incluir métricas de tiempo hasta el primer token y tokens por segundo según el endpoint. Registra además si el modelo estaba cargado. Una primera petición no es comparable con otra que reutiliza pesos residentes.
Lista de controles antes de permitir acceso de red
- Autenticación activada y secretos fuera del código cliente.
- TLS mediante proxy frontal y certificados mantenidos.
- Cortafuegos con origen limitado, no acceso público general.
- Límites de tamaño, contexto, concurrencia y tiempo.
- Registro de errores y métricas sin conservar prompts sensibles por defecto.
- Pruebas de contrato para chat, respuestas estructuradas, herramientas y streaming.
- Política de actualización y vuelta atrás del runtime y de los modelos.
API compatible no significa idéntica. Valida los campos que utiliza tu aplicación, los formatos de error y el comportamiento ante herramientas. La compatibilidad parcial es suficiente para muchas integraciones, pero debe probarse.
Cuándo elegir LM Studio, Ollama u Open WebUI
| Caso | Elección inicial | Motivo |
|---|---|---|
| Comparar modelos desde un puesto | LM Studio | Interfaz gráfica, descarga, parámetros y métricas en un solo lugar |
| Ejecutar un backend compacto | Ollama | Servicio sencillo, CLI, API e integración con automatizaciones |
| Dar chat a varios usuarios | Open WebUI sobre un proveedor | Identidad, roles, historial, conocimiento y administración |
| Integrar una aplicación propia | LM Studio u Ollama | Depende del contrato de API, runtime, operación y plataforma |
| RAG con permisos empresariales | Arquitectura dedicada | La interfaz por sí sola no resuelve autorización previa a la recuperación |
| Automatización de procesos | Ollama o API de LM Studio más orquestador | El orquestador controla herramientas, reintentos, permisos y aprobación |
No ejecutes varios gestores de modelos por inercia. Puedes duplicar almacenamiento, cargar dos copias del mismo modelo y crear conflictos de puertos. Define cuál es la fuente de inferencia de cada aplicación.
Diagnóstico: modelo que no carga, servidor inaccesible o respuestas lentas
| Síntoma | Qué comprobar | Qué cambiar |
|---|---|---|
| El modelo no carga | Memoria estimada, formato y runtime | Elige una cuantización menor o reduce contexto |
| La GPU no se utiliza | Backend, controlador y offload | Selecciona el runtime compatible y confirma memoria libre |
| Primera respuesta muy lenta | Tiempo de carga del modelo | Mantén el modelo residente si la memoria lo permite |
| Las siguientes respuestas empeoran | Historial, contexto y caché | Recorta contexto y reinicia una conversación limpia |
/v1/models no responde | Servidor iniciado, puerto y dirección | Arranca el servidor y prueba desde localhost |
| Otra máquina no conecta | Enlace, cortafuegos y autenticación | No abras el puerto sin proxy, TLS y control de origen |
| JSON no cumple el esquema | Modelo, prompt y validación | Solicita salida estructurada y valida de nuevo en código |
| Un documento produce respuestas falsas | Extracción, fragmentos y recuperación | Prueba preguntas con fuente y separa problema de RAG y generación |
El modelo que apruebes determina el equipo que necesitas
LM Studio es especialmente útil para descubrir la carga real. Si el modelo aprobado cabe en la VRAM de una GPU, esa GPU suele ofrecer la mejor velocidad. Si necesita más memoria, DGX Spark amplía la capacidad hasta 128 GB coherentes con CUDA. Para cargas que caben en 96 GB y buscan alto rendimiento, RTX PRO 6000 es la alternativa profesional.
Recomendador de hardware
Relaciona tarea, usuarios, privacidad y nivel de inversión para descartar opciones que no encajan.
Abrir el recomendador
128 GB coherentesNVIDIA DGX Spark
Para modelos y contextos que superan la VRAM convencional y necesitan un entorno NVIDIA integrado.
Ver ficha y precio cerrado
96 GB GDDR7RTX PRO 6000 Blackwell
Para acelerar inferencia y creación cuando el conjunto de pesos y contexto cabe en la VRAM disponible.
Abrir la ficha profesionalUtiliza LM Studio para comparar antes de desplegar
Prueba varias familias con el mismo conjunto de tareas y conserva la variante más pequeña que cumpla calidad, contexto y licencia.
Elegir modelosMide esta carga y elige el equipo con datos
Ejecuta una prueba representativa, registra memoria y tiempo, y utiliza el recomendador para comparar una GPU rápida con una plataforma de memoria coherente.
- 01
Define la carga
Concreta tarea, familia de modelo, contexto, lote y usuarios simultáneos.
Aclarar el caso de uso → - 02
Dimensiona memoria
Compara VRAM, memoria coherente, velocidad y margen de crecimiento.
Usar el recomendador de hardware → - 03
Compra en la tienda
Abre la ficha comercial para consultar configuración, precio cerrado, disponibilidad y condiciones vigentes.
Contacto y disponibilidad →
RTX PRO 6000 · 96 GB
Prioriza una GPU profesional para inferencia, imagen, vídeo o serving cuando el modelo y el contexto caben en sus 96 GB de VRAM.
Ver ficha profesional →NVIDIA DGX Spark · 128 GB
Considera memoria unificada para desarrollo CUDA y cargas que superan la VRAM de una GPU, aceptando que capacidad no equivale siempre a más velocidad.
Ver ficha y comprar →Recomendador de hardware
Responde cinco preguntas y compara el equipo actual, una GPU NVIDIA, la RTX PRO 6000 y sistemas GB10 como DGX Spark, ASUS Ascent GX10 o Lenovo ThinkStation PGX.
Comparar opciones →aisupercomputers.es aporta guías y herramientas de decisión. La compra, el precio cerrado en la ficha y el soporte comercial desde España se gestionan en las tiendas del grupo Ietres.
Respuestas directas
¿LM Studio puede funcionar sin conexión?
Sí. Después de descargar los modelos y dependencias necesarias, sus funciones principales de chat, documentos y servidor local pueden funcionar sin Internet.
¿LM Studio es lo mismo que Ollama?
No. LM Studio ofrece una aplicación gráfica, gestión de modelos y servidor local. Ollama está más orientado a servicio, terminal e integraciones. Pueden cubrir usos similares con experiencias distintas.
¿Puedo utilizar LM Studio en una empresa?
Sus condiciones vigentes permiten uso personal e interno de empresa. Debes revisar las condiciones, la licencia de cada modelo y las funciones que actives.
¿La API es compatible con OpenAI y Anthropic?
LM Studio ofrece endpoints compatibles, pero cada integración debe validarse. No presupongas paridad completa en todos los campos, herramientas y errores.
¿Es seguro publicar el servidor en la red?
Solo con autenticación, TLS, cortafuegos, límites y segmentación. La propia documentación advierte que enlazar fuera de 127.0.0.1 expone el servidor.
¿Qué hardware necesita?
Depende del modelo y de su cuantización. Como referencia práctica, conviene disponer de memoria suficiente para pesos, contexto y sistema, y de una GPU compatible cuando se busca mayor velocidad.