Antes de empezar
- Un ordenador con Windows, macOS o Linux
- Espacio libre para descargar al menos un modelo pequeño
- Permisos para instalar aplicaciones
AI Supercomputers es el portal de IA local del grupo ietres.La compra se realiza en nuestras tiendas oficiales. Si una referencia no aparece con stock, consulta la posibilidad de reserva y la siguiente entrada prevista.
La instalación ocupa pocos pasos, pero una puesta en marcha fiable debe verificar el origen del instalador, el modelo descargado, la aceleración, el contexto y la exposición de red.
Al terminar tendrás un modelo respondiendo en tu propio ordenador y sabrás comprobar que no está usando un servicio externo.
No necesitas entender toda la parte técnica para comenzar. Sigue el recorrido básico y abre los apartados avanzados únicamente cuando la primera prueba funcione.
Sigue primero el recorrido corto. Cuando puedas abrir el terminal, descargar un modelo y recibir una respuesta, ya tienes la base. Red, API y servicio compartido vienen después.
Instalar Ollama, descargar un modelo pequeño y ejecutar una pregunta de prueba.
Cambia de equipo si el modelo no cabe, responde demasiado lento o debe atender a más personas.
Servicio en red, automatización, varias versiones y configuración avanzada.
La explicación avanzada continúa debajo. Puedes consultarla cuando el uso, los datos o el número de personas lo justifiquen.
Ejecuta la guía sobre un entorno de prueba. No avances a producción hasta obtener la salida verificable y documentar la reversión.
Permisos de administración, drivers revisados y una ruta de datos con espacio suficiente.
Tener Ollama instalado, acelerado, limitado a la interfaz correcta y probado con un modelo pequeño.
Continúa con la etapa relacionada y conserva comandos, versiones, métricas y responsables.
Abrir el siguiente paso →El carrusel conecta la guía con las plataformas que aparecen cuando el modelo deja de caber o se comparte.
Referencia NVIDIA con 128 GB coherentes para modelos y contextos que exceden la VRAM habitual.
Compra entienda ietres
La misma clase de capacidad GB10 con tres escalones de almacenamiento y chasis ASUS.
Plataforma GB10 de Lenovo con varias referencias; el almacenamiento es la diferencia principal verificada.
Prioriza velocidad y concurrencia cuando la carga completa cabe en la VRAM disponible.
Compra enietres informática
Instalar Ollama es como instalar cualquier programa: descargar, aceptar, siguiente. La única diferencia llega con el primer ollama run: ese comando descarga el modelo (varios GB, una sola vez) — como bajar una película larga que después ves cuantas veces quieras sin volver a descargarla.
127.0.0.1.ollama ps.ollama --version ollama pull <modelo> ollama run <modelo> ollama ps
Si ollama ps muestra CPU cuando esperabas GPU, revisa controlador, compatibilidad, memoria disponible y registros. Un modelo demasiado grande puede ejecutarse parcialmente en CPU.
Descarga la aplicación desde el sitio oficial de Ollama, muévela a Aplicaciones y ejecútala. Después utiliza Terminal con los mismos comandos de descarga, ejecución y comprobación.
ollama --version ollama pull <modelo> ollama run <modelo> ollama ps
En equipos Apple Silicon, la memoria es compartida. No destines toda la capacidad al modelo: macOS, el motor, la caché y otras aplicaciones también la necesitan.
El instalador oficial para Linux se distribuye desde ollama.com. Revisa el script antes de ejecutarlo si tu política interna lo exige y utiliza una cuenta con privilegios controlados.
curl -fsSL https://ollama.com/install.sh | sh ollama --version systemctl status ollama
En un servidor, fija la versión dentro del procedimiento de cambios, documenta el servicio y evita actualizar todos los nodos a la vez. Comprueba también que el usuario del servicio puede acceder al acelerador.
"Local" de verdad significa que ni la pregunta ni el documento salen de tu equipo. Este paso cierra las opciones del programa que sí hablarían con internet — el equivalente a poner el teléfono en modo avión para una conversación privada: todo sigue funcionando, pero nada sale de la habitación.
Ollama admite modelos locales y modelos procesados en su nube. En un entorno donde los datos no deben salir, configura una de las opciones oficiales y reinicia el servicio:
OLLAMA_NO_CLOUD=1
Como alternativa, añade "disable_ollama_cloud": true en el archivo de configuración del servidor. Después comprueba el comportamiento con una cuenta sin acceso a Internet y registra las etiquetas autorizadas.
ollama --version responde y el proceso permanece estable tras reiniciar el equipo.
ollama list muestra la variante esperada. Guarda el nombre y la fecha de validación en tu inventario interno.
ollama ps confirma si la carga está en GPU, CPU o repartida. Registra la memoria ocupada.
La API responde en 127.0.0.1:11434 y no es accesible desde otra red sin autorización.
Una prueba con el contexto previsto no provoca descarga inesperada ni agota memoria.
Las funciones cloud están desactivadas cuando el entorno lo requiere y las integraciones no envían datos a terceros.
curl http://127.0.0.1:11434/api/generate -d '{"model":"<modelo>","prompt":"Devuelve únicamente: correcto","stream":false}'
Esta prueba verifica el servicio, no la seguridad completa. Para acceso desde otra máquina, añade un proxy con TLS y autenticación, limita el tamaño de las solicitudes y segmenta la red. No expongas directamente el puerto de Ollama a Internet.
Interfaz de chat, usuarios, permisos, documentos y administración de modelos.
Recuperación de fragmentos relevantes con control de fuentes y permisos.
Automatización de borradores de correo con validación y revisión humana.
No necesitas esta parte para completar el tutorial básico. Ábrela únicamente si vas a administrar el sistema, compartirlo con más personas o resolver una incidencia.
Ollama puede arrancar en equipos modestos, pero el tamaño de modelo utilizable depende de la memoria total disponible, del formato de los pesos y del contexto. Antes de descargar nada, comprueba cuatro recursos: memoria, almacenamiento, acelerador y margen térmico. El sistema operativo, la interfaz y otros procesos también consumen recursos.
No elijas un modelo que ocupe prácticamente toda la RAM o VRAM. La caché KV aumenta con el contexto y la concurrencia. Una variante que entra con un prompt corto puede descargar capas a CPU cuando el historial crece.
Las pruebas suelen requerir más de un tamaño o cuantización. Mantén espacio para pesos, actualizaciones, registros y copias de configuración. Un disco rápido reduce tiempos de carga, pero no sustituye memoria durante la inferencia.
Verifica que el sistema reconoce la GPU y que no hay procesos ocupando su memoria. En Linux, el usuario del servicio debe tener acceso a los dispositivos; en contenedores, la GPU debe pasarse expresamente.
Para uso individual, la dirección local es suficiente. Para equipos, diseña primero identidad, TLS, cortafuegos y segmentación. No abras el puerto únicamente porque una aplicación no encuentra el servicio.
| Antes de empezar | Comando o comprobación | Resultado esperado |
|---|---|---|
| Espacio libre | Herramienta de almacenamiento del sistema | Margen para el modelo elegido y otras variantes |
| GPU NVIDIA en Linux | nvidia-smi | GPU, controlador y memoria visibles sin errores |
| Servicio existente | ollama --version | Saber si ya existe una instalación que deba actualizarse |
| Puerto local | 127.0.0.1:11434 | No ocupado por otro proceso ni expuesto a redes no autorizadas |
| Política de datos | Inventario interno | Modelos locales autorizados y funciones cloud desactivadas cuando proceda |
ollama --version. Si no aparece, reinicia la sesión y revisa la instalación.ollama ps dónde se ha cargado el modelo.ollama --version ollama pull <familia:variante> ollama run <familia:variante> ollama ps
Configura las variables desde la sección de variables de entorno de Windows y reinicia la aplicación Ollama. Para un entorno que deba permanecer local, añade OLLAMA_NO_CLOUD con valor 1. Si mueves los modelos, crea OLLAMA_MODELS con una ruta local cuyos permisos controles.
No utilices una carpeta de red para empezar. La latencia, los bloqueos y los permisos complican el diagnóstico. Valida primero una carpeta local y, si necesitas almacenamiento compartido, diseña la operación y las copias de forma explícita.
ollama --version antes de descargar un modelo.ollama ps mientras el modelo está cargado y supervisa presión de memoria con las herramientas del sistema.ollama pull <familia:variante> ollama run <familia:variante> ollama ps
Cuando Ollama se ejecuta como aplicación, las variables pueden establecerse con launchctl setenv. Reinicia la aplicación después del cambio y confirma el comportamiento.
launchctl setenv OLLAMA_NO_CLOUD 1 launchctl setenv OLLAMA_CONTEXT_LENGTH 16384
Un contexto mayor no mejora automáticamente todas las respuestas. Úsalo cuando el caso lo necesite y vuelve a medir memoria, latencia y estabilidad.
En un puesto personal puede bastar el instalador oficial. En un servidor, trata Ollama como cualquier servicio: usuario dedicado, configuración versionada, cambios controlados, registros, límites de red y prueba de recuperación.
systemctl edit ollama.service.curl -fsSL https://ollama.com/install.sh | sh sudo systemctl status ollama sudo journalctl -u ollama --no-pager -n 100
sudo systemctl edit ollama.service [Service] Environment="OLLAMA_NO_CLOUD=1" Environment="OLLAMA_HOST=127.0.0.1:11434" Environment="OLLAMA_CONTEXT_LENGTH=16384"
sudo systemctl daemon-reload sudo systemctl restart ollama sudo systemctl status ollama
Para mover modelos en Linux, el usuario ollama necesita lectura y escritura sobre la nueva ruta. Aplica el mínimo permiso necesario y evita directorios compartidos con usuarios que no deban sustituir pesos.
Elige una familia adecuada a la tarea y una variante que quepa con margen. La biblioteca cambia con frecuencia, por lo que conviene copiar el nombre exacto y conservarlo en la documentación de la prueba.
ollama pull <familia:variante> ollama show <familia:variante> ollama run <familia:variante>
Dentro de la conversación, utiliza una tarea que puedas verificar. Un buen primer caso es resumir un texto breve que tú mismo aportes y pedir que indique cuando la información no aparece. Después termina la sesión y revisa:
ollama list ollama ps
¿Respeta el texto y el formato? ¿Distingue hechos de inferencias? ¿Reconoce que falta información?
¿Cabe íntegramente en el acelerador? ¿Qué ocurre al duplicar el contexto o abrir una segunda sesión?
¿Cuánto tarda la primera respuesta? ¿Permanece cargado? ¿Se recupera correctamente tras reiniciar?
Cuando una variante ya no sea necesaria, detenla y elimínala de forma consciente:
ollama stop <familia:variante> ollama rm <familia:variante>
La variable OLLAMA_MODELS indica la carpeta de almacenamiento. El procedimiento seguro consiste en detener Ollama, copiar los datos conservando integridad, aplicar permisos, cambiar la variable, reiniciar y comprobar el inventario. No borres la carpeta antigua hasta haber validado varias cargas.
OLLAMA_MODELS. Aplica el cambio al proceso correcto y reinicia.ollama list y carga un modelo. Verifica inventario, rendimiento y registros.Copias: los modelos pueden volver a descargarse, pero tus Modelfiles, configuraciones, prompts, evaluaciones y registros de versiones son activos propios y deben incluirse en la copia de seguridad.
Una actualización puede modificar compatibilidad de modelos, backends, consumo o API. En un equipo personal, registra al menos la versión anterior y la nueva. En un servidor, prueba primero en un nodo o entorno no crítico y conserva un procedimiento de vuelta atrás.
| Acción | Antes | Después |
|---|---|---|
| Actualizar la aplicación | Registra versión, modelos activos y aplicaciones conectadas | Repite API, aceleración, contexto y prueba funcional |
| Actualizar un modelo | Conserva la etiqueta o digest validado cuando sea posible | Repite la batería de calidad y herramientas |
| Cambiar controlador | Documenta versión y carga estable | Comprueba detección, memoria y rendimiento |
| Desinstalar | Decide si conservar modelos y configuraciones | Revisa servicios, carpetas y variables que hayan quedado |
| Volver atrás | Ten instalador, configuración y modelo aprobados | Valida que las aplicaciones recuperan el servicio |
En Linux, la documentación oficial permite volver a ejecutar el instalador para actualizar y fijar una versión dentro del procedimiento. No mezcles una actualización del motor con un cambio de modelo y de prompt en la misma prueba: no sabrás qué causó una diferencia.
| Problema | Qué revisar primero | Corrección habitual |
|---|---|---|
ollama no se reconoce | Terminal anterior a la instalación, PATH y enlace del binario | Abre una terminal nueva, reinicia sesión o repara la instalación |
| No se puede conectar con el servidor | Proceso, servicio, puerto y registros | Arranca Ollama y comprueba que escucha en la dirección esperada |
| La descarga se interrumpe | Espacio, proxy HTTPS, cortafuegos y estabilidad de red | Libera espacio y revisa la salida; evita configurar un proxy HTTP incorrecto |
| La GPU no aparece | Controlador, compatibilidad, permisos y contenedor | Actualiza controlador y concede acceso al usuario o contenedor |
| Memoria insuficiente | Tamaño, cuantización, contexto y otros modelos residentes | Reduce variante o contexto y detén cargas no necesarias |
| Respuesta local pero muy lenta | ollama ps, presión de memoria y temperatura | Evita descarga a CPU o dimensiona un acelerador con más memoria |
| Otra máquina no conecta | Dirección de escucha y segmentación | Diseña proxy y autenticación; no abras el puerto directamente |
| El modo local sigue mostrando funciones cloud | Variable aplicada al proceso correcto y reinicio | Revisa configuración y registro, y limita etiquetas autorizadas |
Empieza con el hardware que ya tienes y mide. Si el modelo cabe en la VRAM de una GPU, esa GPU suele ofrecer más velocidad. Si el modelo, el contexto o varios procesos ya no caben, DGX Spark aporta 128 GB coherentes con CUDA. Para cargas que caben en 96 GB y priorizan rendimiento, RTX PRO 6000 es la alternativa profesional.
Cuatro preguntas separan chat, desarrollo, imagen, empresa y número de usuarios antes de proponer una plataforma.
Abrir el recomendador
128 GB coherentesUn entorno integrado para modelos y flujos CUDA que exceden la VRAM de una GPU convencional.
Ver ficha y precio cerrado
96 GB GDDR7Rendimiento de GPU profesional para inferencia, imagen y vídeo cuando el flujo cabe completo en VRAM.
Abrir la ficha profesionalVerifica la aceleración con una variante pequeña antes de descargar modelos de gran tamaño. Después mide contexto y concurrencia sobre tu carga real.
Elegir un modeloLas especificaciones, funciones y límites descritos se contrastan con documentación primaria de Ollama y modelos. Las recomendaciones de compra, el orden de los pasos y los márgenes de planificación son criterios editoriales de AI Supercomputers: deben confirmarse con la versión instalada y una prueba real.
Documentación oficial de Ollama · Biblioteca oficial de modelos · Contexto y comprobación de offload
No. Puede ejecutarse en CPU y admite varios aceleradores, pero una GPU compatible mejora mucho la velocidad. El rendimiento y la memoria disponible dependen del sistema.
Utiliza el instalador oficial de Ollama para Windows. Después abre PowerShell o Terminal y verifica el comando ollama.
La aplicación puede funcionar sin conexión después de instalarla y descargar los modelos necesarios. La descarga inicial y las actualizaciones requieren acceso a las fuentes correspondientes.
Configura OLLAMA_NO_CLOUD=1 o disable_ollama_cloud, reinicia el servicio y utiliza exclusivamente etiquetas locales.
No para uso en el mismo equipo. Solo abre acceso de red cuando una aplicación externa lo necesite, y añade segmentación, autenticación, TLS y restricciones de origen.
Puede faltar compatibilidad del controlador, el modelo puede superar la memoria del acelerador o la configuración puede descargar capas. Comprueba ollama ps y los registros del servicio.