Permisos de administración, drivers revisados y una ruta de datos con espacio suficiente.
Cómo instalar Ollama y comprobar que la IA se ejecuta en el equipo correcto
La instalación ocupa pocos pasos, pero una puesta en marcha fiable debe verificar el origen del instalador, el modelo descargado, la aceleración, el contexto y la exposición de red.
Qué necesitas antes y cómo sabrás que has terminado
Ejecuta la guía sobre un entorno de prueba. No avances a producción hasta obtener la salida verificable y documentar la reversión.
Tener Ollama instalado, acelerado, limitado a la interfaz correcta y probado con un modelo pequeño.
Continúa con la etapa relacionada y conserva comandos, versiones, métricas y responsables.
Abrir el siguiente paso →De una instalación de prueba a un equipo dedicado
El carrusel conecta la guía con las plataformas que aparecen cuando el modelo deja de caber o se comparte.
NVIDIA DGX Spark
Referencia NVIDIA con 128 GB coherentes para modelos y contextos que exceden la VRAM habitual.
Compra enTienda Ietres
ASUS Ascent GX10
La misma clase de capacidad GB10 con tres escalones de almacenamiento y chasis ASUS.
Lenovo ThinkStation PGX
Plataforma GB10 de Lenovo con varias referencias; el almacenamiento es la diferencia principal verificada.
RTX PRO 6000 Blackwell
Prioriza velocidad y concurrencia cuando la carga completa cabe en la VRAM disponible.
Compra enIetres Informática
Antes de instalar
Instalar Ollama es como instalar cualquier programa: descargar, aceptar, siguiente. La única diferencia llega con el primer ollama run: ese comando descarga el modelo (varios GB, una sola vez) — como bajar una película larga que después ves cuantas veces quieras sin volver a descargarla.
- Actualiza el controlador del acelerador desde el canal del fabricante y reinicia cuando corresponda.
- Reserva almacenamiento para varias variantes. Los modelos grandes pueden ocupar decenas de gigabytes.
- Decide el modo de privacidad. Si el entorno debe ser exclusivamente local, activa la opción de nube deshabilitada antes de dar acceso a usuarios.
- Revisa la licencia del modelo. La aplicación y los pesos no comparten necesariamente las mismas condiciones.
- No publiques la API. La configuración inicial debe permanecer en
127.0.0.1.
Instalación con el paquete oficial
- Descarga el instalador. Utiliza OllamaSetup.exe desde ollama.com.
- Ejecuta la instalación. Mantén el origen verificado y completa el asistente.
- Abre PowerShell o Terminal. Comprueba que el ejecutable está disponible.
- Descarga una variante pequeña. Elige una familia en la biblioteca oficial y copia su comando.
- Verifica la aceleración. Con el modelo cargado, ejecuta
ollama ps.
ollama --version ollama pull <modelo> ollama run <modelo> ollama ps
Si ollama ps muestra CPU cuando esperabas GPU, revisa controlador, compatibilidad, memoria disponible y registros. Un modelo demasiado grande puede ejecutarse parcialmente en CPU.
Instalación de la aplicación
Descarga la aplicación desde el sitio oficial de Ollama, muévela a Aplicaciones y ejecútala. Después utiliza Terminal con los mismos comandos de descarga, ejecución y comprobación.
ollama --version ollama pull <modelo> ollama run <modelo> ollama ps
En equipos Apple Silicon, la memoria es compartida. No destines toda la capacidad al modelo: macOS, el motor, la caché y otras aplicaciones también la necesitan.
Instalación y servicio
El instalador oficial para Linux se distribuye desde ollama.com. Revisa el script antes de ejecutarlo si tu política interna lo exige y utiliza una cuenta con privilegios controlados.
curl -fsSL https://ollama.com/install.sh | sh ollama --version systemctl status ollama
En un servidor, fija la versión dentro del procedimiento de cambios, documenta el servicio y evita actualizar todos los nodos a la vez. Comprueba también que el usuario del servicio puede acceder al acelerador.
Desactivar funciones cloud
"Local" de verdad significa que ni la pregunta ni el documento salen de tu equipo. Este paso cierra las opciones del programa que sí hablarían con internet — el equivalente a poner el teléfono en modo avión para una conversación privada: todo sigue funcionando, pero nada sale de la habitación.
Ollama admite modelos locales y modelos procesados en su nube. En un entorno donde los datos no deben salir, configura una de las opciones oficiales y reinicia el servicio:
OLLAMA_NO_CLOUD=1
Como alternativa, añade "disable_ollama_cloud": true en el archivo de configuración del servidor. Después comprueba el comportamiento con una cuenta sin acceso a Internet y registra las etiquetas autorizadas.
Seis comprobaciones después de instalar
1. Versión y servicio
ollama --version responde y el proceso permanece estable tras reiniciar el equipo.
2. Modelo exacto
ollama list muestra la variante esperada. Guarda el nombre y la fecha de validación en tu inventario interno.
3. Procesador
ollama ps confirma si la carga está en GPU, CPU o repartida. Registra la memoria ocupada.
4. API local
La API responde en 127.0.0.1:11434 y no es accesible desde otra red sin autorización.
5. Contexto
Una prueba con el contexto previsto no provoca descarga inesperada ni agota memoria.
6. Privacidad
Las funciones cloud están desactivadas cuando el entorno lo requiere y las integraciones no envían datos a terceros.
Confirmar una respuesta local
curl http://127.0.0.1:11434/api/generate -d '{"model":"<modelo>","prompt":"Devuelve únicamente: correcto","stream":false}'
Esta prueba verifica el servicio, no la seguridad completa. Para acceso desde otra máquina, añade un proxy con TLS y autenticación, limita el tamaño de las solicitudes y segmenta la red. No expongas directamente el puerto de Ollama a Internet.
De la terminal a una herramienta útil
Open WebUI
Interfaz de chat, usuarios, permisos, documentos y administración de modelos.
RAG para empresa
Recuperación de fragmentos relevantes con control de fuentes y permisos.
n8n y Outlook
Automatización de borradores de correo con validación y revisión humana.
Requisitos reales: sistema, memoria, disco y aceleración
Ollama puede arrancar en equipos modestos, pero el tamaño de modelo utilizable depende de la memoria total disponible, del formato de los pesos y del contexto. Antes de descargar nada, comprueba cuatro recursos: memoria, almacenamiento, acelerador y margen térmico. El sistema operativo, la interfaz y otros procesos también consumen recursos.
Deja margen para el sistema y la caché
No elijas un modelo que ocupe prácticamente toda la RAM o VRAM. La caché KV aumenta con el contexto y la concurrencia. Una variante que entra con un prompt corto puede descargar capas a CPU cuando el historial crece.
Reserva espacio para varias variantes
Las pruebas suelen requerir más de un tamaño o cuantización. Mantén espacio para pesos, actualizaciones, registros y copias de configuración. Un disco rápido reduce tiempos de carga, pero no sustituye memoria durante la inferencia.
Actualiza el controlador antes de diagnosticar
Verifica que el sistema reconoce la GPU y que no hay procesos ocupando su memoria. En Linux, el usuario del servicio debe tener acceso a los dispositivos; en contenedores, la GPU debe pasarse expresamente.
Decide quién necesita conectarse
Para uso individual, la dirección local es suficiente. Para equipos, diseña primero identidad, TLS, cortafuegos y segmentación. No abras el puerto únicamente porque una aplicación no encuentra el servicio.
| Antes de empezar | Comando o comprobación | Resultado esperado |
|---|---|---|
| Espacio libre | Herramienta de almacenamiento del sistema | Margen para el modelo elegido y otras variantes |
| GPU NVIDIA en Linux | nvidia-smi | GPU, controlador y memoria visibles sin errores |
| Servicio existente | ollama --version | Saber si ya existe una instalación que deba actualizarse |
| Puerto local | 127.0.0.1:11434 | No ocupado por otro proceso ni expuesto a redes no autorizadas |
| Política de datos | Inventario interno | Modelos locales autorizados y funciones cloud desactivadas cuando proceda |
Instalar Ollama en Windows y validar el servicio
- Descarga el ejecutable oficial. Utiliza únicamente OllamaSetup.exe desde ollama.com. Comprueba el nombre del archivo y evita copias alojadas en terceros.
- Cierra aplicaciones que ocupen la GPU. Esto facilita la primera prueba y evita interpretar una falta de memoria como un problema de instalación.
- Ejecuta el instalador. Completa el proceso con tu cuenta habitual. Al terminar, Ollama se inicia en segundo plano.
- Abre una terminal nueva. El PATH de una ventana que ya estaba abierta puede no haberse actualizado.
- Comprueba la versión. Ejecuta
ollama --version. Si no aparece, reinicia la sesión y revisa la instalación. - Descarga una variante pequeña. Copia el comando exacto desde la biblioteca oficial.
- Ejecuta una conversación corta. Escribe una pregunta, termina la sesión y verifica con
ollama psdónde se ha cargado el modelo.
ollama --version ollama pull <familia:variante> ollama run <familia:variante> ollama ps
Cómo aplicar variables de entorno en Windows
Configura las variables desde la sección de variables de entorno de Windows y reinicia la aplicación Ollama. Para un entorno que deba permanecer local, añade OLLAMA_NO_CLOUD con valor 1. Si mueves los modelos, crea OLLAMA_MODELS con una ruta local cuyos permisos controles.
No utilices una carpeta de red para empezar. La latencia, los bloqueos y los permisos complican el diagnóstico. Valida primero una carpeta local y, si necesitas almacenamiento compartido, diseña la operación y las copias de forma explícita.
Instalar Ollama en macOS y controlar la memoria unificada
- Descarga la aplicación oficial. Abre la imagen de disco y mueve Ollama a la carpeta de aplicaciones.
- Inicia la aplicación. Autoriza la creación del enlace del comando cuando el sistema lo solicite.
- Abre Terminal y verifica. Ejecuta
ollama --versionantes de descargar un modelo. - Elige una variante con margen. La memoria unificada se comparte entre sistema, aplicaciones, pesos y caché. No utilices toda la capacidad nominal.
- Ejecuta y observa. Usa
ollama psmientras el modelo está cargado y supervisa presión de memoria con las herramientas del sistema.
ollama pull <familia:variante> ollama run <familia:variante> ollama ps
Variables para la aplicación
Cuando Ollama se ejecuta como aplicación, las variables pueden establecerse con launchctl setenv. Reinicia la aplicación después del cambio y confirma el comportamiento.
launchctl setenv OLLAMA_NO_CLOUD 1 launchctl setenv OLLAMA_CONTEXT_LENGTH 16384
Un contexto mayor no mejora automáticamente todas las respuestas. Úsalo cuando el caso lo necesite y vuelve a medir memoria, latencia y estabilidad.
Instalar Ollama en Linux como servicio mantenible
En un puesto personal puede bastar el instalador oficial. En un servidor, trata Ollama como cualquier servicio: usuario dedicado, configuración versionada, cambios controlados, registros, límites de red y prueba de recuperación.
- Revisa el instalador conforme a tu política. Descárgalo desde el dominio oficial y ejecútalo con privilegios controlados.
- Comprueba systemd. El servicio debe estar activo y sin reinicios continuos.
- Verifica el acceso a la GPU. Ejecuta la prueba con el mismo usuario del servicio, no solo con tu cuenta de administración.
- Configura un override. No edites directamente la unidad instalada; utiliza
systemctl edit ollama.service. - Reinicia y consulta registros. Confirma que las variables se han aplicado antes de conectar otras aplicaciones.
curl -fsSL https://ollama.com/install.sh | sh sudo systemctl status ollama sudo journalctl -u ollama --no-pager -n 100
sudo systemctl edit ollama.service [Service] Environment="OLLAMA_NO_CLOUD=1" Environment="OLLAMA_HOST=127.0.0.1:11434" Environment="OLLAMA_CONTEXT_LENGTH=16384"
sudo systemctl daemon-reload sudo systemctl restart ollama sudo systemctl status ollama
Para mover modelos en Linux, el usuario ollama necesita lectura y escritura sobre la nueva ruta. Aplica el mínimo permiso necesario y evita directorios compartidos con usuarios que no deban sustituir pesos.
Descargar, probar y retirar tu primer modelo
Elige una familia adecuada a la tarea y una variante que quepa con margen. La biblioteca cambia con frecuencia, por lo que conviene copiar el nombre exacto y conservarlo en la documentación de la prueba.
ollama pull <familia:variante> ollama show <familia:variante> ollama run <familia:variante>
Dentro de la conversación, utiliza una tarea que puedas verificar. Un buen primer caso es resumir un texto breve que tú mismo aportes y pedir que indique cuando la información no aparece. Después termina la sesión y revisa:
ollama list ollama ps
Calidad
¿Respeta el texto y el formato? ¿Distingue hechos de inferencias? ¿Reconoce que falta información?
Capacidad
¿Cabe íntegramente en el acelerador? ¿Qué ocurre al duplicar el contexto o abrir una segunda sesión?
Operación
¿Cuánto tarda la primera respuesta? ¿Permanece cargado? ¿Se recupera correctamente tras reiniciar?
Cuando una variante ya no sea necesaria, detenla y elimínala de forma consciente:
ollama stop <familia:variante> ollama rm <familia:variante>
Mover los modelos a otro disco sin romper el servicio
La variable OLLAMA_MODELS indica la carpeta de almacenamiento. El procedimiento seguro consiste en detener Ollama, copiar los datos conservando integridad, aplicar permisos, cambiar la variable, reiniciar y comprobar el inventario. No borres la carpeta antigua hasta haber validado varias cargas.
- Detén el servicio o la aplicación. Evita copiar archivos mientras están siendo modificados.
- Copia, no muevas todavía. Conserva el original como recuperación temporal.
- Comprueba capacidad y sistema de archivos. Evita volúmenes con permisos o límites incompatibles.
- Asigna propietario y permisos. El proceso de Ollama debe poder leer y escribir; otros usuarios no deben reemplazar modelos sin autorización.
- Configura
OLLAMA_MODELS. Aplica el cambio al proceso correcto y reinicia. - Ejecuta
ollama listy carga un modelo. Verifica inventario, rendimiento y registros. - Retira el original después de la aceptación. Documenta la nueva ruta y su política de copias.
Copias: los modelos pueden volver a descargarse, pero tus Modelfiles, configuraciones, prompts, evaluaciones y registros de versiones son activos propios y deben incluirse en la copia de seguridad.
Actualizar, retroceder y desinstalar sin perder trazabilidad
Una actualización puede modificar compatibilidad de modelos, backends, consumo o API. En un equipo personal, registra al menos la versión anterior y la nueva. En un servidor, prueba primero en un nodo o entorno no crítico y conserva un procedimiento de vuelta atrás.
| Acción | Antes | Después |
|---|---|---|
| Actualizar la aplicación | Registra versión, modelos activos y aplicaciones conectadas | Repite API, aceleración, contexto y prueba funcional |
| Actualizar un modelo | Conserva la etiqueta o digest validado cuando sea posible | Repite la batería de calidad y herramientas |
| Cambiar controlador | Documenta versión y carga estable | Comprueba detección, memoria y rendimiento |
| Desinstalar | Decide si conservar modelos y configuraciones | Revisa servicios, carpetas y variables que hayan quedado |
| Volver atrás | Ten instalador, configuración y modelo aprobados | Valida que las aplicaciones recuperan el servicio |
En Linux, la documentación oficial permite volver a ejecutar el instalador para actualizar y fijar una versión dentro del procedimiento. No mezcles una actualización del motor con un cambio de modelo y de prompt en la misma prueba: no sabrás qué causó una diferencia.
Errores comunes de instalación y diagnóstico ordenado
| Problema | Qué revisar primero | Corrección habitual |
|---|---|---|
ollama no se reconoce | Terminal anterior a la instalación, PATH y enlace del binario | Abre una terminal nueva, reinicia sesión o repara la instalación |
| No se puede conectar con el servidor | Proceso, servicio, puerto y registros | Arranca Ollama y comprueba que escucha en la dirección esperada |
| La descarga se interrumpe | Espacio, proxy HTTPS, cortafuegos y estabilidad de red | Libera espacio y revisa la salida; evita configurar un proxy HTTP incorrecto |
| La GPU no aparece | Controlador, compatibilidad, permisos y contenedor | Actualiza controlador y concede acceso al usuario o contenedor |
| Memoria insuficiente | Tamaño, cuantización, contexto y otros modelos residentes | Reduce variante o contexto y detén cargas no necesarias |
| Respuesta local pero muy lenta | ollama ps, presión de memoria y temperatura | Evita descarga a CPU o dimensiona un acelerador con más memoria |
| Otra máquina no conecta | Dirección de escucha y segmentación | Diseña proxy y autenticación; no abras el puerto directamente |
| El modo local sigue mostrando funciones cloud | Variable aplicada al proceso correcto y reinicio | Revisa configuración y registro, y limita etiquetas autorizadas |
- Vuelve a la CLI local. Si funciona, el problema está en la integración o la red.
- Prueba un modelo pequeño. Si funciona, el problema puede ser memoria y no instalación.
- Consulta el registro del servicio. No adivines a partir de la interfaz.
- Cambia una sola variable cada vez. Conserva el estado anterior para volver atrás.
- Repite la prueba de aceptación. Una corrección técnica debe demostrar que no ha abierto un problema de seguridad.
La instalación es la misma; cambia la capacidad disponible
Empieza con el hardware que ya tienes y mide. Si el modelo cabe en la VRAM de una GPU, esa GPU suele ofrecer más velocidad. Si el modelo, el contexto o varios procesos ya no caben, DGX Spark aporta 128 GB coherentes con CUDA. Para cargas que caben en 96 GB y priorizan rendimiento, RTX PRO 6000 es la alternativa profesional.
Recomendador de hardware
Cuatro preguntas separan chat, desarrollo, imagen, empresa y número de usuarios antes de proponer una plataforma.
Abrir el recomendador
128 GB coherentesNVIDIA DGX Spark
Un entorno integrado para modelos y flujos CUDA que exceden la VRAM de una GPU convencional.
Ver ficha y precio cerrado
96 GB GDDR7RTX PRO 6000 Blackwell
Rendimiento de GPU profesional para inferencia, imagen y vídeo cuando el flujo cabe completo en VRAM.
Abrir la ficha profesionalEmpieza con un modelo que quepa con margen
Verifica la aceleración con una variante pequeña antes de descargar modelos de gran tamaño. Después mide contexto y concurrencia sobre tu carga real.
Elegir un modeloMide esta carga y elige el equipo con datos
Ejecuta una prueba representativa, registra memoria y tiempo, y utiliza el recomendador para comparar una GPU rápida con una plataforma de memoria coherente.
- 01
Define la carga
Concreta tarea, familia de modelo, contexto, lote y usuarios simultáneos.
Aclarar el caso de uso → - 02
Dimensiona memoria
Compara VRAM, memoria coherente, velocidad y margen de crecimiento.
Usar el recomendador de hardware → - 03
Compra en la tienda
Abre la ficha comercial para consultar configuración, precio cerrado, disponibilidad y condiciones vigentes.
Contacto y disponibilidad →
RTX PRO 6000 · 96 GB
Prioriza una GPU profesional para inferencia, imagen, vídeo o serving cuando el modelo y el contexto caben en sus 96 GB de VRAM.
Ver ficha profesional →NVIDIA DGX Spark · 128 GB
Considera memoria unificada para desarrollo CUDA y cargas que superan la VRAM de una GPU, aceptando que capacidad no equivale siempre a más velocidad.
Ver ficha y comprar →Recomendador de hardware
Responde cinco preguntas y compara el equipo actual, una GPU NVIDIA, la RTX PRO 6000 y sistemas GB10 como DGX Spark, ASUS Ascent GX10 o Lenovo ThinkStation PGX.
Comparar opciones →aisupercomputers.es aporta guías y herramientas de decisión. La compra, el precio cerrado en la ficha y el soporte comercial desde España se gestionan en las tiendas del grupo Ietres.
Respuestas directas
¿Ollama necesita una GPU NVIDIA?
No. Puede ejecutarse en CPU y admite varios aceleradores, pero una GPU compatible mejora mucho la velocidad. El rendimiento y la memoria disponible dependen del sistema.
¿Qué instalador uso en Windows?
Utiliza el instalador oficial de Ollama para Windows. Después abre PowerShell o Terminal y verifica el comando ollama.
¿Puedo instalar Ollama sin conexión?
La aplicación puede funcionar sin conexión después de instalarla y descargar los modelos necesarios. La descarga inicial y las actualizaciones requieren acceso a las fuentes correspondientes.
¿Cómo fuerzo el modo solo local?
Configura OLLAMA_NO_CLOUD=1 o disable_ollama_cloud, reinicia el servicio y utiliza exclusivamente etiquetas locales.
¿Debo abrir el puerto 11434 en el cortafuegos?
No para uso en el mismo equipo. Solo abre acceso de red cuando una aplicación externa lo necesite, y añade segmentación, autenticación, TLS y restricciones de origen.
¿Por qué el modelo usa CPU?
Puede faltar compatibilidad del controlador, el modelo puede superar la memoria del acelerador o la configuración puede descargar capas. Comprueba ollama ps y los registros del servicio.