Cómo instalar Ollama en tu PC: guía completa para usar la IA en local

Por Daniele Forciniti

Cómo instalar Ollama en tu PC: guía completa para usar la IA en local

Cómo instalar Ollama es más sencillo de lo que parece: descargas el programa desde la web oficial ollama.com —o pegas un comando en la terminal—, luego escribes ollama run gemma4 y en unos minutos tienes una inteligencia artificial funcionando en tu ordenador, sin cuenta y sin conexión a internet. Ollama va en Windows, macOS y Linux, es gratuito y tus datos no salen nunca de tu equipo. Lo único que hace falta de verdad es espacio en disco y algo de paciencia con la primera descarga.

Llevo más de 10 años trabajando con webs, SEO y contenidos, y en los dos últimos empecé a usar modelos en local por una razón muy concreta: hay trabajos en los que manejo datos de clientes —tarifas, bases de datos, textos aún sin publicar— que no me apetece pegar dentro de un servicio online. En esta guía te cuento todo: qué necesita de verdad tu ordenador, cómo se instala en cada sistema, qué modelo elegir para empezar, cómo ponerle una interfaz gráfica decente y —sobre todo— cuándo compensa este camino y cuándo estás perdiendo el tiempo.

Qué es Ollama y por qué ejecutarlo en tu ordenador

Ollama es un programa gratuito que te permite descargar y hacer funcionar en tu ordenador los mismos modelos de inteligencia artificial que normalmente usarías online. Un modelo, dicho en simple, es el fichero que contiene todo lo que la IA aprendió durante su entrenamiento: lo descargas una vez y luego le preguntas, como harías en cualquier chat.

La diferencia con ChatGPT o Claude está en dónde ocurre el trabajo. Con los servicios online, lo que escribes viaja hasta los servidores de la empresa. Con Ollama todo se queda en tu disco: no sale ningún dato, no hay cuenta, y una vez descargado el modelo puedes desconectar el wifi y seguir trabajando.

Las razones para probarlo son básicamente tres:

  • Confidencialidad: es el motivo por el que empecé yo. Si trabajas con documentos de clientes, contratos o datos personales, tenerlos en tu máquina elimina el problema de raíz.
  • Coste cero y sin límite de uso: nada de suscripción ni de contador. Si necesitas reescribir dos mil descripciones de producto, lo haces sin mirar el gasto.
  • Funciona sin conexión: útil más de lo que parece si viajas o tienes una conexión inestable.

Un punto que quiero dejar claro desde el principio, porque ninguna guía lo dice: los modelos que puedes mover en casa no son tan potentes como ChatGPT o Claude. Son más pequeños, y se nota. Para resumir, ordenar, traducir, clasificar o hacer un primer borrador van de sobra. Para razonamiento complejo te quedas atrás. Sabiéndolo de entrada te ahorras la decepción.

Qué necesitas de verdad, sin humo

Aquí es donde se estrella casi todo el mundo, yo incluido la primera vez. Probé a mover un modelo en un portátil sin tarjeta gráfica dedicada: funcionaba, pero escupía una palabra cada dos segundos. Técnicamente un éxito, en la práctica inservible. Así que empecemos por lo que hace falta de verdad.

Requisitos oficiales, sacados de la documentación de Ollama:

SistemaQué hace falta
WindowsWindows 10 versión 22H2 o superior, Home o Pro
macOSmacOS 14 Sonoma o superior; Mac con chip Apple (M1 en adelante) o Intel
LinuxDistribuciones de 64 bits
Espacio en discoAl menos 4 GB para el programa, más el espacio de los modelos

El cuello de botella real, sin embargo, no es el sistema operativo: es la memoria. Un modelo tiene que caber entero en memoria para trabajar, y si no cabe el ordenador se arrastra. La regla práctica que se usa en la comunidad es esta —no es un dato oficial de Ollama, que no publica mínimos de RAM, pero es la que funciona en la práctica:

Tamaño del modeloMemoria recomendadaQué tipo de ordenador
1B – 3B4–8 GBCualquier portátil reciente
7B – 8B8–16 GBEl punto de equilibrio para la mayoría
13B – 14B16 GBNecesitas gráfica dedicada para ir fluido
70B64 GBEstación de trabajo, no un portátil

La «B» son miles de millones de parámetros: los parámetros son los valores numéricos que el modelo aprendió durante el entrenamiento, y cuantos más tiene más capaz es —pero también más pesado de mover.

Sobre la tarjeta gráfica: no es obligatoria, pero lo cambia todo. Con GPU el modelo vuela, sin ella va al paso. Ollama admite gráficas Nvidia con compute capability 5.0 o superior —en la práctica desde la vieja GTX 750 hasta las RTX 5090— con controladores de la versión 550 en adelante, y AMD Radeon vía ROCm o Vulkan. En los Mac con chip Apple la gráfica integrada se aprovecha de forma automática, y es una de las razones por las que un MacBook con chip M se defiende muy bien con estas cargas.

Cómo instalar Ollama en Windows, macOS y Linux

Cómo instalar Ollama depende poco del sistema que uses: en todos hay dos caminos, el instalador de toda la vida o una línea que pegas en la terminal. Hacen lo mismo, elige con el que estés más cómodo.

Windows

Entra en ollama.com/download/windows, descarga el instalador y ejecútalo. Dos cosas que vienen bien saber: no hacen falta permisos de administrador y la instalación va a tu carpeta de usuario, así que puedes hacerlo también en el ordenador de la oficina sin llamar a nadie.

Como alternativa, abre PowerShell y pega:

irm https://ollama.com/install.ps1 | iex

Al terminar, Ollama arranca solo en segundo plano y el comando ollama queda disponible en cmd, PowerShell o la terminal que uses.

Si el disco C se te llena —y con los modelos se llena rápido, por ahí he pasado— puedes mover las cosas. Para el programa, lanza el instalador así:

OllamaSetup.exe /DIR="d:rutaquequieras"

Para los modelos, crea una variable de entorno llamada OLLAMA_MODELS con la ruta de la carpeta donde quieras guardarlos: busca «variables de entorno» en Configuración, entra en Editar las variables de entorno de tu cuenta y añádela. Después cierra Ollama desde la barra de tareas y vuelve a abrirlo, si no, no lee el cambio.

macOS

Descarga el fichero desde la web oficial, abre el .dmg y arrastra Ollama a la carpeta Aplicaciones. La primera vez te pedirá permiso para crear un enlace en /usr/local/bin: acéptalo, hace falta para usar los comandos desde la terminal.

Quien prefiera la terminal lo resuelve con una línea:

curl -fsSL https://ollama.com/install.sh | sh

Los modelos y la configuración acaban en la carpeta oculta ~/.ollama, y los registros en ~/.ollama/logs. Apúntatelo: cuando algo falle, es ahí donde se mira.

Linux

Una línea y listo:

curl -fsSL https://ollama.com/install.sh | sh

Si prefieres no ejecutar un script descargado al vuelo —costumbre sana si el equipo no es solo tuyo— puedes instalarlo a mano bajando el paquete y extrayéndolo:

curl -fsSL https://ollama.com/download/ollama-linux-amd64.tar.zst | sudo tar x -C /usr
ollama serve

Luego, desde otra terminal, comprueba que responde con ollama -v. Si vienes de una versión antigua, quita antes las librerías viejas con sudo rm -rf /usr/lib/ollama o te arriesgas a conflictos.

Tu primer modelo: cuál elegir para empezar

Con el programa instalado todavía no tienes ninguna IA: el modelo se descarga aparte. Escribe ollama en la terminal y se abre un menú interactivo desde el que eliges qué arrancar —es una comodidad añadida hace poco, antes tocaba saberse el nombre del modelo de memoria.

Para la primera descarga, mi consejo es empezar pequeño, ver cómo reacciona el ordenador y luego subir. Estos son de los más descargados de la biblioteca oficial:

ModeloTamañosPara qué va bien
gemma4variosEl de Google, el que usan en los ejemplos oficiales: buen punto de partida
llama3.21B, 3BLigerísimo, se mueve incluso en portátiles modestos
llama3.18B, 70B, 405BEl más descargado de todos; la versión 8B es el equilibrio clásico
deepseek-r1de 1.5B a 671BRazonamiento: tarda más pero explica los pasos
gemma3270M, 1B, 4B, 12BTambién lee imágenes, y cabe en una sola gráfica
qwen3.5variosEl que recomienda la propia documentación para programar
nomic-embed-textúnicoNo conversa: convierte textos en números para hacer buscadores internos

Para descargarlo y arrancarlo basta un comando. La primera vez se baja unos cuantos gigas, tenlo en cuenta:

ollama run gemma4

Terminada la descarga arranca el chat dentro de la terminal. A partir de ahí escribes como en cualquier otra IA. En mi caso la primera prueba siempre es la misma: le paso un texto largo y le pido un resumen en cinco líneas. Si lo hace bien y en un tiempo razonable, el modelo se queda; si no, bajo de tamaño.

Qué significan las siglas raras tipo q4_K_M

En cuanto entras en la biblioteca de modelos te encuentras nombres como llama3.1:8b-instruct-q4_K_M y no hay guía que te explique qué es esa coleta final. Como es justo la decisión que determina si el modelo te cabe o no en el ordenador, vamos con ello.

Se llama cuantización, y es una forma de adelgazar el modelo. Los valores que aprendió durante el entrenamiento se guardan con menos precisión —en vez de con muchos decimales, redondeados— y así el fichero pesa bastante menos. El número que sigue a la q son los bits que se usan: cuanto más bajo, más pequeño y más rápido, pero también algo peor de calidad.

Estas son las medidas reales del mismo modelo, llama3.1 de 8 mil millones de parámetros, en sus distintas versiones:

VersiónTamañoCuándo elegirla
q2_K3,2 GBSolo si vas muy justo de memoria; la calidad se resiente de verdad
q3_K_M4,0 GBApaño aceptable en equipos modestos
q4_K_M4,9 GBEl equilibrio habitual: es la que suele venir por defecto
q5_K_M~5,7 GBUn punto más de calidad si te sobra memoria
fp16~16 GBSin adelgazar. Solo con gráfica potente

En la práctica: si escribes ollama run llama3.1:8b sin especificar nada, Ollama te da la versión equilibrada y no tienes que pensar en esto. Solo merece la pena bajar a q3 o q2 cuando el modelo no te entra en memoria, y en ese caso casi siempre es mejor idea elegir un modelo más pequeño bien conservado que uno grande muy adelgazado.

Los comandos que vas a usar de verdad

La documentación trae unos cuantos, pero en el día a día siempre se vuelve a estos:

ComandoQué hace
ollamaAbre el menú interactivo
ollama run nombreArranca un chat con ese modelo
ollama pull nombreDescarga un modelo sin arrancarlo
ollama lsLista los modelos que tienes en disco
ollama psMuestra cuáles están encendidos ahora mismo
ollama stop nombreApaga un modelo y libera memoria
ollama rm nombreBorra un modelo y recupera espacio
ollama -vDice qué versión tienes instalada

Dentro del chat, para salir se escribe /bye. Y para escribir en varias líneas sin enviar a medias, encierra el texto entre tres comillas ("""). Si el modelo lee imágenes, puedes pasarle una directamente en la pregunta:

ollama run gemma4 "¿Qué hay en esta imagen? /Users/daniele/Escritorio/foto.png"

Hay además un comando que las guías en español todavía no recogen, ollama launch, que conecta Ollama con las herramientas de programación que ya usas —VS Code, Claude Code, Codex, OpenCode, Droid. En la práctica escribes código con tu editor de siempre, pero el modelo que responde corre en tu máquina:

ollama launch claude --model qwen3.5

Un apunte técnico útil: por defecto Ollama recuerda 4.096 tokens por conversación —los tokens son los trocitos en los que se parte el texto, algo menos de una palabra cada uno, o sea unas 3.000 palabras de memoria. Si trabajas con documentos largos se te queda corto, y puedes subirlo así:

OLLAMA_CONTEXT_LENGTH=8192 ollama serve

Ponerle una interfaz gráfica con Open WebUI

Trabajar desde la terminal está bien para probar, pero si vas a usarlo a diario acabarás queriendo una ventana de chat normal, con su historial y sus conversaciones guardadas. Ahí entra Open WebUI, un proyecto de código abierto que le pone a Ollama una interfaz prácticamente igual a la de ChatGPT, pero funcionando en tu ordenador.

Se instala con Docker, en un solo comando:

docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

Luego abres http://localhost:3000 en el navegador y ya está: te encuentras el chat, con los modelos que tengas instalados listos para elegir en un desplegable. Si tienes gráfica Nvidia, usa la variante :cuda y añade --gpus all. Y si no quieres instalar Ollama y Open WebUI por separado, existe la etiqueta :ollama, que trae los dos dentro del mismo contenedor.

Este es el paso que, en mi experiencia, marca la diferencia entre «lo probé un rato» y «lo uso todos los días». Mientras está en la terminal, la mayoría de la gente lo abandona a la semana.

La API local, la parte que casi nadie aprovecha

Cuando Ollama está funcionando, deja abierta una puerta en tu propio ordenador, en la dirección http://localhost:11434. Es una API: el canal por el que otro programa puede hacerle preguntas al modelo sin pasar por el chat. Para probarlo basta con esto desde la terminal:

curl http://localhost:11434/api/chat -d '{
  "model": "gemma4",
  "messages": [{"role": "user", "content": "Resume este texto en tres líneas"}],
  "stream": false
}'

¿Y por qué importa? Porque esa puerta es compatible con las APIs de OpenAI y de Anthropic. En cristiano: un montón de herramientas creadas para funcionar con ChatGPT o Claude funcionan también con Ollama cambiando solo la dirección a la que apuntan. No hay que reprogramar nada.

Sobre esa API está montado todo lo demás. La documentación oficial lista integraciones ya preparadas con editores como VS Code y JetBrains, con asistentes de programación como Claude Code, Codex o Cline, y —la que más juego da si automatizas— con n8n, la herramienta con la que se encadenan procesos sin programar. Ahí es donde Ollama deja de ser una curiosidad y se convierte en una pieza de tu forma de trabajar.

Cinco usos reales para quien trabaja con webs

Las guías suelen quedarse en «instálalo y pregúntale cosas». Como llevo años haciendo webs y posicionamiento, te cuento en qué lo uso de verdad, porque el valor no está en el juguete sino en el trabajo que te quita de encima.

  • Primeros borradores de descripciones de producto. Un catálogo de 500 referencias no lo escribes a mano ni lo pagas por consumo. Le paso las fichas técnicas y me devuelve borradores; después los reviso y reescribo yo. La materia prima la pone la máquina, el texto que se publica lo pongo yo.
  • Clasificar los mensajes del formulario de contacto. Presupuesto, soporte, spam o proveedor. Es una tarea aburrida, repetitiva y perfecta para un modelo pequeño, y son datos personales que así no salen de mi equipo.
  • Limpiar y ordenar datos antes de importarlos. Hojas de cálculo de clientes con las categorías mal escritas, direcciones en cinco formatos distintos, nombres con mayúsculas aleatorias. Un modelo local normaliza todo eso en minutos.
  • Traducir contenidos entre italiano y español. Trabajo en los dos idiomas a diario. Para una primera pasada va sobrado; la revisión final sigue siendo humana, porque el matiz y el tono no los acierta.
  • Leer documentación larga y extraerme lo que necesito. Un manual técnico de sesenta páginas, la pregunta concreta, la respuesta. Aquí conviene subir la memoria con OLLAMA_CONTEXT_LENGTH, si no se pierde a mitad del documento.

Fíjate en el patrón: en los cinco casos el modelo hace el trabajo pesado y sin gracia, y la decisión final la tomo yo. En cuanto he intentado saltarme ese segundo paso, el resultado se ha notado. Y se nota también en Google, que lleva tiempo distinguiendo bastante bien un texto trabajado de uno generado y publicado tal cual.

¿Ollama es gratis? Sí, pero hay un matiz que importa

Es la pregunta que más veo circular, y la respuesta honesta tiene dos partes.

Ollama en tu ordenador es gratis y sigue siendo gratis: cero euros, sin límite de uso, sin tarjeta. Descargas el programa, descargas los modelos públicos y los usas cuanto quieras. Ese es el plan Free, y para la inmensa mayoría de la gente es todo lo que hace falta.

Desde hace un tiempo, eso sí, Ollama ofrece también modelos «cloud»: modelos demasiado grandes para un ordenador normal, que corren en los servidores de la empresa y que tú manejas desde la misma terminal. Esos sí se pagan a partir de cierto uso, y ahí el listado cambia:

PlanPrecioQué cambia
Free0 $Modelos en tu hardware, datos privados, uso ilimitado, más de 40.000 integraciones
Pro20 $/mes (200 $/año)Modelos cloud más grandes, 3 en paralelo, 50 veces el uso cloud del plan gratuito
Max100 $/mes10 modelos cloud en paralelo. Altas nuevas suspendidas por falta de capacidad
Team25 $ por puesto/mesMínimo 5 puestos, próximamente

El detalle que mejor explica lo rápido que está creciendo esto: Ollama ha suspendido las altas nuevas del plan Max porque el tráfico en su nube más que se duplica cada mes, y en su explicación citan la llegada de modelos cada vez más grandes como Kimi K3, el modelo chino de 2,8 billones de parámetros.

Traducido: si lo que te interesa es la IA en local por privacidad y por coste, no vas a pagar nunca. Si acabas tirando de los modelos cloud, estás volviendo justo al modelo de gasto del que querías salir —un razonamiento que desarrollé en el artículo sobre cuánto estás pagando de verdad por la IA.

Ollama, LM Studio o Jan: cuál te conviene

Ollama no es la única forma de mover modelos en tu equipo, y según cómo trabajes puede no ser la mejor para ti. Estas son las tres opciones que se manejan hoy:

HerramientaCómo esPara quién
OllamaTerminal por defecto, interfaz gráfica opcional. API local y muchísimas integracionesQuien automatiza, programa o quiere conectarlo con otras herramientas
LM StudioAplicación de escritorio con ventana propia desde el minuto uno; su versión actual, Bionic, funciona además como agenteQuien quiere probar modelos sin tocar la terminal
JanCódigo abierto, se define como un sustituto de ChatGPT que funciona en localQuien busca sencillez y una alternativa abierta

Mi recomendación sincera: si solo quieres curiosear y no te apetece pelearte con comandos, empieza por LM Studio. Si en cambio piensas conectar el modelo a tus procesos —guiones, automatizaciones, tu editor de código— Ollama es la opción, porque esa API local no la tienen las demás con la misma facilidad.

Privacidad, RGPD y el reglamento europeo de IA

Este apartado importa especialmente si trabajas con clientes en España o en cualquier país de la Unión Europea, y es el que ninguna guía sobre Ollama toca.

Cuando usas un servicio de IA online y le pegas datos de un cliente, estás enviando información personal a un tercero, casi siempre fuera de la UE. Eso no está prohibido, pero obliga a tener las cosas en regla: base legal, contrato de encargo de tratamiento, información al cliente. Ejecutar el modelo en tu propio ordenador elimina ese envío, y con él buena parte del problema: no hay transferencia porque el dato no se mueve de tu máquina.

Ojo, y lo digo claro: esto no te convierte automáticamente en cumplidor del RGPD. Sigues teniendo que tratar esos datos como toca, con su base legal y sus medidas de seguridad —empezando por cifrar el disco del portátil donde tienes los modelos. Lo que hace el uso en local es quitar de la ecuación la parte más incómoda, la cesión a terceros, no la obligación entera.

Sobre el Reglamento europeo de IA: desde el 2 de agosto de 2026 la Comisión puede ejercer sus poderes sancionadores. Afecta sobre todo a quien desarrolla o pone en el mercado sistemas de IA, no a quien usa un modelo para redactar borradores. Aun así, si trabajas con administraciones públicas o con datos sensibles, conviene revisar la licencia concreta del modelo que estés usando: no todos los modelos «abiertos» llevan una licencia estándar, y las exenciones previstas dependen justo de esas condiciones.

Ejecutarlo dentro de Docker

Si ya te manejas con Docker —el sistema que hace funcionar programas dentro de «contenedores» aislados del resto del equipo— Ollama tiene imagen oficial. Sirve sobre todo en un servidor, o si quieres tenerlo separado del resto de la máquina:

docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

Con una gráfica Nvidia hay que añadir --gpus=all; si no, el contenedor tira solo de procesador y la diferencia se nota bastante. Si Docker es terreno nuevo para ti, déjalo: la instalación normal hace lo mismo con la mitad de complicaciones.

Problemas habituales y cómo se resuelven

  • Va lentísimo. Nueve de cada diez veces está corriendo en el procesador en vez de en la gráfica. Compruébalo con ollama ps: ahí ves qué está cargado y dónde. Si no usa la GPU, casi siempre es cosa de actualizar controladores —en Nvidia hace falta la versión 550 como mínimo.
  • Se ha llenado el disco. Nos pasa a todos, los modelos ocupan desde unos gigas hasta cientos. Haz ollama ls para ver lo que has acumulado y ollama rm para quitar lo que no usas.
  • Se olvida de lo que le has escrito antes. No es un fallo: es el límite de 4.096 tokens de memoria. Súbelo con OLLAMA_CONTEXT_LENGTH, teniendo en cuenta que más memoria significa más RAM ocupada.
  • Cuadraditos raros en la barra de progreso en Windows 10: es solo la fuente de la terminal, que no digiere los símbolos que usa. Cambia de fuente y desaparecen.
  • Cómo se actualiza. En Windows y Mac las actualizaciones llegan solas: pinchas en el icono y eliges reiniciar. En Linux se relanza el script de instalación. La última versión, la 0.32.5, es del 27 de julio de 2026.

Cuándo compensa de verdad y cuándo no

Después de un par de años usándolo en trabajo real, me he hecho una idea bastante clara de dónde rinde y dónde no.

Compensa cuando los datos no deben salir: documentos de clientes, textos aún sin publicar, bases de datos. Compensa para el trabajo repetitivo y de mucho volumen —ordenar listados, clasificar consultas, preparar borradores de descripciones— donde la calidad que necesitas es media pero la cantidad es alta, y pagar por consumo tendría poco sentido. Y compensa para aprender: tener un modelo a mano para destriparlo enseña mucho más que leer artículos, este incluido.

No compensa si tu ordenador no tiene una gráfica decente: pasarás más tiempo esperando que trabajando. No compensa si esperas la calidad de ChatGPT o Claude, porque no la hay —y quien te diga lo contrario te está vendiendo algo. Y no compensa para los textos que van delante del cliente: los uso para el primer borrador, nunca para la versión final. Cuando un contenido tiene que posicionar en Google el trabajo es otro, y es de lo que me ocupo en la consultoría SEO: un modelo te ahorra tiempo en la materia prima, no te pone primero.

Mi regla, después de unas cuantas pruebas equivocadas, se ha vuelto simple: local para el trabajo de volumen y para todo lo confidencial, servicios online para lo que exige calidad de razonamiento. No compiten, hacen dos oficios distintos.

Preguntas frecuentes

¿Ollama es gratis?
Sí. Descargar el programa y mover los modelos en tu ordenador no cuesta nada y no tiene límite de uso. Existen planes de pago (Pro a 20 $ al mes, Max a 100 $) pero solo afectan a los modelos «cloud», los que corren en los servidores de Ollama: para el uso en local no hacen falta.

¿Hace falta tarjeta gráfica para usar Ollama?
No, funciona también sin ella, pero la diferencia de velocidad es enorme. Sin gráfica dedicada conviene quedarse en modelos pequeños, de 1 a 3 mil millones de parámetros. Con una Nvidia reciente o un Mac con chip Apple puedes subir tranquilamente a 7-8 mil millones.

¿Cuánto espacio ocupa en el disco?
El programa solo, unos 4 GB. Los modelos son el peso real: van desde unos cientos de megas los más pequeños hasta decenas o cientos de gigas los más grandes. Puedes mover la carpeta de modelos a otro disco con la variable OLLAMA_MODELS.

¿Mis datos se quedan de verdad en mi ordenador?
Sí, si usas los modelos en local: la pregunta no sale de la máquina y puedes trabajar incluso desconectado. Otra cosa son los modelos cloud, que por definición envían los datos a los servidores de Ollama.

¿Puedo usar Ollama en español?
Sí. Los modelos actuales son multilingües y responden en español sin configurar nada: basta con escribirle en español. Eso sí, los modelos pequeños se defienden mejor en inglés, así que si notas respuestas flojas prueba a subir de tamaño antes de descartarlo.

¿Qué modelo elijo para empezar?
Empieza por uno pequeño, como llama3.2 en su versión de 3 mil millones de parámetros, y mira cómo responde el ordenador. Si va fluido sube a uno de 7-8 mil millones. Es mucho mejor un modelo pequeño que contesta al momento que uno grande que te hace esperar.

¿Se puede usar con una ventana de chat normal?
Sí, instalando Open WebUI con Docker: te deja una interfaz muy parecida a la de ChatGPT en http://localhost:3000, con historial de conversaciones y selector de modelos. Es el paso que convierte Ollama en algo que usas a diario.

¿Ollama sustituye a ChatGPT?
Para ciertos trabajos sí, para otros no. Resúmenes, traducciones, reordenar textos y primeros borradores los hace bien. En razonamiento complejo los modelos que caben en un ordenador normal se quedan por detrás de los grandes servicios online, y es justo saberlo antes de empezar.

¿Cómo lo desinstalo?
En Windows, desde el panel de aplicaciones instaladas. En Mac se elimina Ollama de la carpeta Aplicaciones, luego el enlace /usr/local/bin/ollama y las carpetas de apoyo. Acuérdate de borrar también ~/.ollama, o los modelos se quedan ahí ocupando sitio.

Fuentes

Avatar de Daniele Forciniti