Ejecuta Cualquier Modelo de I.A. Abierto en Tu Propia Computadora, Gratis
Cada vez que chateas con una I.A. en la nube, una solicitud sale de tu máquina, un medidor de tokens empieza a correr y tu prompt queda en el servidor de otra persona. Nada de eso es obligatorio. Los modelos de pesos abiertos pueden ejecutarse por completo en tu propia laptop, gratis, con una sola herramienta: Ollama.
El problema con la I.A. solo en la nube
Las APIs en la nube son excelentes para escalar, pero cuestan dinero por token, necesitan conexión a internet y envían tus datos fuera del dispositivo. Para mucho uso cotidiano — redacción, ayuda con código, preguntas rápidas, notas privadas — nada de ese compromiso es necesario. Una laptop moderna puede ejecutar un modelo abierto genuinamente útil de forma local, y una vez descargado, funciona sin conexión y no cuesta nada por consulta.
Por qué funciona
Los modelos de pesos abiertos se distribuyen como archivos descargables. Ollama empaqueta los pesos del modelo, un runtime y una CLI/API sencilla en una sola instalación. Se encarga de las partes que antes requerían conocimientos reales de ML-ops — cuantización, detección de GPU/CPU, gestión de memoria — detrás de un solo comando.
Cómo hacerlo
- Instala Ollama. Ve a ollama.com y descarga el instalador para tu sistema operativo (macOS, Windows, Linux). Instala un servicio en segundo plano más una CLI
ollama. - Descarga y ejecuta un modelo. En tu terminal:
ollama run llama2. La primera vez que ejecutas un nombre de modelo dado, Ollama lo descarga (unos pocos GB, según el tamaño). Cada ejecución posterior arranca casi al instante, porque los pesos ya están en el disco. - Chatea. Una vez que carga, obtienes un prompt directo en la terminal — escribes y responde, por completo en tu propio hardware.
- Elige un tamaño que quepa en tu RAM. Los modelos más pequeños (7B parámetros o menos) corren cómodamente en la mayoría de las laptops con 8–16GB de RAM. Los modelos más grandes necesitan más memoria e idealmente una GPU. Si un modelo no carga o va dolorosamente lento, prueba con uno más pequeño —
ollama run llama2:7ben lugar de una variante de 70B, por ejemplo. - Cambia cuando quieras. Otra tarea, otro modelo — solo ejecuta un nombre distinto (
ollama run mistral,ollama run gemma, etc.). Ollama conserva localmente lo que hayas descargado, así que cambiar es instantáneo después de la primera descarga.
Dónde encaja esto
- Ayuda con código y redacción sin enviar tu código a un tercero.
- Chat privado — diario, lluvia de ideas, cualquier cosa que no quieras que salga de tu máquina.
- Trabajo sin conexión — no se necesita conectividad una vez descargado el modelo.
- Experimentación sensible al costo — prueba prompts y flujos de trabajo sin factura de tokens mientras prototipas, y pasa a un modelo alojado solo si necesitas más capacidad.
Trampas comunes
- La RAM, no solo el espacio en disco, es la verdadera restricción. Un modelo puede descargarse bien y aún así ir demasiado lento o no cargar si no cabe cómodamente en memoria junto con todo lo demás que está corriendo.
- Los modelos locales quedan por detrás de los modelos alojados más grandes en capacidad bruta. Para razonamiento de frontera o ventanas de contexto enormes, un modelo en la nube todavía puede ganar — lo local se trata de costo, privacidad y acceso sin conexión, no siempre del mejor puntaje en benchmarks.
- La primera ejecución es lenta por la descarga — eso es normal, no un error. Las ejecuciones posteriores del mismo modelo son rápidas.
- Los modelos cuantizados sacrifican un poco de calidad a cambio de mucho menos tamaño. Si ves una etiqueta como
Q4en el nombre de un modelo, es una versión comprimida — más pequeña y rápida, normalmente lo bastante cercana en calidad para el uso cotidiano.
Trucos avanzados
- Ollama expone una API HTTP local en
http://localhost:11434, así que cualquier app o script en cualquier lenguaje puede llamar a tu modelo local en lugar de a un endpoint en la nube — útil para construir tus propias herramientas encima de él. - Ollama puede mantener varios modelos en disco y alternar entre ellos libremente; usa
ollama listpara ver lo que ya has descargado. - Si prefieres una app de apuntar y hacer clic en vez de una terminal, LM Studio ofrece una GUI sobre la misma idea — el mismo modelo local-first, sin necesidad de CLI.
- Por debajo, herramientas como Ollama y LM Studio están construidas sobre llama.cpp, el motor de inferencia de código abierto que hizo práctico ejecutar estos modelos en hardware común en primer lugar. Si alguna vez quieres convertir o cuantizar tu propio archivo de modelo GGUF, llama.cpp es donde eso ocurre.
Recursos
- ollama.com — descarga y biblioteca de modelos
- LM Studio — alternativa con GUI
- llama.cpp — el motor por debajo
¿Estás construyendo una función de IA? Yeda AI diseña, audita y lanza sistemas LLM en producción.