Yeda AI Tips · #046

English

Ejecuta Cualquier Modelo de I.A. Abierto en Tu Propia Computadora, Gratis

Cada vez que chateas con una I.A. en la nube, una solicitud sale de tu máquina, un medidor de tokens empieza a correr y tu prompt queda en el servidor de otra persona. Nada de eso es obligatorio. Los modelos de pesos abiertos pueden ejecutarse por completo en tu propia laptop, gratis, con una sola herramienta: Ollama.

El problema con la I.A. solo en la nube

Las APIs en la nube son excelentes para escalar, pero cuestan dinero por token, necesitan conexión a internet y envían tus datos fuera del dispositivo. Para mucho uso cotidiano — redacción, ayuda con código, preguntas rápidas, notas privadas — nada de ese compromiso es necesario. Una laptop moderna puede ejecutar un modelo abierto genuinamente útil de forma local, y una vez descargado, funciona sin conexión y no cuesta nada por consulta.

Por qué funciona

Los modelos de pesos abiertos se distribuyen como archivos descargables. Ollama empaqueta los pesos del modelo, un runtime y una CLI/API sencilla en una sola instalación. Se encarga de las partes que antes requerían conocimientos reales de ML-ops — cuantización, detección de GPU/CPU, gestión de memoria — detrás de un solo comando.

Cómo hacerlo

  1. Instala Ollama. Ve a ollama.com y descarga el instalador para tu sistema operativo (macOS, Windows, Linux). Instala un servicio en segundo plano más una CLI ollama.
  2. Descarga y ejecuta un modelo. En tu terminal: ollama run llama2. La primera vez que ejecutas un nombre de modelo dado, Ollama lo descarga (unos pocos GB, según el tamaño). Cada ejecución posterior arranca casi al instante, porque los pesos ya están en el disco.
  3. Chatea. Una vez que carga, obtienes un prompt directo en la terminal — escribes y responde, por completo en tu propio hardware.
  4. Elige un tamaño que quepa en tu RAM. Los modelos más pequeños (7B parámetros o menos) corren cómodamente en la mayoría de las laptops con 8–16GB de RAM. Los modelos más grandes necesitan más memoria e idealmente una GPU. Si un modelo no carga o va dolorosamente lento, prueba con uno más pequeño — ollama run llama2:7b en lugar de una variante de 70B, por ejemplo.
  5. Cambia cuando quieras. Otra tarea, otro modelo — solo ejecuta un nombre distinto (ollama run mistral, ollama run gemma, etc.). Ollama conserva localmente lo que hayas descargado, así que cambiar es instantáneo después de la primera descarga.

Dónde encaja esto

Trampas comunes

Trucos avanzados

Recursos

¿Estás construyendo una función de IA? Yeda AI diseña, audita y lanza sistemas LLM en producción.

Hablemos · Lee el blog