Tu primera conversación locale
Para hacer preguntas a un LLM local, arranca un modelo con ollama run, escribe una solicitud completa en una o dos frases con el texto que quieras procesar, lee la respuesta y luego corrígela con una instrucción precisa en lugar de empezar de nuevo. Nada de lo que escribas sale de tu máquina. En unos quince minutos, habrás hecho un resumen, un correo y un poco de código, y habrás comprendido cómo corregir una respuesta fallida.
Ollama está instalado y, delante de ti, parpadea un cursor. Este tutorial del primer día te guía para mantener una conversación real: ejecutar un modelo adecuado para la memoria de tu equipo, formular peticiones que funcionen, usar los comandos de sesión, detectar cuándo el modelo se desvía y evitar las trampas del contexto y de la memoria.
#Lo que sabrás hacer en este tutorial
Vas a pedir un resumen, hacer que el modelo redacte un correo, obtener un pequeño script, probar una pregunta fuera del ámbito del modelo y luego corregir una respuesta que va por el camino equivocado. Estas prácticas te permiten desenvolverte de forma autónoma. La guía parte de que Ollama ya está instalado: si no es así, empieza por la guía de instalación de tu sistema. Para profundizar en cómo formular una instrucción, continúa con la guía sobre los fundamentos del prompting.
#Elegir un modelo que quepa en tu máquina
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
El modelo es un archivo de varios gigabytes: debe caber en la memoria de vídeo de tu tarjeta o en la memoria RAM de un Mac o de un PC sin tarjeta dedicada. La página de Gemma 4 en la biblioteca de Ollama enumera las variantes y sus tamaños de descarga. Una variante demasiado grande para tu máquina funcionará, pero lentamente, recurriendo al procesador.
| Etiqueta | Tamaño de descarga | Memoria necesaria |
|---|---|---|
| gemma4:e2b | 4,6 a 7,5 GB | Máquinas de 8 GB |
| gemma4 (e4b, por defecto) | 6,6 a 9,5 GB | Máquinas de 12 a 16 GB |
| gemma4:12b | 7,7 a 8,0 GB | Máquinas de 16 GB o más |
| gemma4:26b | 16 a 19 GB | Tarjetas de 24 GB o más |
| gemma4:31b | 19 a 20 GB | Tarjetas de 24 a 32 GB, contexto reducido |
La columna de la derecha es nuestra estimación prudente: suma a las cantidades anteriores la memoria del contexto y un margen para el sistema. En caso de duda, elige la variante más pequeña: una respuesta rápida de un modelo pequeño enseña más que una respuesta muy lenta de un modelo grande. Puedes cambiar de modelo en cualquier momento.
#Tu primera sesión, paso a paso
Calcula unos quince minutos para recorrer los ocho pasos siguientes. Van desde el inicio hasta la comprobación de una respuesta. Cada paso es independiente: puedes detenerte después del segundo y volver más tarde; lo único que pierdes al cerrar la sesión es el historial de la conversación, que el terminal no conserva.
#1. Iniciar el modelo
El comando ollama run gemma4 aparece en la documentación de Ollama como ejemplo de ejecución de un modelo. La primera vez que lo ejecutas, el modelo se descarga: el tiempo depende de su tamaño y de tu conexión. Después, aparece un indicador de entrada y el modelo espera tu mensaje. No sucede nada mientras no escribas.
#2. Habla con él en frases completas
Primer error habitual: escribir palabras clave como en un motor de búsqueda. Un modelo de lenguaje no busca documentos, continúa un texto. Describe, por tanto, lo que quieres, con el contexto y el resultado esperado.
Un esquema que casi siempre funciona: la tarea, los datos a procesar, el formato esperado. Cuatro ejercicios para entrenarte: pedir un resumen de notas personales, redactar un correo de cancelación en tres líneas, pedir una función en Python que cuente las palabras de un archivo, plantear una pregunta a la que el modelo no puede responder, como el contenido de un documento que no le has proporcionado.
#3. Probar lo que el modelo no sabe
El último ejercicio es el más instructivo. Un modelo no consulta ni internet ni tus archivos, salvo que tenga una herramienta conectada: solo conoce lo aprendido durante su entrenamiento y el texto de la conversación. Pídele el contenido de un documento imaginario o información sobre un evento reciente y observa: un buen modelo responde que no sabe; un modelo menos fiable inventa una respuesta plausible. Este comportamiento se llama alucinación. La regla que se deriva de ello: cuanto más precisa, reciente o específica de ti sea la información, más debes incluirla en el prompt o verificarla. Nuestra guía sobre las alucinaciones detalla las contramedidas.
#4. Corregir sin empezar desde cero
¿El modelo responde algo que no viene al caso? No escribas simplemente «no, vuelve a intentarlo»: no ha entendido nada más. Añade una restricción precisa que indique qué falla y qué esperas.
- Longitud
- Número de viñetas, de líneas o de palabras.
- Ton
- Formal, coloquial, periodístico, pedagógico.
- Forma
- Lista, tabla, JSON, correo, código.
- Prohibiciones expresadas positivamente
- Prefiere «empieza directamente con la respuesta» a «no digas “aquí tienes”».
#5. Las órdenes de sesión
En la sesión, las líneas que empiezan con una barra oblicua no se envían al modelo: controlan Ollama. El comando /? muestra la lista completa.
- /set parameter num_ctx 8192
- Fija el tamaño del contexto para la sesión: la FAQ de Ollama cita este comando para cambiar la ventana.
- /set system
- Define un mensaje de sistema, un rol permanente para la sesión.
- /show info
- Muestra la información del modelo cargado: arquitectura, tamaño, longitud de contexto, cuantización.
- /clear
- Elimina el contexto de la conversación actual sin retirar el modelo de la memoria.
- /bye
- Cierra la sesión, o presiona Ctrl+D.
Una vez cerrada la sesión, el modelo permanece en memoria durante cinco minutos por defecto, según la FAQ de Ollama, lo que acelera un nuevo inicio. Para retirarlo de la memoria inmediatamente, ejecuta ollama stop seguido del nombre del modelo; ollama ps muestra lo que está cargado e indica la parte ejecutada en la GPU y en la CPU.
#6. Mantener una conversación de varios turnos
El modelo solo recuerda lo que está dentro de la ventana de contexto: en cada turno, la aplicación le devuelve todo el historial. Puedes así encadenar peticiones que se apoyen unas en otras.
El límite es el tamaño del contexto. Según la documentación de Ollama, el valor predeterminado es de unos 4.000 tokens con menos de 24 GiB de VRAM, 32k entre 24 y 48 GiB y 256k por encima de esa cifra. Cuando el historial supera la ventana, los intercambios más antiguos se pierden. Si el modelo «olvida» el comienzo de una sesión larga, aumenta la ventana con el comando num_ctx, teniendo en cuenta que cada token de contexto consume memoria.
#7. Pedir código y verificarlo
El código es un buen campo de pruebas, porque el resultado se puede comprobar. Indica el lenguaje, la entrada, la salida esperada y una restricción: «Escribe una función en Python que reciba la ruta de un archivo de texto y devuelva el número de palabras. Responde solo con el código y luego con una frase de explicación». Copia el código en un archivo, ejecútalo con un caso cuya respuesta conoces y, si aparece un error, pega el mensaje de error completo en la conversación y pide que lo corrija. Este ciclo de petición, ejecución y corrección funciona mejor que pedir un código perfecto a la primera.
#8. Leer una respuesta con ojo crítico
Una respuesta fluida no es una respuesta exacta. El modelo genera texto plausible; no verifica. Acostúmbrate a comprobar lo importante antes de utilizarlo.
- Números y fechas
- Contrástalos con una fuente: son los elementos que los modelos inventan más fácilmente.
- Nombres, referencias y citas
- Verifica que existan. Un modelo puede inventar un título de una obra o un artículo de ley que suene convincente.
- Código
- Ejecútalo antes de confiar en él, y revisa lo que hace con tus archivos.
- Coherencia
- Formula la misma pregunta de dos maneras: si las respuestas divergen, desconfía de ambas.
Una buena costumbre es proporcionar tú mismo el texto de referencia y pedir al modelo que cite el pasaje que justifique cada afirmación. Así, puedes comprobarlo en unos segundos, en lugar de tener que buscarlo todo.
#¿Quedarse en el terminal o pasar a una interfaz?
| Vía | Ventaja | Límite |
|---|---|---|
| Terminal (ollama run) | Sin instalación adicional, ideal para un primer intento | Sin un historial organizado, poca comodidad para textos largos |
| Interfaz de chat (Open WebUI, LM Studio, Jan) | Historial, archivos adjuntos, formato legible | Una instalación adicional |
| API (scripts) | Automatización, integración con tus herramientas | Requiere un poco de código |
Empieza por el terminal para entender el principio, luego pasa a una interfaz en cuanto pegues textos largos o quieras volver a encontrar tus conversaciones. Ambos se pueden combinar: el modelo descargado una vez con Ollama también sirve para las interfaces, sin una segunda descarga, siempre que utilicen el mismo servidor local.
#Cuando algo falla
| Síntoma | Causa probable | Solución |
|---|---|---|
| Respuestas muy lentas | El modelo se ejecuta parcialmente en la CPU | Ejecuta ollama ps, luego elige una variante más pequeña o reduce el contexto |
| El modelo olvida el comienzo | Ventana de contexto llena | Aumenta num_ctx o empieza de nuevo con un resumen |
| Respuesta en inglés | Instrucción o modelo orientado al inglés | Escribe «responde en francés» en la solicitud o en /set system |
| Texto inventado | Información ausente del prompt | Proporciona el texto original y pide citar el pasaje |
| Error de modelo no encontrado | Nombre o etiqueta incorrectos | Revisa la ortografía en la página del modelo en la biblioteca de Ollama |
Para ajustar con mayor precisión la creatividad, la documentación del Modelfile de Ollama resume el efecto de la temperatura: cuanto más alta es, más creativo es el modelo; cuanto más baja, más coherente. La guía sobre la temperatura y el top-p detalla los valores que puedes probar.
#¿Y después de esta primera conversación?
- Un rol permanente
- La guía sobre los system prompts muestra cómo dar reglas estables al modelo.
- Una interfaz más cómoda
- Open WebUI o LM Studio añaden historial, archivos adjuntos y un formato legible.
- Tus propios documentos
- El RAG permite consultar tus archivos sin pegarlos cada vez.
¿Cómo hacer la primera consulta a un LLM?+
¿Se necesita conexión a internet para hablar con un modelo local?+
¿Cómo salir de una conversación en Ollama?+
¿Por qué el modelo olvida el comienzo de la conversación?+
¿Qué modelo elegir para empezar?+
¿Puede el modelo leer mis archivos o internet?+
#Para ir más allá
- Instalar Ollama en 5 minutos
- Fundamentos del prompting
- Dominar los system prompts
- Comprender la ventana de contexto
- Alucinaciones: cómo limitarlas
- Open WebUI con Ollama: guía completa
- Fuente: Preguntas frecuentes de Ollama
- Fuente: Ollama, longitud de contexto
- Fuente: biblioteca Ollama, Gemma 4
- Fuente: Ollama, referencia del Modelfile
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.