Principiante 10 minPrompting

Tu primera conversación locale

Respuesta directa

Para hacer preguntas a un LLM local, arranca un modelo con ollama run, escribe una solicitud completa en una o dos frases con el texto que quieras procesar, lee la respuesta y luego corrígela con una instrucción precisa en lugar de empezar de nuevo. Nada de lo que escribas sale de tu máquina. En unos quince minutos, habrás hecho un resumen, un correo y un poco de código, y habrás comprendido cómo corregir una respuesta fallida.

Ollama está instalado y, delante de ti, parpadea un cursor. Este tutorial del primer día te guía para mantener una conversación real: ejecutar un modelo adecuado para la memoria de tu equipo, formular peticiones que funcionen, usar los comandos de sesión, detectar cuándo el modelo se desvía y evitar las trampas del contexto y de la memoria.

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux

#Lo que sabrás hacer en este tutorial

Vas a pedir un resumen, hacer que el modelo redacte un correo, obtener un pequeño script, probar una pregunta fuera del ámbito del modelo y luego corregir una respuesta que va por el camino equivocado. Estas prácticas te permiten desenvolverte de forma autónoma. La guía parte de que Ollama ya está instalado: si no es así, empieza por la guía de instalación de tu sistema. Para profundizar en cómo formular una instrucción, continúa con la guía sobre los fundamentos del prompting.

#Elegir un modelo que quepa en tu máquina

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

El modelo es un archivo de varios gigabytes: debe caber en la memoria de vídeo de tu tarjeta o en la memoria RAM de un Mac o de un PC sin tarjeta dedicada. La página de Gemma 4 en la biblioteca de Ollama enumera las variantes y sus tamaños de descarga. Una variante demasiado grande para tu máquina funcionará, pero lentamente, recurriendo al procesador.

Variantes de Gemma 4 en la biblioteca Ollama (tamaño indicado por Ollama)
EtiquetaTamaño de descargaMemoria necesaria
gemma4:e2b4,6 a 7,5 GBMáquinas de 8 GB
gemma4 (e4b, por defecto)6,6 a 9,5 GBMáquinas de 12 a 16 GB
gemma4:12b7,7 a 8,0 GBMáquinas de 16 GB o más
gemma4:26b16 a 19 GBTarjetas de 24 GB o más
gemma4:31b19 a 20 GBTarjetas de 24 a 32 GB, contexto reducido

La columna de la derecha es nuestra estimación prudente: suma a las cantidades anteriores la memoria del contexto y un margen para el sistema. En caso de duda, elige la variante más pequeña: una respuesta rápida de un modelo pequeño enseña más que una respuesta muy lenta de un modelo grande. Puedes cambiar de modelo en cualquier momento.

#Tu primera sesión, paso a paso

Calcula unos quince minutos para recorrer los ocho pasos siguientes. Van desde el inicio hasta la comprobación de una respuesta. Cada paso es independiente: puedes detenerte después del segundo y volver más tarde; lo único que pierdes al cerrar la sesión es el historial de la conversación, que el terminal no conserva.

#1. Iniciar el modelo

Primer inicio
ollama run gemma4:e2b

El comando ollama run gemma4 aparece en la documentación de Ollama como ejemplo de ejecución de un modelo. La primera vez que lo ejecutas, el modelo se descarga: el tiempo depende de su tamaño y de tu conexión. Después, aparece un indicador de entrada y el modelo espera tu mensaje. No sucede nada mientras no escribas.

i
Tus mensajes se quedan en tu equipo
La FAQ de Ollama indica que cuando ejecutas un modelo localmente, Ollama no ve tus prompts ni tus datos. Esto no es cierto para los modelos en la nube, que envían tus mensajes a los servidores del proveedor: verifica que el nombre del modelo no termine en cloud.

#2. Habla con él en frases completas

Primer error habitual: escribir palabras clave como en un motor de búsqueda. Un modelo de lenguaje no busca documentos, continúa un texto. Describe, por tanto, lo que quieres, con el contexto y el resultado esperado.

Una solicitud vaga, luego una solicitud completa
# Trop vague
résumer réunion points importants

# Précis
Voici des notes de réunion. Résume-les en 5 puces : d'abord les décisions
prises, puis les actions à faire avec leur responsable.

Notes :
- Alice propose de migrer vers Postgres d'ici juin
- Bob rappelle qu'il faut finir l'audit sécurité avant
- Décision : on migre, mais l'audit passe avant (fin mai)
- Charles s'occupe de l'audit
- Alice s'occupe de la migration

Un esquema que casi siempre funciona: la tarea, los datos a procesar, el formato esperado. Cuatro ejercicios para entrenarte: pedir un resumen de notas personales, redactar un correo de cancelación en tres líneas, pedir una función en Python que cuente las palabras de un archivo, plantear una pregunta a la que el modelo no puede responder, como el contenido de un documento que no le has proporcionado.

#3. Probar lo que el modelo no sabe

El último ejercicio es el más instructivo. Un modelo no consulta ni internet ni tus archivos, salvo que tenga una herramienta conectada: solo conoce lo aprendido durante su entrenamiento y el texto de la conversación. Pídele el contenido de un documento imaginario o información sobre un evento reciente y observa: un buen modelo responde que no sabe; un modelo menos fiable inventa una respuesta plausible. Este comportamiento se llama alucinación. La regla que se deriva de ello: cuanto más precisa, reciente o específica de ti sea la información, más debes incluirla en el prompt o verificarla. Nuestra guía sobre las alucinaciones detalla las contramedidas.

#4. Corregir sin empezar desde cero

¿El modelo responde algo que no viene al caso? No escribas simplemente «no, vuelve a intentarlo»: no ha entendido nada más. Añade una restricción precisa que indique qué falla y qué esperas.

Una intervención de seguimiento específica
Refais, mais en 3 puces maximum et sans jargon technique.
Chaque puce doit tenir sur une ligne.
Longitud
Número de viñetas, de líneas o de palabras.
Ton
Formal, coloquial, periodístico, pedagógico.
Forma
Lista, tabla, JSON, correo, código.
Prohibiciones expresadas positivamente
Prefiere «empieza directamente con la respuesta» a «no digas “aquí tienes”».

#5. Las órdenes de sesión

En la sesión, las líneas que empiezan con una barra oblicua no se envían al modelo: controlan Ollama. El comando /? muestra la lista completa.

/set parameter num_ctx 8192
Fija el tamaño del contexto para la sesión: la FAQ de Ollama cita este comando para cambiar la ventana.
/set system
Define un mensaje de sistema, un rol permanente para la sesión.
/show info
Muestra la información del modelo cargado: arquitectura, tamaño, longitud de contexto, cuantización.
/clear
Elimina el contexto de la conversación actual sin retirar el modelo de la memoria.
/bye
Cierra la sesión, o presiona Ctrl+D.

Una vez cerrada la sesión, el modelo permanece en memoria durante cinco minutos por defecto, según la FAQ de Ollama, lo que acelera un nuevo inicio. Para retirarlo de la memoria inmediatamente, ejecuta ollama stop seguido del nombre del modelo; ollama ps muestra lo que está cargado e indica la parte ejecutada en la GPU y en la CPU.

#6. Mantener una conversación de varios turnos

El modelo solo recuerda lo que está dentro de la ventana de contexto: en cada turno, la aplicación le devuelve todo el historial. Puedes así encadenar peticiones que se apoyen unas en otras.

Encadenar tres turnos
Je dois écrire un courriel pour annuler une réservation au restaurant.
Fais-le en 3 lignes, poli mais pas guindé.

[réponse du modèle]

Bien. Refais la même, mais plus chaleureuse, et précise que je
reprogrammerai dans 15 jours.

[réponse du modèle]

Parfait. Traduis-la en anglais.

El límite es el tamaño del contexto. Según la documentación de Ollama, el valor predeterminado es de unos 4.000 tokens con menos de 24 GiB de VRAM, 32k entre 24 y 48 GiB y 256k por encima de esa cifra. Cuando el historial supera la ventana, los intercambios más antiguos se pierden. Si el modelo «olvida» el comienzo de una sesión larga, aumenta la ventana con el comando num_ctx, teniendo en cuenta que cada token de contexto consume memoria.

#7. Pedir código y verificarlo

El código es un buen campo de pruebas, porque el resultado se puede comprobar. Indica el lenguaje, la entrada, la salida esperada y una restricción: «Escribe una función en Python que reciba la ruta de un archivo de texto y devuelva el número de palabras. Responde solo con el código y luego con una frase de explicación». Copia el código en un archivo, ejecútalo con un caso cuya respuesta conoces y, si aparece un error, pega el mensaje de error completo en la conversación y pide que lo corrija. Este ciclo de petición, ejecución y corrección funciona mejor que pedir un código perfecto a la primera.

#8. Leer una respuesta con ojo crítico

Una respuesta fluida no es una respuesta exacta. El modelo genera texto plausible; no verifica. Acostúmbrate a comprobar lo importante antes de utilizarlo.

Números y fechas
Contrástalos con una fuente: son los elementos que los modelos inventan más fácilmente.
Nombres, referencias y citas
Verifica que existan. Un modelo puede inventar un título de una obra o un artículo de ley que suene convincente.
Código
Ejecútalo antes de confiar en él, y revisa lo que hace con tus archivos.
Coherencia
Formula la misma pregunta de dos maneras: si las respuestas divergen, desconfía de ambas.

Una buena costumbre es proporcionar tú mismo el texto de referencia y pedir al modelo que cite el pasaje que justifique cada afirmación. Así, puedes comprobarlo en unos segundos, en lugar de tener que buscarlo todo.

#¿Quedarse en el terminal o pasar a una interfaz?

Tres formas de dialogar con un modelo local
VíaVentajaLímite
Terminal (ollama run)Sin instalación adicional, ideal para un primer intentoSin un historial organizado, poca comodidad para textos largos
Interfaz de chat (Open WebUI, LM Studio, Jan)Historial, archivos adjuntos, formato legibleUna instalación adicional
API (scripts)Automatización, integración con tus herramientasRequiere un poco de código

Empieza por el terminal para entender el principio, luego pasa a una interfaz en cuanto pegues textos largos o quieras volver a encontrar tus conversaciones. Ambos se pueden combinar: el modelo descargado una vez con Ollama también sirve para las interfaces, sin una segunda descarga, siempre que utilicen el mismo servidor local.

#Cuando algo falla

Síntomas comunes y soluciones
SíntomaCausa probableSolución
Respuestas muy lentasEl modelo se ejecuta parcialmente en la CPUEjecuta ollama ps, luego elige una variante más pequeña o reduce el contexto
El modelo olvida el comienzoVentana de contexto llenaAumenta num_ctx o empieza de nuevo con un resumen
Respuesta en inglésInstrucción o modelo orientado al inglésEscribe «responde en francés» en la solicitud o en /set system
Texto inventadoInformación ausente del promptProporciona el texto original y pide citar el pasaje
Error de modelo no encontradoNombre o etiqueta incorrectosRevisa la ortografía en la página del modelo en la biblioteca de Ollama

Para ajustar con mayor precisión la creatividad, la documentación del Modelfile de Ollama resume el efecto de la temperatura: cuanto más alta es, más creativo es el modelo; cuanto más baja, más coherente. La guía sobre la temperatura y el top-p detalla los valores que puedes probar.

#¿Y después de esta primera conversación?

Un rol permanente
La guía sobre los system prompts muestra cómo dar reglas estables al modelo.
Una interfaz más cómoda
Open WebUI o LM Studio añaden historial, archivos adjuntos y un formato legible.
Tus propios documentos
El RAG permite consultar tus archivos sin pegarlos cada vez.
FAQ
¿Cómo hacer la primera consulta a un LLM?+
Inicia un modelo con ollama run seguido de su nombre, espera a que aparezca el indicador de entrada y luego escribe una solicitud completa: la tarea, el texto que se debe procesar y el formato esperado. Lee la respuesta y después corrígela con una instrucción precisa en lugar de empezar de nuevo. Unos pocos intercambios bastan para comprender lo que el modelo sabe hacer.
¿Se necesita conexión a internet para hablar con un modelo local?+
Solo para descargar el modelo. Después, la conversación se desarrolla en tu máquina, sin conexión. La FAQ de Ollama especifica que, cuando ejecutas un modelo en local, Ollama no ve ni tus prompts ni tus datos. En cambio, los modelos con el sufijo cloud funcionan en servidores remotos y requieren una conexión.
¿Cómo salir de una conversación en Ollama?+
Escribe /bye o usa Ctrl+D para cerrar la sesión. El modelo permanece cargado en memoria durante cinco minutos por defecto, lo que acelera el siguiente inicio. Para descargarlo de la memoria inmediatamente, ejecuta ollama stop seguido del nombre del modelo, y ollama ps para verificar qué sigue cargado.
¿Por qué el modelo olvida el comienzo de la conversación?+
Porque el historial supera la ventana de contexto. Ollama utiliza por defecto alrededor de 4.000 tokens cuando hay menos de 24 GiB de VRAM. Aumenta el valor con /set parameter num_ctx en la sesión, comprobando que el modelo siga cabiendo en la GPU, o resume la conversación antes de continuar.
¿Qué modelo elegir para empezar?+
Elige el modelo más pequeño que ofrezca una calidad aceptable de la familia que quieras probar y que se ajuste a tu memoria: un modelo que responda rápido te enseña más que un modelo grande muy lento. Con 8 GB, la variante e2b de Gemma 4 pesa aproximadamente entre 4,6 y 7,5 GB. Después, pasa a un modelo más grande si la calidad te decepciona.
¿Puede el modelo leer mis archivos o internet?+
Por defecto, no. Solo dispone de lo aprendido durante su entrenamiento y del texto de la conversación. Para que lea tus documentos o busque en internet, debes conectarle una herramienta, por ejemplo una interfaz como Open WebUI con RAG o búsqueda web. De lo contrario, pega el texto en el prompt.

#Para ir más allá

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.