arrow_backVolver a field notes
AI Publicado 5 ago 2026

IA sin publicidad: Guía para ingeniero en ejercicio

Introducción práctica y fundamentada al uso de LLMs y herramientas de ML en proyectos reales, sin palabras clave ni pensamiento mágico.

La mayoría del contenido sobre IA en internet cae en dos campos: apocalipsis por superinteligencia, o afirmaciones exageradas de que un chatbot reemplazará tu trabajo el martes. Ninguno te ayuda a enviar código. Esta guía salta ambos y recorre cómo usar realmente la generación actual de herramientas de IA en proyectos reales, con los límites explícitos.

Qué hace un LLM

Un modelo de lenguaje grande como GPT-4 o Llama 3 predice el siguiente token en una secuencia, entrenado en enormes cantidades de texto. Eso es todo. No hay verificador de hechos interno, no hay memoria persistente entre sesiones (a menos que la construyas), y no hay comprensión en el sentido que una persona comprende. Cuando le haces una pregunta, está generando una continuación estadísticamente plausible de tu indicación.

Esto importa en la práctica: el modelo generará confiadamente una función Python que llama a un método de librería que no existe, porque ese método suena como algo que la librería tendría. Siempre ejecuta el código. Siempre verifica la referencia de API. Trata la salida del modelo como un borrador de un pasante rápido y bien leído que a veces miente sin saberlo.

Un flujo real: usar un LLM para código

Aquí hay un patrón que funciona en lugar de solo pedirle a ChatGPT que "construya una aplicación":

  1. Escribe la firma de la función y el docstring tú mismo, especificando tipos y casos límite.
  2. Pídele al modelo que lo implemente contra esa especificación exacta.
  3. Escribe tus propias pruebas por separado — no le pidas al modelo que escriba pruebas para código que acaba de escribir, tenderá a escribir pruebas que pasen trivialmente.
  4. Ejecuta las pruebas. Retroalimenta fallos como nuevas indicaciones, no declaraciones vagas "no funciona".
def parse_duration(text: str) -> int:
    """
    Parse strings like '1h30m', '45s', '2d' into total seconds.
    Raise ValueError on invalid input.
    """

Darle al modelo este contrato exacto produce salida mucho mejor que una descripción vaga, y te da algo concreto para probar.

Generación aumentada por recuperación, en términos sencillos

RAG se tira como palabra clave pero el mecanismo es simple: en lugar de depender de lo que el modelo memorizó durante el entrenamiento, recuperas documentos relevantes al momento de la consulta y los metes en la indicación.

Una configuración básica:

  1. Divide tus documentos (500-1000 tokens cada uno es un punto de partida común).
  2. Incrusta cada fragmento con un modelo como text-embedding-3-small o un modelo abierto como bge-small-en.
  3. Almacena vectores en algo como Postgres con pgvector, o una tienda dedicada como Qdrant.
  4. Al momento de la consulta, incrusta la pregunta del usuario, ejecuta una búsqueda de similitud (distancia coseno es estándar), y tira los fragmentos top-k en la indicación junto a la pregunta.
SELECT content FROM docs
ORDER BY embedding <=> '[0.012, -0.045, ...]'
LIMIT 5;

Por eso un chatbot entrenado con datos hasta una fecha límite puede seguir respondiendo preguntas sobre tu wiki interno de la semana pasada. No está razonando sobre tu compañía — está leyendo tus documentos y resumiéndolos.

Dónde el ML clásico sigue ganando

No todo problema necesita un transformer. Si estás prediciendo churn desde datos tabulares estructurados — antigüedad de cuenta, frecuencia de uso, tickets de soporte — un modelo de árbol potenciado por gradiente como XGBoost o LightGBM usualmente superará un enfoque basado en LLM, entrenará en minutos en lugar de horas, y costará una fracción para ejecutar. Recurre a RandomForestClassifier de scikit-learn o XGBoost antes de recurrir a una llamada de API, especialmente cuando tus datos caben en una hoja de cálculo y tu variable objetivo es un número o categoría limpia.

Costo y latencia son restricciones de diseño, no reflexiones posteriores

Una llamada de clase GPT-4 cuesta dinero real por token y toma segundos reales para devolver. Si estás construyendo una característica que se ejecuta en cada carga de página para cada usuario, eso se suma rápido y la latencia será visible. Cachea agresivamente, usa un modelo más pequeño como GPT-4o-mini o un Llama 3 8B local para cualquier cosa que no necesite razonamiento de nivel superior, y reserva las costosas llamadas de modelo para las partes de tu pipeline donde la calidad realmente importa.

El modo de fallo del que nadie te advierte

Los modelos alucina más, no menos, cuando les pides cosas ligeramente fuera de su distribución de entrenamiento — versiones de librería oscura, jerga interna de compañía, números de CVE recientes. Si la respuesta necesita ser exactamente correcta (un aviso de seguridad, una cita legal, una dosis médica), no confíes en generación sola. Verifica contra una fuente primaria cada vez, y construye ese paso de verificación en tu pipeline en lugar de confiar en revisión humana después de hecho.

Las herramientas de IA son genuinamente útiles una vez que dejas de esperar que piensen y empiezas a tratarlas como un clasificador de patrones rápido que tienes que verificar. Construye el paso de verificación desde el primer día y obtendrás valor real en lugar de un flujo de tonterías confiadas.

Si quieres ir más lejos, consulta las pistas de Python y Data Science de Korra Studio para los fundamentos que hacen que trabajar con estas herramientas sea realmente productivo.

Escrito con asistencia de IA, revisado y publicado por Michal Pilch (CISSP), Korra Studio.

¿Listo para ir más allá?

Esta es una nota de la base de conocimiento de Korra Studio — la plataforma combina cada tema con mentoría 1 a 1.

Empezar gratisarrow_forward