Pista Técnica
Cursos para quien ya construye con LLM y necesita que el sistema aguante producción. Requiere saber programar.
Escritos sin atarse a ninguna herramienta ni versión de modelo: lo que se enseña acá sigue valiendo cuando cambien las librerías. Donde algo no se sabe con certeza, el curso lo dice en vez de rellenar.
Evaluación de sistemas con LLM
Cómo saber si tu cambio de prompt mejoró algo o rompió otra cosa: datasets, LLM como juez y sus sesgos, y suites de regresión.
🎓 3 niveles📚 12 lecciones
1. Por Qué Necesitás Evals
- •El problema: no sabés si tu cambio mejoró algo
- •Tu conjunto de evaluación: de dónde sale y cómo se arma
- •Qué se puede medir de verdad, y qué no
- •El error de los números pequeños
2. LLM como Juez
- •LLM como juez: cómo funciona y por qué se usa tanto
- •Los sesgos del juez, y qué hacer con cada uno
- •Calibrar el juez contra humanos
- •Rúbricas que producen acuerdo
3. Evals en tu Ciclo de Trabajo
- •La suite de regresión: que un arreglo no rompa lo de antes
- •Offline y online: dos preguntas distintas
- •Trazas: sin observabilidad no hay diagnóstico
- •Tu sistema mínimo de evals, funcionando esta semana
RAG que funciona: recuperación, no magia
Por qué tu chatbot con documentos responde mal: troceado, límites reales de los embeddings, búsqueda híbrida, reranking y cómo medir cada paso.
🎓 3 niveles📚 12 lecciones
1. Por Qué Falla la Recuperación
- •RAG es búsqueda antes que generación
- •Troceado: la decisión que más impacta y menos se piensa
- •Embeddings: qué capturan y qué no
- •Medir la recuperación sola
2. Recuperar Mejor
- •Búsqueda híbrida: por qué BM25 sigue vivo
- •Reranking: el paso que casi nadie pone
- •Metadatos y filtrado: la mejora más barata
- •La consulta del usuario no es la consulta de búsqueda
3. RAG en Producción
- •Perdido en el medio: el orden del contexto importa
- •Citar, y saber decir que no sabés
- •El índice cambia: mantenimiento y datos que caducan
- •Cuándo RAG no es la respuesta
Seguridad de aplicaciones con LLM
Inyección de prompt directa e indirecta, herramientas con demasiado permiso y fuga de datos: por qué no hay solución y cómo reducir el radio de daño.
🎓 3 niveles📚 12 lecciones
1. El Problema de Fondo
- •No hay separación entre instrucciones y datos
- •Inyección directa e indirecta: la segunda es la peligrosa
- •El radio de daño: la única variable que controlás
- •OWASP para LLM como mapa, no como certificado
2. Superficies de Ataque
- •Herramientas: donde la inyección se vuelve incidente
- •RAG envenenado: cuando el atacante escribe tu contexto
- •Fuga de datos y del prompt de sistema
- •Coste y disponibilidad como vector de ataque
3. Defensa en Profundidad
- •Mínimo privilegio: la defensa que sí funciona
- •La salida del modelo es entrada no confiable
- •Humano en el bucle, donde de verdad importa
- •Probar tu propio sistema antes que otro