Agents IA et pipelines LLM - RAG, évaluation et garde-fous qui survivent à la production
Présentation du service
CE QUE TU OBTIENS
- Pipelines RAG : stratégie de fragmentation et d’indexation, récupération hybride, reclassement, et un harnais d’évaluation qui évalue le récupérateur séparément du générateur
- Agents et flux de travail en plusieurs étapes : appel d’outils, état, retentions, contrôle du budget et du timeout, points de contrôle humain dans la boucle
- Garde-corps : validation des entrées et sorties, chemins de refus et de repli, gestion des informations personnelles (PII), résistance à l’injection immédiate
- Évaluation et observabilité : ensembles dorés, exécutions de régression en CI, traçage par requête, suivi des coûts de jetons et de latence
POURQUOI C’EST IMPORTANT
La plupart des fonctionnalités des LLM fonctionnent en démo et s’effondrent sur le trafic réel. Je mesure la qualité de récupération au lieu de deviner, et je branche les métriques dans CI pour qu’un changement d’indice ou de prompt soit un chiffre que vous pouvez voir avant de le livrer.
CONTEXTE
10+ ans en tant qu’ingénieur backend, ayant récemment construit une plateforme ETL à l’échelle pétaoctets avec des couches de traitement LLM par-dessus. Python, Go, TypeScript, bases de données vectorielles, OpenTelemetry, AWS.
COMMENT ON COMMENCE
Envoie-moi le problème et ce qui existe aujourd’hui. Tu obtiens une approche, un gros champ d’action et une estimation avant que tout travail ne commence. Les audits courts et prototypes sont les bienvenus ; les missions plus longues facturées à l’heure avec des mises à jour écrites hebdomadaires.
