
Neelambar Kumthekar
Neelambar Kumthekar
En 2026, le prompting devient une marchandise. Les ingénieurs qui valent la peine d’être embauchés sont ceux qui font tourner un agent sous réelle charge, le récupèrent quand il plante, et savent exactement ce qu’il faisait à ce moment-là. C’est le travail sur lequel je me concentre.
Expertise en IA de qualité production
───────────────────
Des flux de travail agents durables. J’architecte des systèmes multi-agents en utilisant LangGraph et Temporal. Chez Neptune Technologies, j’ai construit des pipelines soutenus par Temporal qui maintenaient une complétude des données de 99 %+ sur des milliers d’appels vocaux de longue durée — des flux de travail qui survivaient aux plantages, géraient les tentatives et maintenaient l’état sans que personne ne les surveille. Les tâches de longue durée ne disparaissent pas. Ils terminent.
Une IA vocale qui ne ressemble pas à un bot. Je construis des pipelines de voix à faible latence en utilisant LiveKit et WebRTC, avec Deepgram et ElevenLabs dans la pile. L’objectif technique est toujours le même : réduire la perception de latence jusqu’à ce que la conversation devienne réelle. J’ai fait cela en production pour la vérification du décaissement de prêts fintech — un domaine où l’appel doit fonctionner, légalement et techniquement.
Contexte d’entreprise via MCP. J’implémente des serveurs Model Context Protocol qui donnent aux agents un accès sécurisé et structuré à vos CRM, bases de données SQL et outils internes. Chez Neptune, ce contexte unifié à travers 20+ outils SaaS sur une seule couche d’orchestration exécutant cinq LLM simultanément — et réduit la latence d’inférence de 30 % grâce à un cache personnalisé et une E/S asynchrone optimisée.
Observabilité du système dès le premier jour. Chaque système que je propose est instrumenté avant sa mise en service — Langfuse pour le raisonnement des agents et le coût, Prometheus pour l’infrastructure. Si quelque chose tombe en panne en production, vous saurez ce que faisait l’agent et pourquoi avant même de demander.
Livraison et bilan
──────────────
J’ai fait passer des systèmes de prototypes Python à un service conteneurisé de qualité production. Plus tôt dans ma carrière, j’ai développé une automatisation backend chez Cloud4C en gérant 7 000+ événements quotidiens avec une tolérance aux pannes de 99,9 %, réduisant le triage manuel des tickets de 75 %. La discipline de ce travail — services idempotents, gestion adéquate des erreurs, architecture pilotée par événements — se retrouve dans chaque système d’IA que je construis aujourd’hui.
Un client m’a gardé intégré à son équipe de développement ML pendant neuf mois. Dix clients indépendants ont utilisé le même mot pour décrire l’engagement : qualité. Je le mentionne non pas comme un diplôme, mais parce que cela décrit ma façon de fonctionner réellement — et parce que les clients avec qui il vaut la peine de travailler ont tendance à remarquer la différence.
Écosystème technique
─────────────
IA et orchestration — LangGraph, LangChain, CrewAI, Autogen. Temporel (flux de travail, activités, signaux, requêtes). Ragas et Langfuse pour évaluation. GPT-5, Claude 4, Llama 4, Ollama, Groq.
Voix et temps réel — LiveKit, WebRTC, SIP, RTP, Deepgram, ElevenLabs, OpenAI Realtime API.
Backend & Infrastructure — Python (FastAPI, Pydantic), Go. Docker, Kubernetes, AWS, Azure, actions GitHub. Apache Kafka, RabbitMQ, Redis Streams. PostgreSQL, MongoDB, Redis. Pine, Weaviate, Milvus.
À quoi vous pouvez vous attendre
─────────────
Livraison axée sur les systèmes. Pas des scripts qui fonctionnent une fois isolément. Des services avec journalisation, gestion des erreurs et observabilité intégrés dès le départ — car les intégrer dans un système de production défaillant coûte trois fois plus que ce qu’il aurait fallu pour les inclure.
Honnêteté technique. Si votre cas d’utilisation n’a pas besoin d’un grand modèle de langage, je vous le dirai. Si un modèle spécifique est trop pour votre budget et votre cas d’usage, je le dirai. J’ai perdu des projets en étant franc à ce sujet. Ceux que je garde ont tendance à durer longtemps.
Un transfert propre. Des bases de code conteneurisées, entièrement documentées — conçues pour que votre équipe puisse les maintenir, l’étendre et la comprendre sans que je sois dans la pièce.
Si votre projet d’IA doit tenir après la démo, contactez-le.
Horaires de travail
- Lundi:08h00 à 18h00
- Mardi:08h00 à 18h00
- Mercredi:08h00 à 18h00
- Jeudi:08h00 à 18h00
- Vendredi:08h00 à 18h00
- Samedi:Non disponible
- Dimanche:Non disponible



