IA & Systèmes agentiques · Étude de cas
CHI-Bench Lab
Laboratoire reproductible pour orchestrer des campagnes d’agents autonomes, inspecter leurs traces et comparer les résultats d’un benchmark.

Le point de départ
Transformer un besoin réel en système exploitable.
Conception d’un laboratoire indépendant autour du benchmark officiel CHI-Bench. Un control plane FastAPI, un worker hôte, une CLI et une console React/TypeScript réunissent configurations figées, campagnes, chronologies d’exécution et artefacts. Les agents et adaptateurs de modèles sont évalués selon des protocoles comparatifs documentés. Les résultats officiels restent la source de vérité, les démonstrations synthétiques sont identifiées et les contenus protégés ne sont pas redistribués. Le projet est en cours et aucune soumission finale n’est déclarée.
Control plane & exécution
Architecture séparant API de contrôle, worker hôte, agent de trial et benchmark épinglé, avec snapshots de configuration et événements reprenables.
Création d’une CLI et d’un accès MCP au laboratoire pour préparer, suivre, comparer et annuler les expériences par les mêmes commandes métier.
Console & observabilité
Interface React/TypeScript pour campagnes, essais, flux d’agent, chronologies, inspection des preuves et contrôle de préparation d’une soumission.
Présentation distincte des essais officiels, diagnostics et démonstrations synthétiques, avec suivi des budgets et de la provenance des artefacts.
Expérimentation & contrôle
Versionnement des scénarios d’agents et adaptateurs multi-fournisseurs ; comparaisons préenregistrées, changement d’un facteur par variante et critères d’arrêt.
Vérification de la révision de l’image Docker et des sources avant exécution ; tests locaux de contrats API, types, contrôles documentaires et règles de sécurité.
Stack & disciplines
Explorer les compétences du projet.
Clique sur une carte pour comprendre son rôle et la manière dont elle intervient dans la réalisation.