Aller au contenu
Logo MandaMANDA.
AI Engineering Lab / Journal de construction

AI ENGINEERING LAB

Construire des agents utiles et montrer les preuves : architecture, outils, garde-fous, déploiement et limites de systèmes conçus avec Claude et OpenAI.

Laboratoire indépendant. Manda n’est ni affilié, ni certifié, ni sponsorisé par Anthropic ou OpenAI.

ClaudeLivré et documenté

Claude / Anthropic

Claude Code est utilisé comme environnement d’ingénierie sur des produits réels : compréhension du dépôt, implémentation, revue, tests et passage par Git. MCP et n8n étendent ce travail à des outils bornés et à des validations humaines.

  • Claude Code
  • MCP
  • Git + tests
  • Validation humaine
OpenAIPiste de recherche publique

OpenAI / Codex

La prochaine piste publique applique la même discipline à OpenAI : outils typés, sorties structurées, traces, jeux d’évaluation et contrôle des actions. Le benchmark sera publié avec ses échecs, son coût et sa latence — pas seulement une démo heureuse.

  • Agents & outils
  • Sorties structurées
  • Evals
  • Coût & latence

Standard de publication

Une démo n’est pas une preuve de production.

Chaque nouvelle étude du laboratoire doit rendre ces six éléments vérifiables.

  1. 01

    Problème

    Une tâche métier bornée et un résultat observable.

  2. 02

    Architecture

    Modèle, données, outils, permissions et conditions d’arrêt.

  3. 03

    Évaluations

    Cas normaux, incomplets, contradictoires et hostiles.

  4. 04

    Garde-fous

    Actions sensibles en brouillon ou soumises à validation.

  5. 05

    Exploitation

    Logs, coût, latence, reprise et changements de modèle.

  6. 06

    Limites

    Échecs connus et décisions qui doivent rester humaines.

Preuves disponibles

Produits et systèmes déjà construits

Produit construit avec Claude Code

Factumation

Application de facturation reliée à des automatisations métier : conception assistée, intégration Next.js, contrôles et livraison continue.

  • Claude Code
  • Next.js
  • n8n
  • Webhooks
Voir l’étude de cas

Expérience MCP documentée

Webflow piloté par Claude

Expérience de pilotage d’un CMS via deux serveurs MCP, avec publication, SEO et limites de l’API explicitement documentées.

  • Claude
  • MCP
  • Webflow API
  • SEO
Voir l’étude de cas

Architecture multi-fournisseurs

ZeroClaw

Infrastructure d’agent en Rust compatible avec plusieurs fournisseurs, dont OpenAI et Anthropic, pensée pour des outils et canaux multiples.

  • Rust
  • OpenAI
  • Anthropic
  • Tool use
Voir l’étude de cas

Prochain protocole

Même tâche, mêmes données, deux modèles.

Le prochain benchmark comparera Claude et OpenAI sur un agent de recherche borné. Les mesures prévues : réussite de la tâche, qualité des sources, appels d’outils, coût, latence et besoin de reprise humaine.

  1. 01Constituer un jeu de scénarios versionné
  2. 02Exécuter les deux variantes avec les mêmes outils
  3. 03Publier résultats, traces expurgées et cas d’échec

Vous recrutez ou vous avez un cas d’usage exigeant ?

Je peux présenter l’architecture, le code et les arbitrages derrière ces systèmes — en français ou en anglais, à distance pour l’Europe et les États-Unis.

Discuter du système