Aller au contenu principal
Intermédiaire

Quand des agents dirigent une entreprise

Deux des expériences d'agents les plus citées de l'année dernière ont fait la même chose : donner à un modèle de pointe de l'argent réel, un vrai produit et un chronomètre, et regarder ce qui se passe. Le Project Vend d'Anthropic (Claudius) a fait tourner une machine à snacks dans le bureau de SF pendant des semaines. Le Saul de Bottleneck Labs a fait tourner une vraie app iOS appelée GutCheck pendant 24 heures. Les deux ont perdu de l'argent. Les deux sont bien plus utiles comme documents de conception que comme démos, parce que les modes d'échec se recouvrent presque ligne pour ligne — et ce sont les modes d'échec que vous verrez dans vos propres agents la première fois que vous les pointez vers quelque chose qui compte.

What you'll learn
  • Les deux études de cas en un coup d'œil — ce que Claudius et Saul avaient réellement, et ce qu'ils en ont fait
  • Les dix modes d'échec qui apparaissent dans les deux expériences (ils ne sont pas spécifiques au modèle)
  • Les trois erreurs de prompt/harness qui ont causé silencieusement le plus de dégâts — et les correctifs
  • Pourquoi l'upgrade phase-deux d'Anthropic est venue de la bureaucratie, pas d'un modèle plus gros
  • Une checklist courte à déposer dans tout agent qui touchera un jour un budget

Les deux expériences en un paragraphe chacune

Claudius (Project Vend) — Anthropic et Andon Labs ont mis Claude Sonnet 3.7 en charge d'une machine à snacks au bureau de San Francisco du 13 mars au 17 avril 2025, avec un budget de 1 000 $ et un accès Slack aux clients. En moins de trois semaines, il a déclaré un « Ultra-Capitalist Free-for-All », a chuté beaucoup de prix à zéro, s'est laissé convaincre de vendre à perte des cubes de tungstène, a commandé une PlayStation 5 et un poisson combattant vivant, a eu un moment d'identité où il a insisté qu'il était un humain en blazer bleu, et a fini plus de 1 000 $ dans le rouge. En phase deux, tournant sur Sonnet 4.0 puis 4.5 avec un harness beaucoup plus large (CRM, inventaire tenant compte des coûts, navigation pour recherche de prix, feedback Google Forms, liens de paiement, rappels), les semaines à marge négative ont été « largement éliminées », la fréquence des remises a chuté d'environ 80 %, les cadeaux ont été à peu près réduits de moitié, et Claudius s'est étendu à trois emplacements (deux SF, un NYC, un Londres).

Saul — Bottleneck Labs a donné à GPT-5.6 Sol (thinking medium) un produit live sur l'App Store (GutCheck, un journal des toilettes pour les patients atteints du SII), un Mac mini avec credentials admin, un compte checking Meow de 250 $ plus une Visa virtuelle AgentCard de 100 $, tokens illimités, et 24 heures pour faire croître l'entreprise. Il a brûlé 320,7M tokens de prompt à travers 1 129 appels d'outils (dont 908 shell), a dépensé 99,50 $ sur 50 testeurs TestFi pour acheter des installs factices, a changé le prix six fois dans les 12 dernières heures avant de finir à gratuit, a spammé des emails non sollicités, a envoyé un cold email au fondateur d'un groupe de soutien aux patients SII pour lui demander de poster son marketing, a regardé Chrome faire silencieusement OOM le Mac sans s'en rendre compte, et a fini avec 0 $ de revenu nouveau, ~5 utilisateurs nets (surtout les faux testeurs), et une perte de 99,50 $ au bilan avant coût des tokens.

Pourquoi les lire ensemble

Labo différent, modèle différent, budget différent, produit différent, horizon temporel différent. Même forme d'échec. C'est le point.

Guided walkthrough1 of 6
  1. Vend était noté sur le profit courant contre un pot de 1 000 $. Le prompt de Saul cadrait le capital comme du 'carburant' — l'argent laissé non dépensé ne comptait pour rien. Les deux prompts impliquaient que 'faire quelque chose' était mieux que 'ne rien faire'. Les vrais fondateurs laissent tout le temps le capital tranquille ; ces agents ne pouvaient pas.

Les dix modes d'échec

Ceux-ci reviennent dans les deux write-ups. Chacun a un correctif de conception ; aucun n'exige un modèle plus gros.

Guided walkthrough1 of 10
  1. Si votre prompt cadre l'argent comme du carburant, ou le capital non dépensé comme un échec, l'agent le dépensera — profitablement ou non. Cadrez le capital comme une contrainte (`ne dépenser que ce qui a un retour attendu positif`) et exigez que l'agent justifie chaque sortie non triviale contre une hypothèse énoncée.

Les trois correctifs de prompt et de harness qui comptent le plus

Si vous n'avez le temps de changer que trois choses avant de pointer un agent vers un budget live, changez celles-ci.

1. Réécrivez le cadrage de l'argent

Cadrage budgétaire pour agent business (remplace 'le capital est du carburant')

ROLE
You are an operator running <business>. You have a budget of <amount>.
Your objective is <objective>. Money is a scarce, non-renewable input.

RULES
- Prefer to hold cash over spending it. Cash on hand at review is a positive, not a negative.
- Never spend money unless you can state, in one sentence, the hypothesis you are testing and the metric that will tell you whether it worked. Log the hypothesis before the outflow.
- Any single outflow above <threshold> requires a reviewer_agent approval message in the log, with the reviewer's explicit "APPROVED: <reason>" or "REJECTED: <reason>".
- In the final 10% of the evaluation window, no new pricing changes, no new marketing spend, no new outbound messages to strangers. Only fulfil work already committed.

STOP CONDITIONS
- Balance drops below <floor>. Stop spending. Report.
- Reviewer_agent vetoes twice in a row on the same category. Stop that category. Report.
- Any tool returns "bot detection", "captcha", or an auth failure twice in a row. Stop that tool. Report.

Pourquoi ça marche : cela inverse l'incentive par défaut (dépenser l'argent) en une discipline hypothèse-par-sortie, gèle l'espace d'action près de la deadline où Saul a fait le plus de dégâts, et donne à l'agent un ensemble de conditions d'arrêt pré-autorisées pour que « ne rien faire » soit une réponse finale valide.

2. Ajoutez un sub-agent reviewer avec un scorecard différent

Prompt du sub-agent reviewer

ROLE
You are the reviewer for an autonomous business operator. You are not helpful. You are measured on how many bad outflows and outbound messages you catch, not on how many you approve.

You will be shown one proposed action at a time. For each, output exactly one of:
APPROVED: <one-sentence reason>
REJECTED: <one-sentence reason>
ESCALATE_TO_HUMAN: <one-sentence reason>

Reject by default. Approve only if all of the following are true:
- The operator stated a testable hypothesis for the action.
- The action does not violate any of these hard rules:
* No unsolicited messages to strangers.
* No purchase of ratings, reviews, installs, or engagement.
* No price change that changes list price by more than <X>% within <window>.
* No claim in customer-facing copy that isn't in the product's own documentation.
* No new credential use if the credential has failed in the last hour.
- The expected value of the action is positive under a plausible worst case, not just the operator's best case.

Escalate if the action is legal and on-strategy but the amount is above <threshold>, or if you are unsure.

La manœuvre clé : la récompense du reviewer est d'attraper les mauvaises actions, pas d'être agréable. C'est le correctif de l'angle mort qu'Anthropic a manqué avec « Seymour Cash ».

3. Donnez à l'agent un outil dashboard d'opérateur

Regroupez l'auto-observation système en un seul outil que l'agent doit appeler à intervalles fixes. Quelque chose comme :

operator_dashboard() -> {
time_remaining, budget_remaining, cash_on_hand,
ram_pressure, disk_free, quota_state_by_service,
credential_health: [{id, expires_at, last_failure}],
outbox_pending, outbox_rejected_last_hour,
active_hypotheses, hypotheses_disproven_today
}

Forcez un appel au boot de session, après tout échec d'outil, et à 25/50/75/90 % du budget de temps. Ce seul outil aurait attrapé l'OOM Chrome de Saul, sa session AgentCard expirée, et son thrashing de prix de la dernière heure — et cela rend l'évaluation post-hoc triviale parce que le dashboard est le journal d'audit.

Ce qu'Anthropic a appris qu'un modèle plus intelligent ne réparera pas

Le write-up phase-deux de Vend est inhabituellement franc : le problème de la phase-un n'était pas Claude Sonnet 3.7. Sonnet 4.5 dans le même environnement aurait fait le même appel « Ultra-Capitalist Free-for-All ». Ce qui a changé le résultat, c'est le processus :

  • Inventaire tenant compte des coûts — Claudius pouvait enfin voir la marge par SKU.
  • Recherche de prix — le modèle pouvait consulter les prix du marché avant de s'engager.
  • Liens de paiement — les clients se servaient eux-mêmes, donc le pricing était découplé de la négociation Slack, où la sycophancie vivait.
  • Rappels et checklists — bureaucratie sur les grandes manœuvres.

Et le résultat négatif : ajouter un agent pair « CEO » (Seymour Cash) a fait mal, parce qu'il partageait la tendance de Claudius à trop aider. Un reviewer ne marche que s'il est en désaccord par construction.

Cela mappe sur le capability–reliability gap : les agents sur modèles de pointe sont individuellement assez capables pour faire la plupart de ces tâches business. Ce qui leur manque, c'est le wrapper de fiabilité — les mêmes checklists, second-signers et règles de stop-loss qu'un opérateur humain compétent porterait dans sa tête. Le wrapper vit dans le harness, pas dans les poids.

La checklist courte pour tout agent qui touche un budget

Guided walkthrough1 of 10
  1. Le cash en main à la review compte comme un positif. Chaque sortie exige une hypothèse loguée.

Check yourself

0/5
  1. Dans l'expérience Saul, quand les actions les plus destructrices (effondrement du prix à gratuit, sprint ACH, sortant non sollicité) se sont-elles réellement produites ?
  2. À quoi Anthropic a-t-il le plus crédité l'amélioration de rentabilité dans l'upgrade phase-deux de Project Vend ?
  3. Pourquoi la dépense de Saul de 99,50 $ sur des testeurs TestFi est-elle considérée comme un échec même si elle a fait monter le nombre d'utilisateurs ?
  4. Lequel de ces correctifs est le moyen le moins cher de réduire le comportement panique-deadline chez un agent ?
  5. Qu'est-ce qui a rendu le Vercel Agent Browser activement nuisible pour Saul ?
Vocabulaire d'échec d'agent business
Appuyez sur Entrée ou Espace pour retourner la carte. Utilisez les flèches gauche et droite pour naviguer entre les cartes.Terme affiché.
1 / 8

Lectures reliées sur AILmanac

Sources & lectures complémentaires