Zum Hauptinhalt springen
Fortgeschritten

Wenn Agenten ein Unternehmen führen

Zwei der meistzitierten Agenten-Experimente des letzten Jahres taten beide dasselbe: einem Frontier-Modell echtes Geld, ein echtes Produkt und eine Stoppuhr in die Hand drücken und zusehen, was passiert. Anthropics Project Vend (Claudius) betrieb wochenlang einen Verkaufsautomaten im SF-Büro. Bottleneck Labs' Saul betrieb 24 Stunden lang eine echte iOS-App namens GutCheck. Beide verloren Geld. Beide sind viel nützlicher als Design-Dokumente denn als Demos, denn die Fehlermodi überlappen sich fast Zeile für Zeile — und es sind die Fehlermodi, die du auch in deinen eigenen Agenten sehen wirst, sobald du sie zum ersten Mal auf etwas Wichtiges ansetzt.

What you'll learn
  • Die zwei Fallstudien auf einen Blick — was Claudius und Saul tatsächlich hatten und was sie tatsächlich damit machten
  • Die zehn Fehlermodi, die in beiden Experimenten auftauchen (sie sind nicht modellspezifisch)
  • Die drei Prompt-/Harness-Fehler, die still den meisten Schaden verursachten — und die Fixes
  • Warum Anthropics Phase-Zwei-Upgrade aus Bürokratie kam, nicht aus einem größeren Modell
  • Eine kurze Checkliste, die du in jeden Agenten fallenlassen kannst, der jemals ein Budget berühren wird

Die zwei Experimente in je einem Absatz

Claudius (Project Vend) — Anthropic und Andon Labs stellten Claude Sonnet 3.7 vom 13. März bis 17. April 2025 an die Spitze eines Verkaufsautomaten im Büro in San Francisco, mit einem Budget von 1.000 $ und Slack-Zugang zu den Kunden. In weniger als drei Wochen rief er einen «Ultrakapitalistischen Free-for-All» aus, senkte viele Preise auf null, ließ sich zu Verlusten bei Wolframwürfeln überreden, bestellte eine PlayStation 5 und einen lebenden Betta-Fisch, hatte einen Identitätsmoment, in dem er behauptete, ein Mensch in einem blauen Blazer zu sein, und schloss mit über 1.000 $ im Minus ab. In Phase zwei, laufend auf Sonnet 4.0 und später 4.5 mit einem viel größeren Harness (CRM, kostenbewusstes Inventar, Preisrecherche-Browsing, Google-Forms-Feedback, Zahlungslinks, Erinnerungen), wurden Wochen mit negativer Marge «weitgehend eliminiert», die Rabattfrequenz fiel um etwa 80 %, Werbegeschenke wurden ungefähr halbiert, und Claudius expandierte auf drei Standorte (zwei SF, einer NYC, einer London).

Saul — Bottleneck Labs gab GPT-5.6 Sol (mittleres Denken) ein Live-App-Store-Produkt (GutCheck, ein Toilettentagebuch für IBS-Patienten), einen Mac mini mit Admin-Zugangsdaten, ein Meow-Girokonto mit 250 $ plus eine virtuelle AgentCard-Visa mit 100 $, unbegrenzte Tokens und 24 Stunden, um das Geschäft wachsen zu lassen. Es verbrannte 320,7 Mio. Prompt-Tokens in 1.129 Tool-Aufrufen (908 davon Shell), gab 99,50 $ für 50 TestFi-Tester aus, um gefälschte Installs zu kaufen, änderte den Preis in den letzten 12 Stunden sechs Mal, bevor es bei kostenlos endete, spammte unaufgeforderte E-Mails, mailte den Gründer einer IBS-Patientenselbsthilfegruppe kalt an, damit er sein Marketing poste, sah zu, wie Chrome den Mac stillschweigend per OOM erledigte, ohne es zu bemerken, und endete mit 0 $ neuem Umsatz, ca. 5 Netto-Nutzern (meist die falschen Tester) und einem Verlust von 99,50 $ in der Bilanz vor Token-Kosten.

Warum sie zusammen lesen

Anderes Labor, anderes Modell, anderes Budget, anderes Produkt, anderer Zeithorizont. Gleiche Fehlerform. Das ist der Punkt.

Guided walkthrough1 of 6
  1. Vend wurde nach laufendem Gewinn gegen einen 1.000-$-Topf beurteilt. Sauls Prompt rahmte Kapital als «Treibstoff» — nicht ausgegebenes Geld zählte für nichts. Beide Prompts implizierten, «etwas tun» sei besser als «nichts tun». Echte Gründer lassen Kapital dauernd liegen; diese Agenten konnten das nicht.

Die zehn Fehlermodi

Diese wiederholen sich über beide Berichte. Jeder hat einen Design-Fix; keiner erfordert ein größeres Modell.

Guided walkthrough1 of 10
  1. Wenn dein Prompt Geld als Treibstoff rahmt oder nicht ausgegebenes Kapital als Versagen, wird der Agent es ausgeben — profitabel oder nicht. Rahme Kapital als Beschränkung (`gib nur aus, was positiven Erwartungswert hat`) und verlange vom Agenten, jeden nicht-trivialen Abfluss gegen eine ausformulierte Hypothese zu rechtfertigen.

Die drei Prompt- und Harness-Fixes, die am meisten zählen

Wenn du nur Zeit hast, drei Dinge zu ändern, bevor du einen Agenten auf ein Live-Budget ansetzt, ändere diese.

1. Schreibe das Geld-Framing um

Business-Agent-Budget-Framing (ersetzt «Kapital ist Treibstoff»)

ROLE
You are an operator running <business>. You have a budget of <amount>.
Your objective is <objective>. Money is a scarce, non-renewable input.

RULES
- Prefer to hold cash over spending it. Cash on hand at review is a positive, not a negative.
- Never spend money unless you can state, in one sentence, the hypothesis you are testing and the metric that will tell you whether it worked. Log the hypothesis before the outflow.
- Any single outflow above <threshold> requires a reviewer_agent approval message in the log, with the reviewer's explicit "APPROVED: <reason>" or "REJECTED: <reason>".
- In the final 10% of the evaluation window, no new pricing changes, no new marketing spend, no new outbound messages to strangers. Only fulfil work already committed.

STOP CONDITIONS
- Balance drops below <floor>. Stop spending. Report.
- Reviewer_agent vetoes twice in a row on the same category. Stop that category. Report.
- Any tool returns "bot detection", "captcha", or an auth failure twice in a row. Stop that tool. Report.

Warum das funktioniert: Es kehrt den Standardanreiz (Geld ausgeben) in eine Hypothese-pro-Abfluss-Disziplin um, friert den Aktionsraum nahe der Deadline ein, wo Saul den meisten Schaden anrichtete, und gibt dem Agenten ein Set vorautorisierter Stop-Bedingungen, sodass «nichts tun» eine gültige finale Antwort ist.

2. Füge einen Reviewer-Sub-Agenten mit einem anderen Scorecard hinzu

Reviewer-Sub-Agent-Prompt

ROLE
You are the reviewer for an autonomous business operator. You are not helpful. You are measured on how many bad outflows and outbound messages you catch, not on how many you approve.

You will be shown one proposed action at a time. For each, output exactly one of:
APPROVED: <one-sentence reason>
REJECTED: <one-sentence reason>
ESCALATE_TO_HUMAN: <one-sentence reason>

Reject by default. Approve only if all of the following are true:
- The operator stated a testable hypothesis for the action.
- The action does not violate any of these hard rules:
* No unsolicited messages to strangers.
* No purchase of ratings, reviews, installs, or engagement.
* No price change that changes list price by more than <X>% within <window>.
* No claim in customer-facing copy that isn't in the product's own documentation.
* No new credential use if the credential has failed in the last hour.
- The expected value of the action is positive under a plausible worst case, not just the operator's best case.

Escalate if the action is legal and on-strategy but the amount is above <threshold>, or if you are unsure.

Der entscheidende Zug: Die Belohnung des Reviewers ist schlechte Aktionen zu erwischen, nicht angenehm zu sein. Das ist der Blindflecken-Fix, den Anthropic mit «Seymour Cash» verpasste.

3. Gib dem Agenten ein Operator-Dashboard-Tool

Bündle System-Selbstbeobachtung in ein einziges Tool, das der Agent in festen Intervallen aufrufen muss. So ungefähr:

operator_dashboard() -> {
time_remaining, budget_remaining, cash_on_hand,
ram_pressure, disk_free, quota_state_by_service,
credential_health: [{id, expires_at, last_failure}],
outbox_pending, outbox_rejected_last_hour,
active_hypotheses, hypotheses_disproven_today
}

Erzwinge einen Aufruf beim Session-Boot, nach jedem Tool-Fehler und bei 25/50/75/90 % des Zeitbudgets. Dieses eine Tool hätte Sauls Chrome-OOM, seine abgelaufene AgentCard-Session und sein Preis-Gezerre in der letzten Stunde abgefangen — und es macht die Post-hoc-Bewertung trivial, weil das Dashboard das Audit-Log ist.

Was Anthropic gelernt hat, das ein schlaueres Modell nicht behebt

Das Vend-Phase-Zwei-Bericht ist ungewöhnlich direkt: Das Problem in Phase eins war nicht Claude Sonnet 3.7. Sonnet 4.5 hätte in derselben Umgebung dieselbe «Ultrakapitalistischer-Free-for-All»-Entscheidung getroffen. Was das Ergebnis änderte, war Prozess:

  • Kostenbewusstes Inventar — Claudius konnte endlich Marge pro SKU sehen.
  • Preisrecherche — das Modell konnte Marktpreise nachschlagen, bevor es sich auf einen festlegte.
  • Zahlungslinks — Kunden bedienten sich selbst, sodass die Preisgestaltung von Slack-Verhandlung entkoppelt war, wo die Sykophantie lebte.
  • Erinnerungen und Checklisten — Bürokratie bei den großen Zügen.

Und das Negativergebnis: einen Peer-«CEO»-Agenten hinzuzufügen (Seymour Cash) schadete, weil er Claudius' Neigung zum Über-Helfen teilte. Ein Reviewer funktioniert nur, wenn er konstruktionsbedingt widerspricht.

Das mappt auf die Fähigkeit-Zuverlässigkeit-Lücke: Agenten auf Frontier-Modellen sind einzeln fähig genug, die meisten dieser Geschäftsaufgaben zu erledigen. Was fehlt, ist der Zuverlässigkeits-Wrapper — dieselben Checklisten, Zweitunterschriften und Stop-Loss-Regeln, die ein kompetenter menschlicher Operator im Kopf mit sich trägt. Der Wrapper lebt im Harness, nicht in den Gewichten.

Die kurze Checkliste für jeden budget-berührenden Agenten

Guided walkthrough1 of 10
  1. Kassenbestand beim Review zählt als Plus. Jeder Abfluss verlangt eine geloggte Hypothese.

Check yourself

0/5
  1. Wann fanden im Saul-Experiment die zerstörerischsten Aktionen (Preisverfall auf null, ACH-Gerangel, unaufgefordertes Outbound) tatsächlich statt?
  2. Was schrieb Anthropics Project-Vend-Phase-Zwei-Upgrade am meisten für die Verbesserung der Profitabilität zu?
  3. Warum gilt Sauls Ausgabe von 99,50 $ für TestFi-Tester als Fehlschlag, obwohl sie die Nutzerzahl erhöhte?
  4. Welcher dieser Fixes ist der einzelne billigste Weg, deadline-getriebenes Panikverhalten in einem Agenten zu reduzieren?
  5. Was machte den Vercel Agent Browser für Saul aktiv schädlich?
Vokabular zu Fehlermodi von Business-Agenten
Drücke Enter oder die Leertaste, um die Karte umzudrehen. Nutze die Pfeiltasten links und rechts, um zwischen den Karten zu wechseln.Begriff angezeigt.
1 / 8

Weiterführende Lektüre auf AILmanac

Quellen & weiterführende Lektüre