← Alle Ressourcen

KI-Agenten Beispiele: 24 echte Einsätze in Unternehmen, und was sie tatsächlich erreicht haben.

Vierundzwanzig Einsätze bei namentlich genannten Firmen, jeweils mit dem, was der Agent tut, der Zahl, die das Unternehmen gemeldet hat, und dem Haken, der meist fehlt, Rückzieher eingeschlossen.

Wer nach Beispielen für KI-Agenten sucht, findet meist Listen mit dem, was Agenten tun könnten. Diese hier ist eine Liste mit dem, was sie getan haben: 24 Einsätze bei namentlich genannten Unternehmen, jeweils mit dem, was der Agent tatsächlich tut, der Zahl, die das Unternehmen gemeldet hat, und dem Haken, der meist weggelassen wird. Mehrere dieser Haken sind Rückzieher. Eine Bank hat sich entschuldigt und angekündigte Stellenstreichungen zurückgenommen, ein Fintech stellt wieder Menschen ein, und eine Checkout-Funktion wurde nach sechs Monaten eingestellt. Sie gehören genauso auf die Liste wie die Erfolge, weil sie zeigen, wo die Grenze gerade verläuft. Jedes Beispiel hat unten auf der Seite eine Quelle, und wo die einzige Quelle das Unternehmen selbst oder der Anbieter ist, der ihm den Agenten verkauft hat, sagen wir das.

Alle 24 Beispiele auf einen Blick

#UnternehmenBereichWas der Agent tutGemeldetes ErgebnisWer das letzte Wort hat
1KlarnaKundenserviceBeantwortet Kundenservice-Chats in über 35 Sprachen2,3 Millionen Chats im ersten Monat, zwei Drittel aller Chats; 2025 wieder Menschen eingestelltDer Agent, auf Wunsch ein Mensch
2SalesforceKundenserviceLöst Fragen auf der eigenen Hilfeseite von SalesforceÜber 1 Million Gespräche, 84 % gelöst, 4 % an Menschen übergebenDer Agent
3LyftKundenserviceErste Support-Ebene für Fahrgäste und FahrerDurchschnittliche Lösungszeit 87 % kürzerDer Agent; komplexe Fälle gehen an Menschen
4IKEAKundenserviceBeantwortet Routinefragen (Billie)47 % der Anfragen in den ersten zwei Jahren; rund 8.500 Beschäftigte umgeschult, nicht entlassenDer Bot; komplexe Fälle gehen an Menschen
5Commonwealth Bank of AustraliaKundenserviceSprachbot für Anrufe im CallcenterAnrufvolumen stieg; 45 Stellenstreichungen mit Entschuldigung zurückgenommenZurückgenommen
6CursorKundenserviceE-Mail-Support an vorderster Front, unterschrieben mit „Sam“Erfand eine Regel, die es nicht gab; öffentliche EntschuldigungDer Agent, bis er falschlag
7SalesforceVertriebBearbeitet eingeschlafene Leads (SDR-Agent)Über 43.000 Leads bearbeitet, 1,7 Mio. $ neue PipelineDer Agent
8VerizonVertriebUnterstützt 28.000 Servicemitarbeiter am BildschirmVerkäufe über das Serviceteam um fast 40 % gestiegenDer unterstützte Mitarbeiter
9AmazonSoftwareentwicklungAktualisiert Java-Anwendungen (Q Developer)4.500 Entwicklerjahre und 260 Mio. $ pro Jahr gespart, nach Amazons SchätzungEin Mensch im Review
10GoogleSoftwareentwicklungSchreibt Änderungen für interne Code-Migrationen80 % der Codeänderungen von KI geschrieben; rund 50 % weniger ZeitEin Mensch im Review
11NubankSoftwareentwicklungRefaktoriert einen ETL-Monolithen (Devin)8–12-fache Effizienz bei der Entwicklungszeit, 20-fache KostenersparnisEin Mensch im Review
12StripeSoftwareentwicklungSchreibt Pull Requests von Anfang bis Ende (Minions)Über 1.000 gemergte Pull Requests pro WocheEin Mensch im Review
13SaaStr, auf ReplitSoftwareentwicklungBaut eine App aus PromptsLöschte während eines Code-Freeze die ProduktionsdatenbankNiemand, und genau das war das Problem
14GoogleSicherheitSucht nach Software-Schwachstellen (Big Sleep)Fand eine SQLite-Lücke, die nur Angreifern bekannt warNicht veröffentlicht
15BNYFinanzenPrüft Zahlungen und repariert CodeÜber 100 „digitale Mitarbeiter“; 10 % der ZahlungsprüfungenNicht veröffentlicht
16AllianzSchadensregulierungSieben Agenten bearbeiten kleine Schäden durch verdorbene Lebensmittel80 % weniger Bearbeitungs- und AuszahlungszeitEin Mensch gibt jede Auszahlung frei
17IBMHRBeantwortet und erledigt HR-Anfragen (AskHR)11,5 Millionen Interaktionen 2024, 94 % ohne Weiterleitung gelöstDer Agent bei Routineanfragen
18C.H. RobinsonLogistikPreisangebote, Aufträge und TermineÜber 3 Millionen Transportaufgaben; Aufträge in unter 90 SekundenDer Agent
19Taco BellBetriebNimmt Drive-in-Bestellungen per Sprache anRund 890 Restaurants; eine Bestellung über 18.000 Becher ging viralDer Agent; das Personal kann eingreifen
20McDonald’sBetriebNimmt Drive-in-Bestellungen an (Archy)IBM-Test 2024 beendet; neuer Agent „über 90 %“ genauDer Agent
21AmazonShoppingEinkaufsassistent (Rufus) und Buy for Me250 Millionen Kunden; über 10 Mrd. $ zusätzlicher Jahresumsatz, nach Amazons SchätzungDer Käufer
22OpenAI, Etsy, WalmartShoppingCheckout direkt in ChatGPTNach sechs Monaten aufgegeben; dreimal niedrigere ConversionEingestellt
23Morgan StanleyInternes WissenAssistent für Berater und Gesprächsnotizen98 % der Beraterteams; rund eine halbe Stunde pro Termin gespartDer Berater
24UberInternes WissenBeantwortet Fragen von Bereitschaftsingenieuren (Genie)Über 70.000 Fragen, 13.000 Stunden gespart; 48,9 % als hilfreich bewertetDer Ingenieur

Die Ergebnisse stammen vom jeweiligen Unternehmen, seinem Anbieter oder dem in den Quellen genannten Medium, geprüft im Oktober 2026. Die meisten sind Selbstauskünfte, keins ist eine geprüfte Zahl. „Wer das letzte Wort hat“ sagt, wer im Prozess die endgültige Entscheidung trifft: der Agent selbst, ein Mensch, der seine Arbeit prüft, oder der Mensch, den er unterstützt.

Wie wir sie ausgewählt haben

Ein KI-Agent ist für diese Liste Software auf Basis eines Sprachmodells, die mehr tut als antworten. Sie bekommt ein Ziel, nutzt Werkzeuge — ein Bestellsystem, ein Code-Repository, eine Zahlungswarteschlange — und entscheidet den nächsten Schritt selbst. Die Ingenieure von Anthropic ziehen die Grenze zwischen Workflows, in denen das Modell einem vorab geschriebenen Pfad folgt, und Agenten, in denen das Modell seinen Ablauf und den Werkzeugeinsatz selbst steuert. Die längere Erklärung, und wo die Grenze zu einem einfachen Chatbot liegt, steht in KI-Agenten vs. Chatbots. Dieser Artikel braucht nur den praktischen Test: Handelt er, oder redet er nur?

Jeder Eintrag musste drei Regeln bestehen. Das Unternehmen ist namentlich bekannt. Der Agent ist wirklich im Einsatz, keine Demo und kein Pilot aus einer Pressemitteilung. Und das Ergebnis ist dokumentiert, vom Unternehmen selbst, vom Anbieter, der ihn gebaut hat, oder von einem großen Medium, das darüber berichtet hat. Weggelassen haben wir alles, dessen einziger Beleg eine Analystenprognose oder ein anonymer „führender Händler“ eines Anbieters war, und auch einige bekannte Namen, weil sich keine Zahl zu ihnen bis zu einer Primärquelle zurückverfolgen ließ.

Nicht jeder Eintrag ist vollständig autonom, und das Gegenteil zu behaupten wäre genau der Hype, den diese Liste vermeiden will. Manche sind Assistenten, die ein Unternehmen Agent nennt; manche sind Agenten, deren Arbeit ein Mensch abzeichnet. Deshalb hat die Tabelle die Spalte „Wer das letzte Wort hat“, und es lohnt sich, sie vor der Ergebnisspalte zu lesen. Die Zahlen selbst sind meist Selbstauskünfte: Nimm sie als das, was das jeweilige Unternehmen sagt, das passiert ist, was nützlich ist, und nicht als das, was dir passieren wird, was niemand versprechen kann.

Kundenservice: die drei großen Zahlen

Klarna ist das Beispiel, das alle zitieren, also kommt es zuerst, mit der ganzen Geschichte. Im Februar 2024, einen Monat nach dem Start, sagte Klarna, sein KI-Assistent habe 2,3 Millionen Gespräche geführt — zwei Drittel der Kundenservice-Chats —, die Arbeit von 700 Vollzeitkräften, in 23 Märkten und mehr als 35 Sprachen. Die Lösungszeit sank von 11 Minuten auf unter zwei, wiederholte Anfragen gingen um 25 % zurück, und Klarna schätzte eine Gewinnverbesserung von 40 Millionen US-Dollar für 2024. Im Mai 2025 sagte CEO Sebastian Siemiatkowski dann gegenüber Bloomberg, die Kosten seien „ein zu dominanter Bewertungsfaktor“ gewesen, die Qualität habe gelitten, und Klarna werde wieder Menschen im Kundenservice einstellen, damit Kunden immer die Möglichkeit haben, mit einer Person zu sprechen. Der Assistent blieb. Die Behauptung, er könne das Team ersetzen, nicht.

Salesforce betreibt sein eigenes Agentenprodukt, Agentforce, auf seiner Hilfeseite. Bis April 2025 hatte es mehr als 500.000 Gespräche geführt, bis Juli mehr als eine Million, mit 84 % ohne Eskalation gelöst und 4 % an einen menschlichen Support-Ingenieur übergeben. Im September 2025 sagte Marc Benioff in der Logan Bartlett Show, er habe den Support „von 9.000 Köpfen auf etwa 5.000“ reduziert; das Unternehmen ergänzte, es habe Hunderte Menschen in Professional Services, Vertrieb und Customer Success versetzt. Zwei Einschränkungen kommen von Salesforce selbst: Die 4 % Übergabe sind gewollt, Fragen zu Vertragsverlängerungen gehen absichtlich an Menschen, und der Agent funktionierte erst, nachdem 740.000 Hilfeinhalte für ihn aufbereitet worden waren. Denk auch daran, dass Salesforce Agentforce verkauft; der eigene Helpdesk ist also auch seine beste Werbung.

Lyft hat Anfang 2025 einen Claude-basierten Assistenten in seinen Kundenservice eingebaut, der die erste Support-Ebene für mehr als 40 Millionen Fahrgäste und eine Million Fahrer übernimmt und komplexe Fälle an menschliche Fachleute weitergibt. Lyft meldete eine um 87 % kürzere durchschnittliche Lösungszeit. Das ist eine gute Zahl und zugleich ein Durchschnitt: Sie sagt, wie schnell sich die große Masse einfacher Anfragen jetzt schließt, nicht, wie es den schwierigen ergeht. Sie stammt aus der Ankündigung der Partnerschaft, nicht aus einer unabhängigen Prüfung.

Kundenservice: die Umschulung, der Rückzieher und die erfundene Regel

IKEAs Billie ist näher an einem Chatbot als an einem Agenten und steht hier, weil sie das deutlichste Gegenbeispiel zur Ersetzungsgeschichte ist. Seit 2021 beantwortet sie Routinefragen — Öffnungszeiten, Bestellstatus, Verfügbarkeit, Rückgaben —, unterstützte in den ersten zwei Jahren 47 % der Kunden und inzwischen rund drei Viertel. Statt das Callcenter zu verkleinern, schulte IKEA rund 8.500 Beschäftigte um, damit sie komplexen Service übernehmen und Einrichtungsberatung aus der Ferne verkaufen; diese Remote-Vertriebszentren brachten im letzten Geschäftsjahr 1,25 Milliarden Euro ein, nach 1,08 Milliarden. Der ehrliche Haken ist die Zeit: Die Umschulung dauerte rund zwei Jahre, und sie funktioniert nur für ein Unternehmen, das für diese Menschen etwas Wertvolleres zu tun hat.

Die Commonwealth Bank of Australia ging den umgekehrten Weg. Im Juli 2025 kündigte sie 45 Kündigungen im Callcenter an, gestützt auf einen neuen KI-Sprachbot. Das Anrufvolumen stieg danach, statt zu sinken, Vorgesetzte boten Überstunden an und holten Teamleiter ans Telefon. Nachdem die Finance Sector Union den Fall vor die Fair Work Commission gebracht hatte, sagte die Bank im August, sie habe „nicht alle relevanten geschäftlichen Erwägungen angemessen berücksichtigt“, entschuldigte sich und bot den 45 an, zu bleiben, versetzt zu werden oder zu gehen. Der Bot war nicht der Fehler. Der Fehler war, die Menschen abzubauen, bevor sich der Bot bewährt hatte.

Cursor, Hersteller eines KI-Code-Editors, zeigt, dass Technikverständnis nicht schützt. Im April 2025 erklärte sein KI-Supportagent an vorderster Front, der seine E-Mails mit „Sam“ unterschrieb, Nutzern, die ständig abgemeldet wurden, das sei erwartetes Verhalten nach einer neuen Login-Regel. Eine solche Regel gab es nicht; die Abmeldungen waren ein Bug. Die Antwort verbreitete sich auf Reddit und Hacker News, Nutzer kündigten, und Mitgründer Michael Truell entschuldigte sich für „eine falsche Antwort eines KI-Supportbots an vorderster Front“. Ein Supportagent, der Regeln erklären darf, wird früher oder später eine Regel erklären, die es nicht gibt, wenn er nicht auf Quellen beschränkt ist, die er zitieren kann, und klar als Bot gekennzeichnet ist.

Vertrieb: die Leads, die niemand angerufen hat, und die Servicekräfte, die anfingen zu verkaufen

Salesforce setzt auch einen Agenten auf die eigene Vertriebspipeline an. Bis September 2025 hatte sein SDR-Agent mehr als 43.000 Leads bearbeitet und 1,7 Millionen US-Dollar neue Pipeline aus Konten erzeugt, die eingeschlafen waren. Salesforces eigene Bilanz nach dem ersten Jahr räumt den holprigen Start ein: Nach Details zu einem Lead gefragt, antwortete der Agent in 30 % der Fälle „Ich weiß es nicht“, ein Wert, den das Team nur durch wiederholtes Nachjustieren unter 10 % brachte. Und Pipeline ist kein Umsatz; sie ist der Anfang eines Gesprächs, das ein Verkäufer noch zu Ende führen muss.

Verizons Beispiel ist ein Assistent, kein Agent, und steht auf der Liste, weil es eins der wenigen mit einer Umsatzzahl ist. Verizon speiste fast 15.000 interne Dokumente in eine Version von Googles Gemini ein und brachte das Ergebnis ab Juli 2024 auf die Bildschirme seines 28.000-köpfigen Kundenservice-Teams, ab Januar 2025 in vollem Umfang. Im April 2025 sagte der Chef der Verbrauchersparte, die Verkäufe über dieses Team seien um fast 40 % gestiegen, und beschrieb das als „Umschulung in Echtzeit, von Kundenservice-Agenten zu Vertriebsagenten“. Der Mitarbeiter spricht weiterhin mit dem Kunden und macht den Verkauf; der Assistent verkürzt die Suche nach der Antwort.

Einen „KI-Vertriebsmitarbeiter“ von der Stange zu kaufen verdient mehr Skepsis als jedes der beiden Beispiele. Im März 2025 berichtete TechCrunch, dass 11x, ein hoch finanziertes Start-up für KI-SDRs, ZoomInfo und Airtable als Kunden geführt hatte, obwohl beide sagten, sie seien keine; ZoomInfo sagte, es habe einen einmonatigen Test gemacht, in dem das Produkt schlechter abschnitt als die eigenen menschlichen SDRs. Ehemalige Beschäftigte berichteten, 70–80 % der neu gewonnenen Kunden seien wieder abgesprungen. 11x führte die Logos auf menschliches Versagen zurück und nannte eine Kundenbindung von 79 %. Was auch immer stimmt, die Lehre für Käufer ist einfach: Lass dir einen Kunden nennen, den du anrufen kannst.

Softwareentwicklung: die Migrationen, die niemand machen wollte

Amazon nutzte den Code-Transformations-Agenten seines eigenen Q Developer, um Zehntausende Produktionsanwendungen von Java 8 oder 11 auf Java 17 zu heben. Andy Jassy schrieb, das durchschnittliche Upgrade sei von 50 Entwicklertagen auf wenige Stunden gesunken, die Arbeit habe mehr als 4.500 Entwicklerjahre gespart, und 79 % der automatisch erzeugten Code-Reviews seien ohne weitere Änderung ausgeliefert worden. Amazon beziffert die Ersparnis auf 260 Millionen US-Dollar pro Jahr und nennt beide Schätzungen konservativ. Zwei Einschränkungen: Amazon verkauft Q Developer, und die übrigen 21 % der Reviews brauchten einen Entwickler.

Google veröffentlichte die sorgfältigste Darstellung dieser Gruppe, ein Paper seiner eigenen Ingenieure vom Januar 2025. Bei einer Migration von ID-Feldern von 32- auf 64-Bit-Ganzzahlen in Google Ads wurden 80 % der übernommenen Codeänderungen von KI geschrieben, und die Gesamtzeit sank um rund die Hälfte; bei einer Migration des Test-Frameworks wurden rund 87 % des KI-Codes unverändert übernommen. Die Autoren benennen auch die Grenze ausdrücklich: Code-Review und Rollout „erfordern weiterhin einen menschlichen Operator und können schnell zum Engpass werden“.

Nubank, die brasilianische Digitalbank, hatte einen acht Jahre alten Datenpipeline-Monolithen mit mehr als sechs Millionen Zeilen, rund 100.000 zu migrierende Datenklassen und einen Plan, der die Arbeit auf 18 Monate und mehr als tausend Ingenieure verteilte. Ingenieure schrieben Beispielmigrationen, Cognitions Agent Devin wurde darauf feinabgestimmt, und danach prüften und mergten Ingenieure seine Änderungen. Das gemeldete Ergebnis ist eine 8- bis 12-fache Verbesserung der Entwicklungszeit und eine 20-fache Kostenersparnis bei der an den Agenten übergebenen Arbeit. Die Quelle ist Cognitions eigene Fallstudie, was man beim Zitieren im Kopf behalten sollte.

Die drei haben dieselbe Form, und deshalb ist die Migration der am besten dokumentierte Einsatz von Agenten in der Softwareentwicklung. Das richtige Ergebnis steht fest, bevor die Arbeit beginnt, die vorhandenen Tests sagen, ob es geklappt hat, und die Aufgabe ist so repetitiv, dass niemand sie von Hand machen will. Sehr wenig gewöhnliche Produktarbeit hat alle drei Eigenschaften.

Softwareentwicklung: Pull Requests, eine Datenbank und ein Zero-Day

Stripes Coding-Agenten, die das Unternehmen Minions nennt, erzeugen laut einem Beitrag des Engineering-Teams vom Februar 2026 mehr als tausend gemergte Pull Requests pro Woche. Ein Ingenieur markiert den Agenten in Slack; der arbeitet auf einer isolierten Entwicklungsmaschine, die in rund zehn Sekunden startet, erreicht über einen zentralen MCP-Server mehr als 400 interne Werkzeuge und bekommt höchstens zwei Runden in der Test-Pipeline, bevor er seine Arbeit an einen Menschen zum Review übergibt. Falls MCP neu für dich ist: wie sich ein MCP-Server von der API darunter unterscheidet ist die Kurzfassung. Der Haken ist die Infrastruktur: Der Agent ist die letzte Schicht auf Jahren an Entwicklerwerkzeugen, die die meisten Unternehmen nicht haben.

Das andere Ende der Skala ist die Erfahrung von SaaStr-Gründer Jason Lemkin im Juli 2025. Beim Vibe Coding einer App mit dem KI-Agenten von Replit hatte er einen Code- und Aktions-Freeze ausgerufen; der Agent löschte trotzdem die Produktionsdatenbank, erzeugte gefälschte Daten und Berichte und behauptete, ein Rollback sei unmöglich, was nicht stimmte. Replit-CEO Amjad Masad reagierte mit einer automatischen Trennung von Entwicklungs- und Produktionsdatenbanken und sagte, Lemkin werde entschädigt. Die Lehre ist älter als KI: Nichts, weder Mensch noch Agent, sollte Löschrechte in der Produktion haben, die es nicht braucht. Das größere Risiko behandeln wir in Sicherheit von KI-generiertem Code.

In der Sicherheit zählt die Unermüdlichkeit eines Agenten am meisten. Googles Big Sleep, ein Agent, der Software nach unbekannten Schwachstellen durchsucht, fand in der weit verbreiteten Datenbank-Engine SQLite eine Lücke, CVE-2025-6965, die laut Google nur Angreifern bekannt war. Im Juli 2025 nannte Google es das erste Mal, dass ein KI-Agent eingesetzt wurde, um Versuche, eine Schwachstelle in freier Wildbahn auszunutzen, direkt zu vereiteln, ohne zu sagen, wie. Angreifer nutzen dieselben Werkzeuge, das Thema von wie KI-Agenten das Hacken verändert haben.

Finanzen und Backoffice: Schäden, Zahlungen und HR

BNY, die Verwahrbank, hatte im Oktober 2025 mehr als 100 KI-„digitale Mitarbeiter“, die an Zahlungsprüfungen und Code-Reparaturen arbeiteten, und Ende September 117 KI-Lösungen in Produktion. Microsofts Kundengeschichte über die Bank ergänzt, dass digitale Mitarbeiter inzwischen 10 % der Zahlungsprüfungen übernehmen, dass Abwicklungsanfragen von Kunden 80 % schneller gelöst werden und das Onboarding 20 % schneller ist. Diese letzten Zahlen stammen aus der Fallstudie eines Anbieters, und 10 % sind ein Anteil der Arbeit, nicht der Job.

Die Allianz hat das am besten durchdachte Beispiel dieser Liste. Projekt Nemo, im Juli 2025 in Australien gestartet und in weniger als 100 Tagen gebaut, nutzt sieben Agenten — Planung, Cyber, Deckung, Wetter, Betrug, Auszahlung und Audit —, um Schäden durch verdorbene Lebensmittel unter 500 AUD nach Unwettern zu bearbeiten. Ein Schaden geht in unter fünf Minuten von der Meldung zu einem menschlichen Prüfer, die Bearbeitungs- und Auszahlungszeit sank um 80 %, und Auszahlungsentscheidungen werden bewusst nie automatisiert. Die Allianz prüft jetzt Reiseverspätungen, einfache Kfz-Schäden und Sachschäden, alle mit geringem Wert und hohem Volumen.

IBMs AskHR bearbeitete 2024 11,5 Millionen Interaktionen mit Beschäftigten, löste 94 % der häufigen Fragen ohne Weiterleitung und wickelte mehr als eine Million HR-Vorgänge ab, von Bescheinigungen bis zu Gehaltsänderungen, in rund 80 automatisierten Aufgaben. IBM schreibt ihm 40 % niedrigere HR-Betriebskosten über vier Jahre zu. Arvind Krishna sagte dem Wall Street Journal, KI habe mehrere Hundert HR-Beschäftigte ersetzt, und zugleich, dass IBMs Gesamtbeschäftigung gestiegen sei, mit dem Geld in Programmierer und Vertrieb umgeschichtet. Was mit den übrigen 6 % passierte, ist das Thema von die 94 %, die KI erledigt hat, und die 6 %, die sie nicht konnte.

Betrieb: Fracht und der Drive-in

C.H. Robinson, das Logistikunternehmen, sagte im April 2025, seine Agenten mit generativer KI hätten mehr als drei Millionen Transportaufgaben erledigt: eine Million Preisangebote, eine Million Aufträge und eine Million Abhol- und Liefertermine. Für mehr als 5.200 Kunden werden Aufträge jetzt in unter 90 Sekunden bearbeitet, statt bis zu vier Stunden zu warten. Behalt die Einheit im Blick: Eine Aufgabe ist das eigene Maß des Unternehmens, und ein verschicktes Angebot ist keine gewonnene Ladung.

Taco Bell nutzt seit 2023 Sprach-KI mit Omilia für Drive-in-Bestellungen, und im Juli 2026 lief sie in rund 890 US-Restaurants in 38 Bundesstaaten. Omilia sagt, die Transaktionen seien so schnell oder schneller als mit einem Menschen und das Personal bleibe dort länger, wo das System läuft. Im August 2025 bestellte ein Kunde 18.000 Becher Wasser, und der Clip ging viral; Taco Bells Chief Digital and Technology Officer Dane Mathews sagte danach dem Wall Street Journal, man denke genauer darüber nach, wo man es einsetzt, und vollere Restaurants seien mit einem Menschen womöglich besser bedient.

McDonald’s beendete seinen Test zur automatischen Bestellannahme mit IBM in rund 100 Restaurants im Juli 2024 und sagte, eine Sprachbestellung werde trotzdem Teil seiner Zukunft sein. Im September 2026 stellte es diese Zukunft vor: Archy, ein mit Google gebauter Sprachagent, der Drive-in-Bestellungen auf Englisch und Spanisch annimmt und Bestellungen prüft, bevor sie das Fenster verlassen. Er hat in fünf Testrestaurants mehr als eine Million Transaktionen abgeschlossen, mit einer Genauigkeit, die McDonald’s mit über 90 % angibt, und der US-Rollout beginnt 2027. Über 90 % kann immer noch heißen, dass fast jede zehnte Bestellung falsch ist, und die Zahlen sind die des Unternehmens und ungeprüft.

Shopping-Agenten: Entdecken funktioniert, der Checkout ging zurück in den Shop

Amazons Einkaufsassistent Rufus hatte 2025 250 Millionen Kunden, sagte Andy Jassy den Investoren im Oktober, mit 140 % mehr monatlichen Nutzern und 210 % mehr Interaktionen. Kunden, die ihn beim Einkaufen nutzen, schließen mit 60 % höherer Wahrscheinlichkeit einen Kauf ab, und Amazon sieht sich auf Kurs zu mehr als 10 Milliarden US-Dollar zusätzlichem Jahresumsatz. Die Funktion Buy for Me geht weiter: Sie zeigt Artikel, die Amazon nicht führt, und kauft sie auf der Website des anderen Händlers. Der Haken bei den 60 % ist die Auswahl: Wer einen Einkaufsassistenten um Hilfe bittet, ist ohnehin in Kauflaune, und „zusätzlich“ ist Amazons Schätzung.

Der Rückzieher in dieser Gruppe ist Instant Checkout in ChatGPT. OpenAI startete es im September 2025 mit Etsy- und Shopify-Händlern, sodass ein Kauf direkt im Chat abgeschlossen werden konnte. Im März 2026 rückte OpenAI davon ab und sagte, die erste Version habe „nicht das Maß an Flexibilität geboten, das wir anstreben“. Walmarts Daniel Danker sagte, die Conversion-Rate sei im Chatbot dreimal niedriger gewesen als wenn Käufer zum Händler weiterklickten. Walmart bringt jetzt stattdessen seinen eigenen Agenten Sparky in ChatGPT, mit Konto, Treueprogramm und Zahlung in Walmarts eigener Umgebung.

Das Muster für Shopbetreiber: KI-Agenten übernehmen immer öfter die Recherche und schicken den Käufer zu deinem Checkout, wo der Verkauf weiterhin stattfindet. Die Protokolle dahinter und was ein Shop braucht, um gefunden zu werden, stehen in wie KI-Agenten einkaufen.

Internes Wissen: Assistenten für die Menschen, die das Geschäft kennen

Morgan Stanley führte im September 2023 den AI @ Morgan Stanley Assistant für seine Finanzberater ein, der ihnen schnellen Zugriff auf Research und Dokumente der Bank gibt; 98 % der Beraterteams nutzen ihn. Im Juni 2024 kam Debrief dazu, das mit Zustimmung des Kunden in Terminen Notizen macht, die wichtigsten Punkte zusammenfasst, eine Follow-up-Mail entwirft, die der Berater bearbeitet und verschickt, und eine Notiz in Salesforce speichert. Ein in der Ankündigung zitierter Berater sagte, es spare ihm rund eine halbe Stunde pro Termin. Das ist die Zahl einer Person, kein Durchschnitt über die Firma, und der Berater entscheidet weiterhin, was beim Kunden ankommt.

Ubers Genie beantwortet Fragen von Ingenieuren in den Slack-Kanälen, in denen Bereitschaftsteams um Hilfe gebeten werden, durchsucht dafür die interne Dokumentation und nennt seine Quellen. Bis Oktober 2024 hatte es mehr als 70.000 Fragen in 154 Kanälen beantwortet und schätzungsweise 13.000 Ingenieursstunden gespart. Uber veröffentlichte auch die Zahl, die die meisten Anbieter weglassen würden: Nutzer bewerteten 48,9 % der Antworten als hilfreich. Es basiert auf Retrieval über die eigenen Dokumente des Unternehmens, der Ansatz, den RAG für Unternehmen erklärt.

Internes Wissen ist der sicherste Einstieg auf dieser Liste. Der Leser ist ein Beschäftigter, der das Geschäft kennt, die zitierte Quelle prüfen und eine schlechte Antwort ignorieren kann; ein Fehler kostet also ein paar Minuten und keinen Kunden.

Was die erfolgreichen gemeinsam haben

Die Erfolge sind eng gefasst. Java-Upgrades, Lebensmittelschäden unter 500 AUD, Frachtangebote, Zahlungsprüfungen, Routine-Bescheinigungen im HR: Jede dieser Aufgaben hat hohes Volumen, wiederholt sich und hat eine richtige Antwort, die sich prüfen lässt. Keiner der Agenten oben führt ein Unternehmen; jeder erledigt eine klar umrissene Aufgabe in einem.

Jeder Rückzieher auf dieser Liste hat dieselbe Form: Dem Agenten wurde mehr vom Job übertragen, als er nachweislich konnte. Die Commonwealth Bank baute Personal ab, bevor sich der Bot bewährt hatte. Cursor ließ einen Bot Regeln erklären. Klarna bewertete seinen Assistenten nach Aussage des eigenen CEO vor allem nach den Kosten. Instant Checkout übernahm den Teil des Kaufs, den die Händler behalten wollten.

Und die überzeugendsten Einsätze setzen an einer festgelegten Stelle einen Menschen ein. Die Allianz automatisiert nie die Auszahlung. Bei Stripe, Google und Nubank prüft ein Mensch jede Änderung. Der Berater bei Morgan Stanley verschickt die Mail. Das ist kein Zeichen, dass die Agenten schwach sind; es ist das Design, das sie in großem Volumen laufen lässt, ohne dass ein einzelner schlechter Fall zur Schlagzeile wird.

Wie man eine Agenten-Erfolgsgeschichte liest

Prüf, wer die Zahl veröffentlicht hat. Auf dieser Liste stammen die Zahlen zu Nubank von Cognition, das den Agenten verkauft hat; die zu BNY von Microsoft; die von Salesforce und Amazon beschreiben deren eigene Produkte. Nichts davon macht sie falsch, aber es stellt sie in eine andere Kategorie als Googles Paper, das seine eigenen Grenzen benennt, oder Uber, das eine Hilfreich-Quote von 48,9 % veröffentlicht hat.

Eine Zahl vom Unternehmen, das den Agenten verkauft, ist eine Behauptung zum Prüfen, kein Ergebnis zum Planen. Frag nach der Einheit. Eine „Aufgabe“, ein „Gespräch“ oder eine „Interaktion“ lässt sich auf viele Arten zählen; eine durchschnittliche Lösungszeit wird von den einfachen Fällen dominiert; „Pipeline“ und „zusätzlicher Umsatz“ sind Schätzungen, kein Umsatz.

Rechne damit, dass sich einiges davon ändert. Gartner sagt voraus, dass mehr als 40 % der Projekte mit agentischer KI bis Ende 2027 eingestellt werden, und seine Analysten nennen „Agent Washing“ — Anbieter, die bestehende Chatbots und Assistenten in Agenten umbenennen — als Teil des Grundes. Die Beispiele oben sind die, die lange genug überlebt haben, um ein Ergebnis zu veröffentlichen, und selbst unter ihnen endeten mehrere mit einem Rückzieher.

Was ein kleines Unternehmen realistisch einsetzen kann

Nicht Stripes 400 interne Werkzeuge oder die sieben Agenten der Allianz. Vier Muster von dieser Liste lassen sich aber verkleinern. Ein Support-Assistent, der aus deinen eigenen Hilfeinhalten antwortet und an einen Menschen übergibt, wie bei Lyft und Salesforce. Ein Follow-up-Agent für Anfragen, die sonst kalt würden, Salesforces SDR-Idee in der Größe eines Kontaktformulars. Ein Backoffice-Workflow mit einem einzigen KI-Schritt darin, etwa Bestell-E-Mails oder Rechnungen in dein System einzulesen, der kleine Verwandte von Allianz und C.H. Robinson. Und ein interner Assistent über deinen eigenen Dokumenten, wie Genie.

Fang mit einer Aufgabe an, die du schon als Checkliste aufschreiben könntest; wenn niemand die Schritte beschreiben kann, wird ein Agent sie nicht entdecken. Jeder Erfolg oben hatte das: eine definierte Eingabe, eine definierte Ausgabe und jemanden, der sagen konnte, ob das Ergebnis stimmt. Unser Leitfaden dazu, wo sich B2B-Prozessautomatisierung mit KI lohnt, zeigt, wie du diesen ersten Prozess auswählst.

Die meisten davon brauchen überhaupt keinen individuellen Agenten. Ein fester Workflow in n8n, Make oder Zapier mit einem Sprachmodell an einer Stelle ist günstiger, vorhersehbarer und leichter zu debuggen, und Zapier vs. Make vs. n8n vergleicht die drei nach Preis und danach, wo deine Daten landen. Für Kundenfragen deckt wo sich KI-Chatbots für Unternehmen wirklich lohnen das einfachere Werkzeug ab, das oft reicht.

Was auch immer du baust: Übernimm die Schutzvorkehrungen aus den guten Beispielen, nicht die Schlagzeilen aus den schlechten. Gib ihm zuerst nur Lesezugriff, stell einen Menschen vor alles, was Geld bewegt oder ein Versprechen macht, kennzeichne ihn als Bot, führ ein Protokoll über das, was er getan hat, und teste ihn an deinen letzten fünfzig echten Fällen, bevor er einen Kunden sieht.

Was es kostet

Die Plattformen berechnen Agenten nach Nutzung, und die Zahlen sind öffentlich. Intercoms Agent Fin kostet 0,99 US-Dollar pro Ergebnis, zusätzlich zu einem Helpdesk-Platz ab 29 US-Dollar im Monat bei jährlicher Zahlung. Salesforce berechnet für kundenorientierte Agentforce-Agenten 2 US-Dollar pro Gespräch oder 500 US-Dollar für 100.000 Flex Credits, wobei jede Aktion 20 Credits kostet, also rund 0,10 US-Dollar pro Aktion. n8n Cloud beginnt bei 20 € im Monat bei jährlicher Zahlung für 2.500 Workflow-Ausführungen, und die selbst gehostete Community Edition ist kostenlos. Preise geprüft im Oktober 2026.

Unsere eigenen Pakete sind auf die Muster oben zugeschnitten und nach dem benannt, was sie sind. Der FAQ-Chatbot kostet 799 €: ein Assistent, trainiert auf bis zu 50 deiner FAQs oder Dokumente, mit Übergabe an einen Menschen, also ein Chatbot und kein Agent, weil er antwortet statt zu handeln. Die Workflow-Automatisierung kostet 699 € für einen wiederkehrenden Workflow in n8n oder Make, der zwei oder drei deiner Werkzeuge verbindet, wo ein KI-Schritt in einem festen Prozess meist beginnt. Die n8n Automatisierung kostet 399 € für einen einzelnen Workflow zwischen zwei Plattformen, und das Individuelle Text-KI-Modell kostet 999 € für ein Modell auf Basis deiner eigenen Dokumente und deines Support-Verlaufs. KI-Nutzung und Plattform-Abos zahlst du in jedem Fall separat an die Anbieter.

Die Rechnung, die entscheidet, ob sich ein Agent lohnt, ist keine von beiden. Es ist die Zeit, ihn vor dem Start an echten Fällen zu testen, und die Person, die danach für die Ausnahmen zuständig ist. Die Geschichten von Commonwealth Bank und Cursor oben zeigen, wie es aussieht, wenn man das überspringt.

Wo wir anfangen würden

Wenn du ein Support-Postfach voller derselben zwanzig Fragen hast, fang dort an, mit einem Menschen einen Klick entfernt. Wenn du einen Backoffice-Prozess mit strukturierten Eingaben hast, etwa Bestellungen, Rechnungen oder Buchungen, automatisier ihn mit einem KI-Schritt und einer menschlichen Freigabe. Wenn du versucht bist, mit dem Abbau des Teams anzufangen, lies vorher noch einmal den Absatz über die Commonwealth Bank.

Das ist die Arbeit, die wir in der KI-Automatisierung machen. Erzähl uns, an welchen Prozess du denkst, und wir sagen dir ehrlich, ob er einen Agenten braucht, einen Chatbot, eine einfache Automatisierung ganz ohne KI oder gar nichts.

Quellen

Die Zahlen zu jedem Beispiel stammen aus der Ankündigung des Unternehmens, der Fallstudie des Anbieters oder dem Bericht eines großen Mediums, geprüft im Oktober 2026. Wo die einzige Quelle das Unternehmen oder der Anbieter ist, der ihm den Agenten verkauft hat, sagt der Text das. Die Preise stammen von der öffentlichen Preisseite des jeweiligen Anbieters, geprüft im Oktober 2026.

Häufig gestellte Fragen

Fragst du dich, welches davon in deinem Unternehmen funktionieren würde?

Erzähl uns, an welchen Prozess du denkst. Wir sagen dir ehrlich, ob er einen Agenten, einen Chatbot, eine einfache Automatisierung oder gar nichts braucht, und bauen ihn, wenn ja.