Die Produktivitätsversprechen der KI-Codeassistenten sind real und messbar. Die andere Hälfte der Rechnung ist es, wie sich zeigt, ebenfalls, und 2026 war das Jahr, in dem genug Code ausgeliefert wurde, dass jemand nachzählen konnte. Nichts davon spricht gegen die Werkzeuge. Es spricht darüber, wer das Ergebnis prüft — und was passiert, wenn es niemand tut.
— News
KI schreibt Code viermal schneller. Und Fehler zehnmal schneller.
Entwickler mit KI-Assistenz committen drei- bis viermal so oft — und produzieren zehnmal so viele Sicherheitsbefunde.
Was die Studien 2026 gemessen haben
| Messgröße | Ergebnis | Quelle |
|---|---|---|
| KI-Beispiele mit einer OWASP-Top-10-Schwachstelle | 45 % | Veracode, über 100 Modelle |
| Beispiele ohne Schutz gegen Cross-Site-Scripting | 86 % | Veracode |
| Beispiele anfällig für Log-Injection | 88 % | Veracode |
| Java-Beispiele, die Sicherheitstests nicht bestehen | 72 % | Veracode |
| CVEs durch KI-generierten Code, Jan. → März 2026 | 6 → 15 → 35 pro Monat | Georgia Tech, Vibe Security Radar |
| Sicherheitsbefunde je KI-gestütztem Entwickler gegenüber Kollegen | 10x | Fortune-50-Studie |
Die Veracode-Zahlen stammen aus kontrollierten, sicherheitsrelevanten Aufgaben, nicht aus Produktions-Repositories — sie messen also, was Modelle auf Anfrage erzeugen, nicht was nach Review live geht. Die CVE-Zahlen umfassen nur bestätigte Meldungen; die Forschenden schätzen den tatsächlichen Wert im Open-Source-Ökosystem fünf- bis zehnmal höher.
Die zwei Zahlen, die zusammengehören
In Entwicklungsteams von Fortune-50-Unternehmen committeten Entwickler mit KI-Unterstützung drei- bis viermal so oft wie ihre Kollegen und erzeugten zehnmal so viele Sicherheitsbefunde. Beide Hälften sind echt. Zusammengenommen beschreiben sie kein schnelleres Team, sondern eines, das eine bestimmte Art Schuld schneller anhäuft, als sie geprüft werden kann.
Nichts davon sagt, dass der Code nicht funktioniert. Es sagt, dass er funktioniert und angreifbar ist — ein weit schwerer zu bemerkender Fehler, denn geprüft wird, ob die Funktion ihre Aufgabe erfüllt. Cross-Site-Scripting und Log-Injection zeigen sich nicht, wenn das Formular korrekt abschickt.
Warum Modelle genau so scheitern
Ein Modell erzeugt den wahrscheinlichsten Code für die Anfrage, und der wahrscheinlichste Code im Internet ist die Tutorial-Fassung — die, die ein Konzept zeigt, ohne das Escaping, die Validierung und die Parametrisierung, die Produktion braucht. Du fragst nach einem Suchfeld und bekommst ein funktionierendes Suchfeld, geschrieben so, wie Suchfelder in Beispielen geschrieben werden.
Deshalb ist die Fehlerquote je Sprache so ungleich: Java schnitt mit 72 % am schlechtesten ab, im Gleichlauf mit Alter und Menge des verfügbaren Beispielcodes. Das Modell macht nach eigenen Maßstäben keinen Fehler. Es reproduziert die gelernte Verteilung, und diese Verteilung besteht überwiegend aus Demonstrationen.
Was das heißt, wenn du billig bauen lassen hast
Kam ein sehr niedriges Angebot mit einer sehr kurzen Frist, lohnt die Frage, ob jemand das Ergebnis auf mehr geprüft hat als auf „sieht richtig aus“. Die sichtbare Schicht — Seiten, Formulare, Layout — ist genau der Teil, den KI gut kann. Eine Website kann also vollständig fertig wirken und ein Formular haben, das ein Script-Tag annimmt.
Der billigste Moment, das zu finden, ist vor dem Launch; der teuerste ist, nachdem ein Sicherheitsvorfall es für dich offenlegt. Ein technisches Audit deckt genau das ab, und was du von einer KI-generierten Website wirklich bekommst ist die größere Fassung derselben Frage.
Wie verantwortungsvoller Einsatz aussieht
Die Teams, die das Tempo ohne die Schuld bekommen, tun drei unspektakuläre Dinge: automatisiertes Security-Scanning in der Pipeline, damit Befunde beim Commit auftauchen und nicht erst im Audit; menschliches Review für alles, was Eingaben, Authentifizierung oder Datenzugriff berührt; und eine ausdrückliche Regel, dass generierter Code ein Entwurf ist.
Das bremst KI nicht aus, es ist die Bedingung, unter der das Tempo etwas wert ist. Wir nutzen diese Werkzeuge täglich und halten uns intern an dieselbe Regel — dass wir mit Next.js bauen, liegt auch daran, dass dessen Voreinstellungen Ausgaben von Haus aus escapen, was eine ganze Klasse dieses Problems beseitigt, bevor überhaupt jemand tippt. Die andere Hälfte desselben Jahres ist, dass Angreifer dieselben Werkzeuge übernommen haben, und schneller — Black-Hat-Hacker steuern jetzt Agenten-Schwärme ist diese Geschichte.
Quellen
Im September 2026 geprüft. Kontrollierte Studien und Meldungszählungen — was jede misst und was nicht, steht in der Tabellenfußnote.
- Veracode — GenAI Code Security Update, Frühjahr 2026 ↗
Über 100 große Sprachmodelle bei sicherheitsrelevanten Aufgaben: 45 % der Beispiele mit einer OWASP-Top-10-Schwachstelle, 86 % ohne XSS-Abwehr, 88 % anfällig für Log-Injection, Java am schlechtesten mit 72 %.
- Cloud Security Alliance — Die Sicherheitsschuld des Vibe Coding: der Anstieg KI-generierter CVEs ↗
Der Verlauf von 6 → 15 → 35 CVEs pro Monat zwischen Januar und März 2026 und die Schätzung, dass bestätigte Meldungen den echten Wert um das Fünf- bis Zehnfache unterschätzen.
- Infosecurity Magazine — Forschende warnen vor Schwachstellen in KI-generiertem Code ↗
Berichterstattung zum Vergleich von Commit-Rate und Befundrate in Entwicklungsteams großer Unternehmen, zitiert im ersten Abschnitt.
— FAQ
Häufig gestellte Fragen
Unsicher, was unter deiner Website steckt?
Wir scannen sie gegen die OWASP Top 10 und sagen dir in klarer Sprache und nach Priorität, was zu beheben ist.