> Die Studien von METR, DORA, Microsoft und GitHub zu KI-Coding-Tools: was sie nicht beweisen, und ein Kostenmodell für einen Senior gegen ein Team oder eine Agentur.
>
> Web page: https://balazscsorba.com/de/blog/ai-assisted-development-economics · Language: Deutsch · Also available in: [English](https://balazscsorba.com/blog/ai-assisted-development-economics.md) · [Magyar](https://balazscsorba.com/hu/blog/ai-assisted-development-economics.md)
> Author: Balázs Csorba · Published: 2026-10-01 · Keywords: AI coding agents cost, developer productivity AI study, METR AI developer slowdown, AI coding break-even cost model, one senior engineer vs team, AI coding agent vs agency, DORA AI adoption report, GDPR processor contract AI coding tools

[Blog](https://balazscsorba.com/de/blog)/KI-Agenten

# Ein Senior mit Coding-Agenten gegen ein Team: was die Belege sagen

Die Studien von METR, DORA, Microsoft und GitHub zu KI-Coding-Tools: was sie nicht beweisen, und ein Kostenmodell für einen Senior gegen ein Team oder eine Agentur.

[Balázs Csorba](https://balazscsorba.com/de/about)·1\. Oktober 2026·11 Min. Lesezeit

-   AI coding agents
-   Developer productivity
-   Engineering economics
-   Team cost
-   GDPR

![Titelbild zur KI-Coding-Ökonomie: eine Pipeline vom Entwurf bis zur Auslieferung, in der Agenten das Schreiben beschleunigen und Review- und Qualitätskosten einen Teil des Gewinns zurückholen.](https://balazscsorba.com/images/blog/ai-assisted-development-economics/cover.webp?v=9cd7e90736)

## Das Wichtigste in Kürze

-   Die Studien widersprechen sich, und das Muster ist nützlich. In einer Studie von 2025 dauerten Aufgaben erfahrener Entwickler auf Codebasen, die sie kannten, mit KI 19 % länger. In einer Studie von 2023 brauchte eine klar abgegrenzte Aufgabe mit Copilot 55,8 % weniger Zeit.
-   Miss den Nettogewinn von Anfang bis Ende, vom Ticket bis zur Produktion, bei gleicher Qualität. Ein Tempogewinn im Entwurf kann in Review, Nacharbeit und Vorfällen wieder aufgezehrt werden.
-   Der Break-even ist einfach: Der Nettogewinn muss die Kosten für Tools, Review und Qualität übersteigen, ausgedrückt als Anteil an den voll belasteten Kosten des Entwicklers.
-   Ein Senior mit Agenten bündelt das Risiko in einer Person und bei einem Anbieter. Plane vor der Entscheidung eine zweite Prüfperson, ein schriftliches Runbook und eine Rückfalloption ein.
-   Schließe einen Auftragsverarbeitungsvertrag ab und bestätige Training und Verarbeitungsstandort schriftlich, bevor Kundendaten in einen Prompt gelangen. Artikel 28 DSGVO verlangt das von Auftragsverarbeitern.

Auf dieser Seite

1.  [Was die Studien gemessen haben](https://balazscsorba.com/#what-the-studies-measured)
2.  [Was die Umfragen über Vertrauen und Auslieferung sagen](https://balazscsorba.com/#surveys-trust-delivery)
3.  [Wo Agenten sich lohnen und wo nicht](https://balazscsorba.com/#where-agents-pay-off)
4.  [Der Vergleich, den niemand gemessen hat](https://balazscsorba.com/#comparison-nobody-measured)
5.  [Ein Kostenmodell, das du ausfüllen kannst](https://balazscsorba.com/#cost-model)
6.  [Drei Risiken, die die Tabelle nicht zeigt](https://balazscsorba.com/#risks)
7.  [Wann ein Senior mit Agenten genügt](https://balazscsorba.com/#when-one-senior-is-enough)
8.  [Was ich zuerst tun würde](https://balazscsorba.com/#first-steps)
9.  [Quellen](https://balazscsorba.com/#sources)

Diesen Artikel anhören

0:000:00

Wenn du Engineering oder Finanzen verantwortest, kommt diese Frage bald: Kann ein Senior-Entwickler mit Coding-Agenten die Arbeit eines Teams oder einer Agentur erledigen? Niemand hat diesen Vergleich direkt gemessen. Die vorhandenen Studien messen Teile davon, und einige Ergebnisse haben die Forschenden selbst überrascht. Meine Antwort ist ein Break-even-Test und kein Urteil. Ein Senior mit Agenten gewinnt nur, wenn der Nettogewinn an Produktivität bei deiner Arbeit die Kosten für Tools, Review und Qualität übersteigt, jeweils als Anteil an den voll belasteten Kosten des Entwicklers.

## Was die Studien gemessen haben

Die kontrollierten Studien mit den größten Gewinnen haben Code-Completion-Assistenten bei klar abgegrenzten Aufgaben gemessen. Die Studie von 2025 hat einen KI-Code-Editor mit Claude-Modellen an echten Issues getestet. Agenten, die planen, Befehle ausführen und ihre eigene Ausgabe überarbeiten, wurden bisher weniger untersucht. Lies jede Zahl deshalb als Momentaufnahme eines Tools, eines Jahres und einer Aufgabenart.

### Die Studie, die eine Verlangsamung fand

METR, eine gemeinnützige Organisation, die KI-Systeme evaluiert, hat Anfang 2025 eine randomisierte Studie mit 16 erfahrenen Open-Source-Entwicklern durchgeführt. Sie arbeiteten an 246 echten Issues in ausgereiften Repositories. Jedes Issue wurde zufällig entweder für KI freigegeben oder für sie gesperrt. Vorab erwarteten die Entwickler, dass KI ihre Zeit um 24 % verkürzt. Danach schätzten sie eine Verkürzung um 20 %. Gemessen wurde das Gegenteil: Mit KI dauerten die Aufgaben 19 % länger, mit einem Konfidenzintervall von +2 % bis +39 %.

Zwei Lehren folgen daraus. Die Entwickler lagen mit ihrer Einschätzung des eigenen Tempos falsch, deshalb ist die Frage, wie schnell sich jemand fühlt, keine Messung. Außerdem ist die Stichprobe klein, die Tools waren Modelle von Anfang 2025, und der Code war den Beteiligten vertraut. Die Studienautoren prüften 20 Eigenschaften ihres Versuchsaufbaus und fanden, dass die Verlangsamung über ihre Analysen hinweg bestehen blieb. Sie halten es für möglich, dass KI anderswo hilft, etwa bei weniger erfahrenen Entwicklern oder in unbekannten Codebasen.

### Die Folgestudie, die nichts entschied

Das zweite Experiment von METR begann im August 2025 mit 57 Entwicklern, 143 Repositories und mehr als 800 Aufgaben. Im Februar 2026 nannten die Autoren die Daten ein unzuverlässiges Signal. Entwickler, die nicht ohne KI arbeiten wollten, haben sich gegen die Teilnahme entschieden, was die Schätzung wahrscheinlich nach unten verzerrt. Außerdem sank die Vergütung von 150 auf 50 Dollar pro Stunde, was beeinflusst haben kann, wer mitgemacht hat. Die Autoren halten es für wahrscheinlich, dass Entwickler heute schneller sind. Ihre Daten sind aber nur sehr schwache Belege für die Größe dieses Gewinns, und ihre Konfidenzintervalle schließen die Null ein.

### Kontrollierte Studien mit großen Gewinnen

In einer Studie von GitHub aus dem Jahr 2023 wurden 95 Entwickler zufällig in eine Copilot-Gruppe und eine Kontrollgruppe aufgeteilt. Alle sollten so schnell wie möglich einen HTTP-Server in JavaScript bauen. Die Copilot-Gruppe brauchte im Durchschnitt 71 Minuten statt 161 Minuten, eine Verringerung um 55,8 % mit einem 95-%-Konfidenzintervall von 21 % bis 89 %. Nur etwa 35 Entwickler haben die Aufgabe abgeschlossen, und der Unterschied bei der Erfolgsquote war statistisch nicht signifikant. Mehrere Autoren arbeiten bei GitHub oder Microsoft Research. Die Studie ist also nicht unabhängig vom Anbieter.

Die größte Stichprobe in dieser Übersicht stammt aus drei Unternehmen. Forschende bei Microsoft, Accenture und einem anonymen Fortune-100-Unternehmen stellten zufällig ausgewählten Gruppen von Entwicklern während des normalen Betriebs einen KI-Assistenten für Code-Completion zur Verfügung. Über alle 4.867 Entwickler hinweg schätzen die Autoren einen Anstieg der abgeschlossenen Aufgaben um 26,08 %, bei einem Standardfehler von 10,3 %. Weniger erfahrene Entwickler haben mehr gewonnen. Deshalb liegt der wahrscheinliche Gewinn eines Seniors unter dem Durchschnitt.

## Was die Umfragen über Vertrauen und Auslieferung sagen

Der DORA-Bericht 2024 von Google Cloud ist korrelativ. Lies ihn also als Zusammenhang, nicht als Ursache. Ein Anstieg der KI-Nutzung um 25 % ging mit einer um 3,4 % höheren Code-Qualität und einer um 3,1 % schnelleren Code-Review einher. Gleichzeitig sanken der Durchsatz der Auslieferung um 1,5 % und die Stabilität der Auslieferung um 7,2 %. 39 % der Befragten hatten wenig oder gar kein Vertrauen in KI-generierten Code. Der Bericht 2025, der auf knapp 5.000 IT-Fachleuten beruht, formuliert es schärfer: KI verstärkt, was eine Organisation bereits gut oder schlecht macht.

Der Stack Overflow Developer Survey 2025 zeigt dieselbe Spannung bei Einzelpersonen. 84 % der Befragten nutzen KI-Tools oder planen es, und 51 % der professionellen Entwickler nutzen sie täglich. Trotzdem misstrauen 46 % der Genauigkeit von KI-Tools, während 33 % ihnen vertrauen. Die häufigste Frustration, von 66 % genannt, ist eine Ausgabe, die fast, aber nicht ganz richtig ist. 45 % sagen, dass die Fehlersuche daran mehr Zeit kostet.

Tabelle 1 stellt die Hauptergebnisse neben ihre Grenzen.

Studie

Was gemessen wurde

Hauptergebnis

Was sie nicht zeigt

METR, 2025

16 erfahrene Entwickler, 246 echte Issues

19 % länger mit KI

Tools von Ende 2025, andere Codebasen

METR, Februar 2026

57 Entwickler, mehr als 800 Aufgaben

Konfidenzintervalle schließen die Null ein

Eine verlässliche Zahl zur Geschwindigkeit

GitHub, 2023 (Peng et al.)

95 randomisierte Entwickler, eine HTTP-Server-Aufgabe

55,8 % weniger Zeit

Wartungsarbeit oder lange Projekte

Microsoft, Accenture, Fortune-100-Unternehmen

4.867 Entwickler in drei Feldexperimenten

+26,08 % abgeschlossene Aufgaben

Agenten oder Qualität nach dem Merge

DORA, 2024

Befragung von IT-Fachleuten

Pro 25 % mehr Nutzung: −1,5 % Durchsatz, −7,2 % Stabilität

Kausalität (korrelativ)

Stack Overflow, 2025

Einstellungen von Entwicklern

46 % misstrauen der KI-Genauigkeit, 33 % vertrauen

Die tatsächliche Produktivität

Google, Migrationen, 2025

39 Code-Migrationen, 595 Änderungen

74,45 % der Änderungen von LLMs erzeugt

Neue Funktionen; die halbe Zeitersparnis ist eine Schätzung

Meta, TestGen-LLM, 2024

Unit-Tests für Instagram Reels und Stories

75 % gebaut, 57 % zuverlässig bestanden

Code außerhalb der Test-Suiten

## Wo Agenten sich lohnen und wo nicht

Das Muster ist ziemlich stabil. Gewinne zeigen sich, wenn die Aufgabe klar abgegrenzt ist, eine automatische Prüfung entscheidet, ob das Ergebnis stimmt, und ein Mensch die Ausgabe nur noch lesen muss. Die Gewinne schrumpfen, wenn die Arbeit von Kontext außerhalb des Codes abhängt oder wenn die Codebasis so groß und vertraut ist, dass jede Änderung Zeile für Zeile geprüft werden muss.

-   **Tests hinter einem Filter.** Metas TestGen-LLM schlägt nur Kandidaten vor, die automatische Prüfungen bestehen und eine messbare Verbesserung bringen. Bei Instagrams Reels und Stories ließen sich 75 % seiner Testfälle fehlerfrei bauen, 57 % bestanden zuverlässig, und 25 % erhöhten die Abdeckung. Ingenieure haben 73 % seiner Empfehlungen angenommen.
-   **Migrationen.** In Googles Bericht über 39 Migrationen stammten 74,45 % der eingereichten Änderungen und 69,46 % der Bearbeitungen von LLMs. Ingenieure schätzten, dass die Gesamtzeit um etwa die Hälfte sank. Das ist eine Schätzung, keine Messung.
-   **Klar abgegrenzte Aufgaben mit eindeutigem Ziel.** Der Gewinn von 55,8 % im GitHub-Versuch stammte genau aus dieser Art von Aufgabe.
-   **Fremder Code und weniger erfahrene Entwickler.** Die Feldexperimente fanden die größten Gewinne bei weniger erfahrenen Entwicklern, und METR nennt unbekannte Codebasen als wahrscheinlichen Ort, an dem KI hilft.

-   **Vertrauter, ausgereifter Code.** In METRs Versuch dauerten Aufgaben in Repositories, die die Entwickler gut kannten, mit erlaubter KI 19 % länger.
-   **Unklare Anforderungen.** Die Studien messen das nicht. Meine Lesart ist, dass die Kosten im Review anfallen. Der Agent erzeugt plausiblen Code für die Anforderung, die er bekommen hat, und ein Senior muss prüfen, ob es die richtige war.
-   **Review und Nacharbeit.** Fast richtige Ausgaben sind die größte Frustration in der Stack-Overflow-Umfrage. GitClear, das Daten zu Codeänderungen auswertet, berichtet, dass der Anteil refaktorierter Zeilen an den geänderten Zeilen von 25 % im Jahr 2021 auf unter 10 % im Jahr 2024 fiel, während kopierte Zeilen von 8,3 % auf 12,3 % stiegen. Das ist ein Zusammenhang, kein Beweis für eine Ursache. Zur Review-Seite des Problems siehe meine Notiz zu [KI-Code-Review ist inzwischen der Engpass](https://balazscsorba.com/de/blog/ai-generated-pr-review-bottleneck).
-   **Wissen außerhalb des Repositorys.** Preisregeln, regulatorische Logik und Eigenheiten der Kunden stehen nicht in den Dateien, die ein Agent liest. Das Aufschreiben dieses Kontexts kostet die Zeit des Seniors.

## Der Vergleich, den niemand gemessen hat

Ich habe keine Studie gefunden, die einen Senior mit Agenten mit einem Team oder einer Agentur vergleicht, bei gleichem Umfang, gleichem Qualitätsmaßstab und gleichem Kunden. Der Vergleich muss aus gemessenen Teilen zusammengesetzt werden: dem Nettogewinn des Seniors, den Kosten, die das Setup über die Zeit des Seniors hinaus verursacht, und Preis und Tempo der Alternative. Das Kostenmodell unten bringt sie an einen Ort. Es ist eine Methode für deine Zahlen, keine Prognose.

Die Alternativen scheitern auf unterschiedliche Weise. Ein Team kostet mehr Köpfe, aber mehr als eine Person kennt das System und kann prüfen und ausliefern, was ein einzelner Senior nicht bietet. Eine Agentur verkauft Kapazität nach Tagessätzen, und ihr Satz deckt eigenen Overhead und Marge. Ihre Tage sind nur vergleichbar, wenn das Angebot dieselbe Arbeit enthält: Discovery, Tests, Deployment und Übergabe.

## Ein Kostenmodell, das du ausfüllen kannst

Verwende für jede Option denselben Umfang, denselben Zeitraum und denselben Qualitätsmaßstab. Das Diagramm zeigt, wo der Gewinn standhalten muss, und die Tabelle definiert die Eingaben.

Der Gewinn entsteht im Entwurf und wird bei Review, Tests und Vorfällen wieder aufgebraucht. Miss ihn vom Ticket bis zur Produktion.

Eingabe

Was einzutragen ist

Woher sie kommt

L, voll belastete Kosten

Monatliche Kosten des Seniors: Gehalt, Arbeitgeberkosten, Ausstattung, Overhead

Lohnbuchhaltung und Finanzen

T, Tool-Kosten

Plätze, Nutzung über dem Tarif, API-Ausgaben, Hosting für Agenten

Rechnungen der Anbieter

V, Review-Kosten

Stunden, die andere mit Prüfen und Korrigieren der Agenten-Ausgabe verbringen, multipliziert mit ihrem Stundensatz

Zeiterfassung für Pull Requests

Q, Qualitätskosten

Erwartete monatliche Kosten für Vorfälle, Nacharbeit und Kundengutschriften

Vorfalls- und Fehlerprotokoll

B, Ausgangsbasis

Tage vereinbarter Arbeit, die pro Monat ohne Agenten geliefert werden

Drei Monate Erfassung

g, Nettogewinn

Gemessener Gewinn vom Ticket bis zur Produktion bei gleicher Qualität, als Anteil: 0,10 sind 10 %

Ein Pilotprojekt, keine Umfrage

D und Sa, Agentur

Tagessatz der Agentur und die Tage, die sie für denselben Umfang angibt

Schriftliches Angebot

```
cost per scope day, no agents      = L / B
cost per scope day, with agents    = (L + T + V + Q) / (B × (1 + g))
break-even net gain                = (T + V + Q) / L
senior with agents, scope S days   = (L + T + V + Q) × S / (B × (1 + g))
agency, same scope                 = D × Sa
```

Die Break-even-Linie ist die Zahl, die du in die Besprechung mitnimmst. Jeder Prozentpunkt an Tool-, Review- und Qualitätskosten, bezogen auf die voll belasteten Kosten, muss durch einen gemessenen Prozentpunkt Nettogewinn wieder hereingeholt werden. Wenn diese Kosten zusammen 10 % der voll belasteten Kosten ausmachen, macht ein Nettogewinn unter 10 % jeden gelieferten Tag teurer als vorher. Für ein Team addierst du die voll belasteten Kosten und verwendest den gemessenen Output des Teams.

Die Tool-Zeile ist am leichtesten zu schätzen und am wenigsten stabil. Stand Oktober 2026 kostet Claude Pro 17 $ pro Monat im Jahresabo oder 20 $ bei monatlicher Abrechnung. Ein Standard-Seat bei Claude Team kostet 20 $ pro Monat bei jährlicher Abrechnung, ein Premium-Seat 100 $ pro Monat bei jährlicher Abrechnung, und Claude Max beginnt bei 100 $ pro Monat. GitHub Copilot Pro kostet 10 $ pro Monat, Pro+ 39 $ und Max 100 $. Es gelten Nutzungslimits, und Anthropic weist darauf hin, dass Preise und Pläne nach eigenem Ermessen geändert werden können.

Vergleiche die Optionen beim gleichen Umfang. Die Agentur-Seite ist ihr Tagessatz mal die angebotenen Tage, die Senior-Seite ist die Umfangsformel. Die Antwort kippt auf zwei Arten: Entweder ist der gemessene Gewinn groß und die Review-Kosten sind niedrig, oder die Agentur veranschlagt weit mehr Tage, als die Arbeit braucht. Lass beide Seiten dieselben Ergebnisse liefern, bevor du Zahlen vergleichst.

**Gleicher Umfang, gleiche Messlatte**

Trag den im Pilotprojekt gemessenen Gewinn ein, nicht den Benchmark eines Anbieters, und miss ihn neu, sobald sich Tool oder Modell ändern.

## Drei Risiken, die die Tabelle nicht zeigt

### Single Point of Failure

Ein Senior ist ein Bus-Faktor von eins, und Agenten vertiefen diese Abhängigkeit, weil das Wissen jetzt auch in Prompts, Skills und Konfigurationen steckt, nicht nur in einem Kopf. Bewahre die Agenten-Konfiguration, die Spezifikationen und die Review-Regeln im Repository auf. Benenne eine zweite Person, die prüfen und ausliefern kann, und vereinbare im Voraus, was bei Krankheit oder Urlaub passiert. Der Anbieter ist eine zweite Schwachstelle. Plane deshalb eine Rückfalloption ein, etwa einen Rahmenvertrag mit einer Agentur, und geh nicht davon aus, dass der heutige Preis bleibt.

### Qualitätsschulden

Qualitätsschulden kommen später und tauchen nicht in der Zeit fürs Programmieren auf. Der Zusammenhang der DORA-Studie mit geringerer Stabilität ist die Warnung: Code kann schneller ankommen, als das System ihn verkraften kann. Die Absicherung gehört in die Pipeline, nicht in den Prompt. Mach den Merge abhängig von Prüfungen, die der Agent nicht ändern kann (meine Notiz zu [Harness Engineering für Coding-Agenten](https://balazscsorba.com/de/blog/harness-engineering-coding-agents) beschreibt den Aufbau). Verlange für jede Änderung eine menschliche Freigabe und verfolge Nacharbeit, etwa Änderungen, die innerhalb eines festen Zeitfensters zurückgenommen oder wieder geöffnet werden.

### Datenschutz

Artikel 28 DSGVO gilt, wenn ein Anbieter personenbezogene Daten in deinem Auftrag verarbeitet. Der Auftragsverarbeiter braucht einen schriftlichen Vertrag, der Gegenstand und Dauer der Verarbeitung, Art und Zweck sowie die Art der personenbezogenen Daten festlegt. Er darf keinen weiteren Auftragsverarbeiter ohne deine vorherige schriftliche Genehmigung hinzuziehen, sei es eine gesonderte oder eine allgemeine. Nimm den Anbieter des Agenten unter diesen Vertrag, bevor personenbezogene Daten in einen Prompt gelangen. Dazu gehören Namen in Tickets, Kundendatensätze in Testdaten und personenbezogene Daten in Logs.

Auch die Vertragsbedingungen zählen. Die kommerziellen Bedingungen von Anthropic sagen, dass Anthropic keine Modelle auf Kundeninhalten aus seinen Diensten trainieren darf. Der Team-Tarif sieht standardmäßig kein Modelltraining mit deinen Inhalten vor. Kunden im EWR, in der Schweiz oder im Vereinigten Königreich schließen ihren Vertrag mit Anthropic Ireland. Die Dokumentation zum Datenstandort beschreibt Inferenz nur in den USA zum 1,1-fachen Standardpreis und sonst globales Routing zum Standardpreis. Auf der Seite, die ich gelesen habe, fand ich keine rein EU-basierte Option. Frag deshalb schriftlich danach. Meine Notiz zu [DSGVO und Datenstandort bei LLM-APIs](https://balazscsorba.com/de/blog/gdpr-llm-api-eu-data-residency) behandelt die EU-Optionen ausführlicher.

## Wann ein Senior mit Agenten genügt

Meine Faustregel ist die Kette unten. Arbeite sie der Reihe nach durch und halte beim ersten Nein an. Die ersten drei Fragen entscheiden, ob das Setup sicher betrieben werden kann. Die letzte entscheidet, ob es günstiger ist.

Beim ersten Nein anhalten. Ein unsicheres Setup ist nicht günstiger, egal wie hoch der gemessene Gewinn ist.

## Was ich zuerst tun würde

1.  Halte die Ausgangsbasis fest. Drei Monate lang notierst du, wie viele Tage vereinbarter Arbeit diese Person liefert und wie lange ein Ticket bis zur Produktion braucht.
2.  Starte einen zweiwöchigen Pilot an einem klar abgegrenzten Projekt mit Agenten. Miss den Gewinn vom Ticket bis zur Auslieferung gegen die Ausgangsbasis, nicht das gefühlte Tempo.
3.  Füll das Kostenmodell mit echten Zahlen aus und vergleiche es mit einem schriftlichen Angebot einer Agentur für denselben Umfang.
4.  Unterschreib den Auftragsverarbeitungsvertrag und bestätige Training, Aufbewahrung und Verarbeitungsstandort schriftlich, bevor Kundendaten in einen Prompt gelangen.
5.  Benenne eine zweite Person, die Agentenarbeit prüft und ausliefert, und halte fest, was passiert, wenn der Senior nicht da ist.
6.  Miss jedes Quartal neu. Tools ändern sich schneller als Studien, und die Folgestudie von METR zeigt, wie schwer sich die Zahl genau bestimmen lässt.

Dafür braucht es keine Plattform. Es braucht eine Ausgangsbasis, einen gemessenen Gewinn und einen unterschriebenen Vertrag, in dieser Reihenfolge.

## Quellen

1.  [METR: KI und erfahrene Open-Source-Entwickler, Anfang 2025](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)
2.  [Becker et al.: arXiv 2507.09089](https://arxiv.org/abs/2507.09089)
3.  [METR: Design des Produktivitätsexperiments, Februar 2026](https://metr.org/blog/2026-02-24-uplift-update/)
4.  [Peng et al.: kontrolliertes Experiment mit GitHub Copilot, arXiv 2302.06590](https://arxiv.org/html/2302.06590v1)
5.  [Cui et al.: drei Feldexperimente mit Softwareentwicklern](https://www.microsoft.com/en-us/research/?p=1148213)
6.  [DORA: State of AI-assisted Software Development 2025](https://research.google/pubs/dora-2025-state-of-ai-assisted-software-development-report/)
7.  [Google Cloud: Highlights des DORA-Berichts 2024](https://cloud.google.com/blog/products/devops-sre/announcing-the-2024-dora-report)
8.  [Stack Overflow: Developer Survey 2025, KI](https://survey.stackoverflow.co/2025/ai)
9.  [Ziftci et al.: Migrating Code At Scale With LLMs At Google](https://arxiv.org/abs/2504.09691)
10.  [Alshahwan et al.: Automated Unit Test Improvement using Large Language Models at Meta](https://arxiv.org/abs/2402.09171)
11.  [GitClear: AI Copilot Code Quality: 2025 Look Back at 12 Months of Data](https://www.gitclear.com/ai_assistant_code_quality_2025_research)
12.  [DSGVO, Verordnung (EU) 2016/679, Artikel 28](https://eur-lex.europa.eu/eli/reg/2016/679/oj/eng)
13.  [Anthropic: Commercial Terms of Service](https://www.anthropic.com/legal/commercial-terms)
14.  [Claude: Preise](https://claude.com/pricing)
15.  [Claude Platform: Datenstandort](https://platform.claude.com/docs/en/build-with-claude/data-residency)
16.  [GitHub Copilot: Pläne und Preise](https://github.com/features/copilot/plans)

## Häufige Fragen

Machen Coding-Agenten erfahrene Entwickler schneller?

Die Belege entscheiden das nicht. Eine randomisierte Studie von METR aus dem Jahr 2025 fand, dass erfahrene Open-Source-Entwickler bei Aufgaben mit erlaubter KI 19 % länger brauchten, obwohl sie meinten, KI habe sie 20 % schneller gemacht. Die Folgestudie von METR vom Februar 2026 lieferte Schätzungen, deren Konfidenzintervalle die Null einschließen. Die Autoren nannten die Daten sehr schwache Belege. Miss dein eigenes Team, bevor du entscheidest.

Wie hoch ist der Break-even-Produktivitätsgewinn für ein KI-Coding-Setup?

Addiere die monatlichen Tool-Kosten, die Review-Zeit, die andere für die KI-Ausgabe aufwenden, und die erwarteten monatlichen Kosten für Qualitätsprobleme. Teile die Summe durch die voll belasteten Monatskosten des Entwicklers. Das Ergebnis ist der minimale Nettogewinn, von Anfang bis Ende gemessen, den das Setup liefern muss, nur um die Kosten zu decken.

Darf ich unter der DSGVO Kundencode oder personenbezogene Daten an einen Coding-Agenten senden?

Nur mit einem schriftlichen Vertrag nach Artikel 28, in dem der Anbieter als Auftragsverarbeiter auftritt. Prüfe schriftlich, dass der Anbieter nicht mit deinen Inhalten trainiert, was er speichert und wo die Verarbeitung stattfindet. Manche Business-Tarife, etwa Claude Team, sehen standardmäßig kein Modelltraining vor, aber der Vertrag muss trotzdem bestehen.

Ist ein Senior mit Agenten günstiger als eine Agentur?

Das kann sein, aber die Antwort hängt vom gemessenen Gewinn, vom Tagessatz der Agentur und von den Tagen ab, die sie für denselben Umfang braucht. Stelle beide Optionen auf denselben Umfang und Qualitätsmaßstab und vergleiche die Kosten pro gelieferten Tag. Eine öffentliche Studie, die beide direkt vergleicht, habe ich nicht gefunden.

Geschrieben von Balázs Csorba

Senior Fullstack & AI Engineer in der Steiermark – über 10 Jahre Vue, Nuxt, Node.js und PHP, heute baue ich Werkzeuge für KI-Agenten.

[KI-Entwicklung & MCP-Server →](https://balazscsorba.com/de/expertise/ai-engineer)[Über mich →](https://balazscsorba.com/de/about)

## Weitere Artikel

-   [Spec-driven Development für Coding-Agenten: den Plan vor dem Code festlegen](https://balazscsorba.com/de/blog/spec-driven-development-coding-agents)
-   [MCP-Tool-Design: Lehren aus einem Jira-Server mit 20 Tools](https://balazscsorba.com/de/blog/mcp-tool-design-lessons-jira-server)
-   [Memory für KI-Agenten entwerfen: Ebenen, Schreibregeln, Poisoning und DSGVO](https://balazscsorba.com/de/blog/ai-agent-memory-design)
-   [Harness Engineering: Guides und Sensors, die Agent-PRs mergebar machen](https://balazscsorba.com/de/blog/harness-engineering-coding-agents)

## Klingt nach dem, was du suchst?

Erzähl mir von deinem Projekt oder deiner Stelle – ich freue mich, von dir zu hören.

[Gespräch buchen](mailto:contact@balazscsorba.com) [Auf LinkedIn vernetzen](https://www.linkedin.com/in/balazs-csorba)
