[{"data":1,"prerenderedAt":819},["ShallowReactive",2],{"blog-ai-assisted-development-economics-de":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":14,"about":23,"sources":33,"cover":82,"og":83,"expertise":84,"locales":85,"lang":87,"title":89,"description":90,"coverAlt":91,"metaTitle":92,"takeaways":93,"faq":99,"toc":112,"blocks":140,"others":548},"ai-assisted-development-economics","2026-10-01",11,"agents",[9,10,11,12,13],"AI coding agents","Developer productivity","Engineering economics","Team cost","GDPR",[15,16,17,18,19,20,21,22],"AI coding agents cost","developer productivity AI study","METR AI developer slowdown","AI coding break-even cost model","one senior engineer vs team","AI coding agent vs agency","DORA AI adoption report","GDPR processor contract AI coding tools",[24,27,30],{"name":25,"url":26},"General Data Protection Regulation","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FGeneral_Data_Protection_Regulation",{"name":28,"url":29},"Randomized controlled trial","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FRandomized_controlled_trial",{"name":31,"url":32},"Bus factor","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FBus_factor",[34,37,40,43,46,49,52,55,58,61,64,67,70,73,76,79],{"title":35,"url":36},"METR: early-2025 AI and experienced open-source developers","https:\u002F\u002Fmetr.org\u002Fblog\u002F2025-07-10-early-2025-ai-experienced-os-dev-study\u002F",{"title":38,"url":39},"Becker et al.: arXiv 2507.09089","https:\u002F\u002Farxiv.org\u002Fabs\u002F2507.09089",{"title":41,"url":42},"METR: developer productivity experiment design, February 2026","https:\u002F\u002Fmetr.org\u002Fblog\u002F2026-02-24-uplift-update\u002F",{"title":44,"url":45},"Peng et al.: GitHub Copilot controlled experiment, arXiv 2302.06590","https:\u002F\u002Farxiv.org\u002Fhtml\u002F2302.06590v1",{"title":47,"url":48},"Cui et al.: three field experiments with software developers","https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002F?p=1148213",{"title":50,"url":51},"DORA: State of AI-assisted Software Development 2025","https:\u002F\u002Fresearch.google\u002Fpubs\u002Fdora-2025-state-of-ai-assisted-software-development-report\u002F",{"title":53,"url":54},"Google Cloud: highlights from the 2024 DORA report","https:\u002F\u002Fcloud.google.com\u002Fblog\u002Fproducts\u002Fdevops-sre\u002Fannouncing-the-2024-dora-report",{"title":56,"url":57},"Stack Overflow: Developer Survey 2025, AI","https:\u002F\u002Fsurvey.stackoverflow.co\u002F2025\u002Fai",{"title":59,"url":60},"Ziftci et al.: Migrating Code At Scale With LLMs At Google","https:\u002F\u002Farxiv.org\u002Fabs\u002F2504.09691",{"title":62,"url":63},"Alshahwan et al.: Automated Unit Test Improvement using Large Language Models at Meta","https:\u002F\u002Farxiv.org\u002Fabs\u002F2402.09171",{"title":65,"url":66},"GitClear: AI Copilot Code Quality: 2025 Look Back at 12 Months of Data","https:\u002F\u002Fwww.gitclear.com\u002Fai_assistant_code_quality_2025_research",{"title":68,"url":69},"GDPR, Regulation (EU) 2016\u002F679, Article 28","https:\u002F\u002Feur-lex.europa.eu\u002Feli\u002Freg\u002F2016\u002F679\u002Foj\u002Feng",{"title":71,"url":72},"Anthropic: Commercial Terms of Service","https:\u002F\u002Fwww.anthropic.com\u002Flegal\u002Fcommercial-terms",{"title":74,"url":75},"Claude: pricing","https:\u002F\u002Fclaude.com\u002Fpricing",{"title":77,"url":78},"Claude Platform: data residency","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fbuild-with-claude\u002Fdata-residency",{"title":80,"url":81},"GitHub Copilot: plans and pricing","https:\u002F\u002Fgithub.com\u002Ffeatures\u002Fcopilot\u002Fplans","\u002Fimages\u002Fblog\u002Fai-assisted-development-economics\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fai-assisted-development-economics\u002Fog.jpg","ai-engineer",[86,87,88],"en","de","hu","Ein Senior mit Coding-Agenten gegen ein Team: was die Belege sagen","Die Studien von METR, DORA, Microsoft und GitHub zu KI-Coding-Tools: was sie nicht beweisen, und ein Kostenmodell für einen Senior gegen ein Team oder eine Agentur.","Titelbild zur KI-Coding-Ökonomie: eine Pipeline vom Entwurf bis zur Auslieferung, in der Agenten das Schreiben beschleunigen und Review- und Qualitätskosten einen Teil des Gewinns zurückholen.","Coding-Agenten vs. Team: die Belege · Balázs Csorba",[94,95,96,97,98],"Die Studien widersprechen sich, und das Muster ist nützlich. In einer Studie von 2025 dauerten Aufgaben erfahrener Entwickler auf Codebasen, die sie kannten, mit KI 19 % länger. In einer Studie von 2023 brauchte eine klar abgegrenzte Aufgabe mit Copilot 55,8 % weniger Zeit.","Miss den Nettogewinn von Anfang bis Ende, vom Ticket bis zur Produktion, bei gleicher Qualität. Ein Tempogewinn im Entwurf kann in Review, Nacharbeit und Vorfällen wieder aufgezehrt werden.","Der Break-even ist einfach: Der Nettogewinn muss die Kosten für Tools, Review und Qualität übersteigen, ausgedrückt als Anteil an den voll belasteten Kosten des Entwicklers.","Ein Senior mit Agenten bündelt das Risiko in einer Person und bei einem Anbieter. Plane vor der Entscheidung eine zweite Prüfperson, ein schriftliches Runbook und eine Rückfalloption ein.","Schließe einen Auftragsverarbeitungsvertrag ab und bestätige Training und Verarbeitungsstandort schriftlich, bevor Kundendaten in einen Prompt gelangen. Artikel 28 DSGVO verlangt das von Auftragsverarbeitern.",[100,103,106,109],{"q":101,"a":102},"Machen Coding-Agenten erfahrene Entwickler schneller?","Die Belege entscheiden das nicht. Eine randomisierte Studie von METR aus dem Jahr 2025 fand, dass erfahrene Open-Source-Entwickler bei Aufgaben mit erlaubter KI 19 % länger brauchten, obwohl sie meinten, KI habe sie 20 % schneller gemacht. Die Folgestudie von METR vom Februar 2026 lieferte Schätzungen, deren Konfidenzintervalle die Null einschließen. Die Autoren nannten die Daten sehr schwache Belege. Miss dein eigenes Team, bevor du entscheidest.",{"q":104,"a":105},"Wie hoch ist der Break-even-Produktivitätsgewinn für ein KI-Coding-Setup?","Addiere die monatlichen Tool-Kosten, die Review-Zeit, die andere für die KI-Ausgabe aufwenden, und die erwarteten monatlichen Kosten für Qualitätsprobleme. Teile die Summe durch die voll belasteten Monatskosten des Entwicklers. Das Ergebnis ist der minimale Nettogewinn, von Anfang bis Ende gemessen, den das Setup liefern muss, nur um die Kosten zu decken.",{"q":107,"a":108},"Darf ich unter der DSGVO Kundencode oder personenbezogene Daten an einen Coding-Agenten senden?","Nur mit einem schriftlichen Vertrag nach Artikel 28, in dem der Anbieter als Auftragsverarbeiter auftritt. Prüfe schriftlich, dass der Anbieter nicht mit deinen Inhalten trainiert, was er speichert und wo die Verarbeitung stattfindet. Manche Business-Tarife, etwa Claude Team, sehen standardmäßig kein Modelltraining vor, aber der Vertrag muss trotzdem bestehen.",{"q":110,"a":111},"Ist ein Senior mit Agenten günstiger als eine Agentur?","Das kann sein, aber die Antwort hängt vom gemessenen Gewinn, vom Tagessatz der Agentur und von den Tagen ab, die sie für denselben Umfang braucht. Stelle beide Optionen auf denselben Umfang und Qualitätsmaßstab und vergleiche die Kosten pro gelieferten Tag. Eine öffentliche Studie, die beide direkt vergleicht, habe ich nicht gefunden.",[113,116,119,122,125,128,131,134,137],{"id":114,"title":115},"what-the-studies-measured","Was die Studien gemessen haben",{"id":117,"title":118},"surveys-trust-delivery","Was die Umfragen über Vertrauen und Auslieferung sagen",{"id":120,"title":121},"where-agents-pay-off","Wo Agenten sich lohnen und wo nicht",{"id":123,"title":124},"comparison-nobody-measured","Der Vergleich, den niemand gemessen hat",{"id":126,"title":127},"cost-model","Ein Kostenmodell, das du ausfüllen kannst",{"id":129,"title":130},"risks","Drei Risiken, die die Tabelle nicht zeigt",{"id":132,"title":133},"when-one-senior-is-enough","Wann ein Senior mit Agenten genügt",{"id":135,"title":136},"first-steps","Was ich zuerst tun würde",{"id":138,"title":139},"sources","Quellen",[141,145,148,151,155,158,161,164,167,170,173,176,177,180,183,186,270,271,274,299,327,328,331,334,335,338,347,405,408,411,414,417,424,425,428,431,434,442,445,448,456,457,460,467,468,483,486,487],{"type":142,"content":143},"paragraph",[144],"Wenn du Engineering oder Finanzen verantwortest, kommt diese Frage bald: Kann ein Senior-Entwickler mit Coding-Agenten die Arbeit eines Teams oder einer Agentur erledigen? Niemand hat diesen Vergleich direkt gemessen. Die vorhandenen Studien messen Teile davon, und einige Ergebnisse haben die Forschenden selbst überrascht. Meine Antwort ist ein Break-even-Test und kein Urteil. Ein Senior mit Agenten gewinnt nur, wenn der Nettogewinn an Produktivität bei deiner Arbeit die Kosten für Tools, Review und Qualität übersteigt, jeweils als Anteil an den voll belasteten Kosten des Entwicklers.",{"type":146,"level":147,"id":114,"text":115},"heading",2,{"type":142,"content":149},[150],"Die kontrollierten Studien mit den größten Gewinnen haben Code-Completion-Assistenten bei klar abgegrenzten Aufgaben gemessen. Die Studie von 2025 hat einen KI-Code-Editor mit Claude-Modellen an echten Issues getestet. Agenten, die planen, Befehle ausführen und ihre eigene Ausgabe überarbeiten, wurden bisher weniger untersucht. Lies jede Zahl deshalb als Momentaufnahme eines Tools, eines Jahres und einer Aufgabenart.",{"type":146,"level":152,"id":153,"text":154},3,"metr-trial","Die Studie, die eine Verlangsamung fand",{"type":142,"content":156},[157],"METR, eine gemeinnützige Organisation, die KI-Systeme evaluiert, hat Anfang 2025 eine randomisierte Studie mit 16 erfahrenen Open-Source-Entwicklern durchgeführt. Sie arbeiteten an 246 echten Issues in ausgereiften Repositories. Jedes Issue wurde zufällig entweder für KI freigegeben oder für sie gesperrt. Vorab erwarteten die Entwickler, dass KI ihre Zeit um 24 % verkürzt. Danach schätzten sie eine Verkürzung um 20 %. Gemessen wurde das Gegenteil: Mit KI dauerten die Aufgaben 19 % länger, mit einem Konfidenzintervall von +2 % bis +39 %.",{"type":142,"content":159},[160],"Zwei Lehren folgen daraus. Die Entwickler lagen mit ihrer Einschätzung des eigenen Tempos falsch, deshalb ist die Frage, wie schnell sich jemand fühlt, keine Messung. Außerdem ist die Stichprobe klein, die Tools waren Modelle von Anfang 2025, und der Code war den Beteiligten vertraut. Die Studienautoren prüften 20 Eigenschaften ihres Versuchsaufbaus und fanden, dass die Verlangsamung über ihre Analysen hinweg bestehen blieb. Sie halten es für möglich, dass KI anderswo hilft, etwa bei weniger erfahrenen Entwicklern oder in unbekannten Codebasen.",{"type":146,"level":152,"id":162,"text":163},"metr-follow-up","Die Folgestudie, die nichts entschied",{"type":142,"content":165},[166],"Das zweite Experiment von METR begann im August 2025 mit 57 Entwicklern, 143 Repositories und mehr als 800 Aufgaben. Im Februar 2026 nannten die Autoren die Daten ein unzuverlässiges Signal. Entwickler, die nicht ohne KI arbeiten wollten, haben sich gegen die Teilnahme entschieden, was die Schätzung wahrscheinlich nach unten verzerrt. Außerdem sank die Vergütung von 150 auf 50 Dollar pro Stunde, was beeinflusst haben kann, wer mitgemacht hat. Die Autoren halten es für wahrscheinlich, dass Entwickler heute schneller sind. Ihre Daten sind aber nur sehr schwache Belege für die Größe dieses Gewinns, und ihre Konfidenzintervalle schließen die Null ein.",{"type":146,"level":152,"id":168,"text":169},"controlled-gains","Kontrollierte Studien mit großen Gewinnen",{"type":142,"content":171},[172],"In einer Studie von GitHub aus dem Jahr 2023 wurden 95 Entwickler zufällig in eine Copilot-Gruppe und eine Kontrollgruppe aufgeteilt. Alle sollten so schnell wie möglich einen HTTP-Server in JavaScript bauen. Die Copilot-Gruppe brauchte im Durchschnitt 71 Minuten statt 161 Minuten, eine Verringerung um 55,8 % mit einem 95-%-Konfidenzintervall von 21 % bis 89 %. Nur etwa 35 Entwickler haben die Aufgabe abgeschlossen, und der Unterschied bei der Erfolgsquote war statistisch nicht signifikant. Mehrere Autoren arbeiten bei GitHub oder Microsoft Research. Die Studie ist also nicht unabhängig vom Anbieter.",{"type":142,"content":174},[175],"Die größte Stichprobe in dieser Übersicht stammt aus drei Unternehmen. Forschende bei Microsoft, Accenture und einem anonymen Fortune-100-Unternehmen stellten zufällig ausgewählten Gruppen von Entwicklern während des normalen Betriebs einen KI-Assistenten für Code-Completion zur Verfügung. Über alle 4.867 Entwickler hinweg schätzen die Autoren einen Anstieg der abgeschlossenen Aufgaben um 26,08 %, bei einem Standardfehler von 10,3 %. Weniger erfahrene Entwickler haben mehr gewonnen. Deshalb liegt der wahrscheinliche Gewinn eines Seniors unter dem Durchschnitt.",{"type":146,"level":147,"id":117,"text":118},{"type":142,"content":178},[179],"Der DORA-Bericht 2024 von Google Cloud ist korrelativ. Lies ihn also als Zusammenhang, nicht als Ursache. Ein Anstieg der KI-Nutzung um 25 % ging mit einer um 3,4 % höheren Code-Qualität und einer um 3,1 % schnelleren Code-Review einher. Gleichzeitig sanken der Durchsatz der Auslieferung um 1,5 % und die Stabilität der Auslieferung um 7,2 %. 39 % der Befragten hatten wenig oder gar kein Vertrauen in KI-generierten Code. Der Bericht 2025, der auf knapp 5.000 IT-Fachleuten beruht, formuliert es schärfer: KI verstärkt, was eine Organisation bereits gut oder schlecht macht.",{"type":142,"content":181},[182],"Der Stack Overflow Developer Survey 2025 zeigt dieselbe Spannung bei Einzelpersonen. 84 % der Befragten nutzen KI-Tools oder planen es, und 51 % der professionellen Entwickler nutzen sie täglich. Trotzdem misstrauen 46 % der Genauigkeit von KI-Tools, während 33 % ihnen vertrauen. Die häufigste Frustration, von 66 % genannt, ist eine Ausgabe, die fast, aber nicht ganz richtig ist. 45 % sagen, dass die Fehlersuche daran mehr Zeit kostet.",{"type":142,"content":184},[185],"Tabelle 1 stellt die Hauptergebnisse neben ihre Grenzen.",{"type":187,"head":188,"rows":197},"table",[189,191,193,195],[190],"Studie",[192],"Was gemessen wurde",[194],"Hauptergebnis",[196],"Was sie nicht zeigt",[198,207,216,225,234,243,252,261],[199,201,203,205],[200],"METR, 2025",[202],"16 erfahrene Entwickler, 246 echte Issues",[204],"19 % länger mit KI",[206],"Tools von Ende 2025, andere Codebasen",[208,210,212,214],[209],"METR, Februar 2026",[211],"57 Entwickler, mehr als 800 Aufgaben",[213],"Konfidenzintervalle schließen die Null ein",[215],"Eine verlässliche Zahl zur Geschwindigkeit",[217,219,221,223],[218],"GitHub, 2023 (Peng et al.)",[220],"95 randomisierte Entwickler, eine HTTP-Server-Aufgabe",[222],"55,8 % weniger Zeit",[224],"Wartungsarbeit oder lange Projekte",[226,228,230,232],[227],"Microsoft, Accenture, Fortune-100-Unternehmen",[229],"4.867 Entwickler in drei Feldexperimenten",[231],"+26,08 % abgeschlossene Aufgaben",[233],"Agenten oder Qualität nach dem Merge",[235,237,239,241],[236],"DORA, 2024",[238],"Befragung von IT-Fachleuten",[240],"Pro 25 % mehr Nutzung: −1,5 % Durchsatz, −7,2 % Stabilität",[242],"Kausalität (korrelativ)",[244,246,248,250],[245],"Stack Overflow, 2025",[247],"Einstellungen von Entwicklern",[249],"46 % misstrauen der KI-Genauigkeit, 33 % vertrauen",[251],"Die tatsächliche Produktivität",[253,255,257,259],[254],"Google, Migrationen, 2025",[256],"39 Code-Migrationen, 595 Änderungen",[258],"74,45 % der Änderungen von LLMs erzeugt",[260],"Neue Funktionen; die halbe Zeitersparnis ist eine Schätzung",[262,264,266,268],[263],"Meta, TestGen-LLM, 2024",[265],"Unit-Tests für Instagram Reels und Stories",[267],"75 % gebaut, 57 % zuverlässig bestanden",[269],"Code außerhalb der Test-Suiten",{"type":146,"level":147,"id":120,"text":121},{"type":142,"content":272},[273],"Das Muster ist ziemlich stabil. Gewinne zeigen sich, wenn die Aufgabe klar abgegrenzt ist, eine automatische Prüfung entscheidet, ob das Ergebnis stimmt, und ein Mensch die Ausgabe nur noch lesen muss. Die Gewinne schrumpfen, wenn die Arbeit von Kontext außerhalb des Codes abhängt oder wenn die Codebasis so groß und vertraut ist, dass jede Änderung Zeile für Zeile geprüft werden muss.",{"type":275,"ordered":276,"items":277},"list",false,[278,284,289,294],[279,283],{"tag":280,"children":281},"strong",[282],"Tests hinter einem Filter."," Metas TestGen-LLM schlägt nur Kandidaten vor, die automatische Prüfungen bestehen und eine messbare Verbesserung bringen. Bei Instagrams Reels und Stories ließen sich 75 % seiner Testfälle fehlerfrei bauen, 57 % bestanden zuverlässig, und 25 % erhöhten die Abdeckung. Ingenieure haben 73 % seiner Empfehlungen angenommen.",[285,288],{"tag":280,"children":286},[287],"Migrationen."," In Googles Bericht über 39 Migrationen stammten 74,45 % der eingereichten Änderungen und 69,46 % der Bearbeitungen von LLMs. Ingenieure schätzten, dass die Gesamtzeit um etwa die Hälfte sank. Das ist eine Schätzung, keine Messung.",[290,293],{"tag":280,"children":291},[292],"Klar abgegrenzte Aufgaben mit eindeutigem Ziel."," Der Gewinn von 55,8 % im GitHub-Versuch stammte genau aus dieser Art von Aufgabe.",[295,298],{"tag":280,"children":296},[297],"Fremder Code und weniger erfahrene Entwickler."," Die Feldexperimente fanden die größten Gewinne bei weniger erfahrenen Entwicklern, und METR nennt unbekannte Codebasen als wahrscheinlichen Ort, an dem KI hilft.",{"type":275,"ordered":276,"items":300},[301,306,311,322],[302,305],{"tag":280,"children":303},[304],"Vertrauter, ausgereifter Code."," In METRs Versuch dauerten Aufgaben in Repositories, die die Entwickler gut kannten, mit erlaubter KI 19 % länger.",[307,310],{"tag":280,"children":308},[309],"Unklare Anforderungen."," Die Studien messen das nicht. Meine Lesart ist, dass die Kosten im Review anfallen. Der Agent erzeugt plausiblen Code für die Anforderung, die er bekommen hat, und ein Senior muss prüfen, ob es die richtige war.",[312,315,316,321],{"tag":280,"children":313},[314],"Review und Nacharbeit."," Fast richtige Ausgaben sind die größte Frustration in der Stack-Overflow-Umfrage. GitClear, das Daten zu Codeänderungen auswertet, berichtet, dass der Anteil refaktorierter Zeilen an den geänderten Zeilen von 25 % im Jahr 2021 auf unter 10 % im Jahr 2024 fiel, während kopierte Zeilen von 8,3 % auf 12,3 % stiegen. Das ist ein Zusammenhang, kein Beweis für eine Ursache. Zur Review-Seite des Problems siehe meine Notiz zu ",{"tag":317,"to":318,"children":319},"link","\u002Fblog\u002Fai-generated-pr-review-bottleneck",[320],"KI-Code-Review ist inzwischen der Engpass",".",[323,326],{"tag":280,"children":324},[325],"Wissen außerhalb des Repositorys."," Preisregeln, regulatorische Logik und Eigenheiten der Kunden stehen nicht in den Dateien, die ein Agent liest. Das Aufschreiben dieses Kontexts kostet die Zeit des Seniors.",{"type":146,"level":147,"id":123,"text":124},{"type":142,"content":329},[330],"Ich habe keine Studie gefunden, die einen Senior mit Agenten mit einem Team oder einer Agentur vergleicht, bei gleichem Umfang, gleichem Qualitätsmaßstab und gleichem Kunden. Der Vergleich muss aus gemessenen Teilen zusammengesetzt werden: dem Nettogewinn des Seniors, den Kosten, die das Setup über die Zeit des Seniors hinaus verursacht, und Preis und Tempo der Alternative. Das Kostenmodell unten bringt sie an einen Ort. Es ist eine Methode für deine Zahlen, keine Prognose.",{"type":142,"content":332},[333],"Die Alternativen scheitern auf unterschiedliche Weise. Ein Team kostet mehr Köpfe, aber mehr als eine Person kennt das System und kann prüfen und ausliefern, was ein einzelner Senior nicht bietet. Eine Agentur verkauft Kapazität nach Tagessätzen, und ihr Satz deckt eigenen Overhead und Marge. Ihre Tage sind nur vergleichbar, wenn das Angebot dieselbe Arbeit enthält: Discovery, Tests, Deployment und Übergabe.",{"type":146,"level":147,"id":126,"text":127},{"type":142,"content":336},[337],"Verwende für jede Option denselben Umfang, denselben Zeitraum und denselben Qualitätsmaßstab. Das Diagramm zeigt, wo der Gewinn standhalten muss, und die Tabelle definiert die Eingaben.",{"type":339,"attrs":340,"inner":344,"caption":345},"diagram",{"viewBox":341,"role":342,"aria-labelledby":343},"0 0 720 250","img","d2-gain-t d2-gain-d","\u003Ctitle id=\"d2-gain-t\">Wo der Gewinn standhalten muss\u003C\u002Ftitle>\u003Cdesc id=\"d2-gain-d\">Vier Stufen nebeneinander: Entwurf, Review, Test und Fix, Auslieferung. Im Entwurf beschleunigt der Agent die Arbeit, und das ist der Gewinn. Review, Tests und spätere Vorfälle sind Kosten. Der Nettogewinn wird bei der Auslieferung gemessen. Darunter besagt die Break-even-Regel, dass der Nettogewinn die Kosten für Tools, Review und Qualität, geteilt durch die voll belasteten Kosten, übersteigen muss.\u003C\u002Fdesc>\u003Ctext x=\"360\" y=\"30\" text-anchor=\"middle\" class=\"d-title\">Wo der Gewinn standhalten muss\u003C\u002Ftext>\u003Crect x=\"20\" y=\"60\" width=\"140\" height=\"70\" rx=\"10\" class=\"d-accent\" \u002F>\u003Ctext x=\"90\" y=\"90\" text-anchor=\"middle\" class=\"d-text\">Entwurf\u003C\u002Ftext>\u003Ctext x=\"90\" y=\"112\" text-anchor=\"middle\" class=\"d-small\">Agent beschleunigt\u003C\u002Ftext>\u003Crect x=\"205\" y=\"60\" width=\"140\" height=\"70\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"275\" y=\"90\" text-anchor=\"middle\" class=\"d-text\">Review\u003C\u002Ftext>\u003Ctext x=\"275\" y=\"112\" text-anchor=\"middle\" class=\"d-small\">Mensch liest mit\u003C\u002Ftext>\u003Crect x=\"390\" y=\"60\" width=\"140\" height=\"70\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"460\" y=\"90\" text-anchor=\"middle\" class=\"d-text\">Test und Fix\u003C\u002Ftext>\u003Ctext x=\"460\" y=\"112\" text-anchor=\"middle\" class=\"d-small\">Fehler kommen später\u003C\u002Ftext>\u003Crect x=\"575\" y=\"60\" width=\"140\" height=\"70\" rx=\"10\" class=\"d-mint\" \u002F>\u003Ctext x=\"645\" y=\"90\" text-anchor=\"middle\" class=\"d-text\">Ausliefern\u003C\u002Ftext>\u003Ctext x=\"645\" y=\"112\" text-anchor=\"middle\" class=\"d-small\">hier messen\u003C\u002Ftext>\u003Cpath d=\"M162 95 H196\" class=\"d-line\" \u002F>\u003Cpath d=\"M205 95 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Cpath d=\"M347 95 H381\" class=\"d-line\" \u002F>\u003Cpath d=\"M390 95 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Cpath d=\"M532 95 H566\" class=\"d-line\" \u002F>\u003Cpath d=\"M575 95 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"90\" y=\"156\" text-anchor=\"middle\" class=\"d-label\">Gewinn\u003C\u002Ftext>\u003Ctext x=\"275\" y=\"156\" text-anchor=\"middle\" class=\"d-label\">Kosten V\u003C\u002Ftext>\u003Ctext x=\"460\" y=\"156\" text-anchor=\"middle\" class=\"d-label\">Kosten Q\u003C\u002Ftext>\u003Ctext x=\"645\" y=\"156\" text-anchor=\"middle\" class=\"d-label\">Nettogewinn g\u003C\u002Ftext>\u003Crect x=\"20\" y=\"186\" width=\"680\" height=\"44\" rx=\"10\" class=\"d-fill-muted\" \u002F>\u003Ctext x=\"360\" y=\"213\" text-anchor=\"middle\" class=\"d-text\">Break-even: g muss (T + V + Q) \u002F L übersteigen\u003C\u002Ftext>",[346],"Der Gewinn entsteht im Entwurf und wird bei Review, Tests und Vorfällen wieder aufgebraucht. Miss ihn vom Ticket bis zur Produktion.",{"type":187,"head":348,"rows":355},[349,351,353],[350],"Eingabe",[352],"Was einzutragen ist",[354],"Woher sie kommt",[356,363,370,377,384,391,398],[357,359,361],[358],"L, voll belastete Kosten",[360],"Monatliche Kosten des Seniors: Gehalt, Arbeitgeberkosten, Ausstattung, Overhead",[362],"Lohnbuchhaltung und Finanzen",[364,366,368],[365],"T, Tool-Kosten",[367],"Plätze, Nutzung über dem Tarif, API-Ausgaben, Hosting für Agenten",[369],"Rechnungen der Anbieter",[371,373,375],[372],"V, Review-Kosten",[374],"Stunden, die andere mit Prüfen und Korrigieren der Agenten-Ausgabe verbringen, multipliziert mit ihrem Stundensatz",[376],"Zeiterfassung für Pull Requests",[378,380,382],[379],"Q, Qualitätskosten",[381],"Erwartete monatliche Kosten für Vorfälle, Nacharbeit und Kundengutschriften",[383],"Vorfalls- und Fehlerprotokoll",[385,387,389],[386],"B, Ausgangsbasis",[388],"Tage vereinbarter Arbeit, die pro Monat ohne Agenten geliefert werden",[390],"Drei Monate Erfassung",[392,394,396],[393],"g, Nettogewinn",[395],"Gemessener Gewinn vom Ticket bis zur Produktion bei gleicher Qualität, als Anteil: 0,10 sind 10 %",[397],"Ein Pilotprojekt, keine Umfrage",[399,401,403],[400],"D und Sa, Agentur",[402],"Tagessatz der Agentur und die Tage, die sie für denselben Umfang angibt",[404],"Schriftliches Angebot",{"type":406,"code":407},"code","cost per scope day, no agents      = L \u002F B\ncost per scope day, with agents    = (L + T + V + Q) \u002F (B × (1 + g))\nbreak-even net gain                = (T + V + Q) \u002F L\nsenior with agents, scope S days   = (L + T + V + Q) × S \u002F (B × (1 + g))\nagency, same scope                 = D × Sa",{"type":142,"content":409},[410],"Die Break-even-Linie ist die Zahl, die du in die Besprechung mitnimmst. Jeder Prozentpunkt an Tool-, Review- und Qualitätskosten, bezogen auf die voll belasteten Kosten, muss durch einen gemessenen Prozentpunkt Nettogewinn wieder hereingeholt werden. Wenn diese Kosten zusammen 10 % der voll belasteten Kosten ausmachen, macht ein Nettogewinn unter 10 % jeden gelieferten Tag teurer als vorher. Für ein Team addierst du die voll belasteten Kosten und verwendest den gemessenen Output des Teams.",{"type":142,"content":412},[413],"Die Tool-Zeile ist am leichtesten zu schätzen und am wenigsten stabil. Stand Oktober 2026 kostet Claude Pro 17 $ pro Monat im Jahresabo oder 20 $ bei monatlicher Abrechnung. Ein Standard-Seat bei Claude Team kostet 20 $ pro Monat bei jährlicher Abrechnung, ein Premium-Seat 100 $ pro Monat bei jährlicher Abrechnung, und Claude Max beginnt bei 100 $ pro Monat. GitHub Copilot Pro kostet 10 $ pro Monat, Pro+ 39 $ und Max 100 $. Es gelten Nutzungslimits, und Anthropic weist darauf hin, dass Preise und Pläne nach eigenem Ermessen geändert werden können.",{"type":142,"content":415},[416],"Vergleiche die Optionen beim gleichen Umfang. Die Agentur-Seite ist ihr Tagessatz mal die angebotenen Tage, die Senior-Seite ist die Umfangsformel. Die Antwort kippt auf zwei Arten: Entweder ist der gemessene Gewinn groß und die Review-Kosten sind niedrig, oder die Agentur veranschlagt weit mehr Tage, als die Arbeit braucht. Lass beide Seiten dieselben Ergebnisse liefern, bevor du Zahlen vergleichst.",{"type":418,"variant":419,"title":420,"body":421},"callout","tip","Gleicher Umfang, gleiche Messlatte",[422],[423],"Trag den im Pilotprojekt gemessenen Gewinn ein, nicht den Benchmark eines Anbieters, und miss ihn neu, sobald sich Tool oder Modell ändern.",{"type":146,"level":147,"id":129,"text":130},{"type":146,"level":152,"id":426,"text":427},"single-point-of-failure","Single Point of Failure",{"type":142,"content":429},[430],"Ein Senior ist ein Bus-Faktor von eins, und Agenten vertiefen diese Abhängigkeit, weil das Wissen jetzt auch in Prompts, Skills und Konfigurationen steckt, nicht nur in einem Kopf. Bewahre die Agenten-Konfiguration, die Spezifikationen und die Review-Regeln im Repository auf. Benenne eine zweite Person, die prüfen und ausliefern kann, und vereinbare im Voraus, was bei Krankheit oder Urlaub passiert. Der Anbieter ist eine zweite Schwachstelle. Plane deshalb eine Rückfalloption ein, etwa einen Rahmenvertrag mit einer Agentur, und geh nicht davon aus, dass der heutige Preis bleibt.",{"type":146,"level":152,"id":432,"text":433},"quality-debt","Qualitätsschulden",{"type":142,"content":435},[436,437,441],"Qualitätsschulden kommen später und tauchen nicht in der Zeit fürs Programmieren auf. Der Zusammenhang der DORA-Studie mit geringerer Stabilität ist die Warnung: Code kann schneller ankommen, als das System ihn verkraften kann. Die Absicherung gehört in die Pipeline, nicht in den Prompt. Mach den Merge abhängig von Prüfungen, die der Agent nicht ändern kann (meine Notiz zu ",{"tag":317,"to":438,"children":439},"\u002Fblog\u002Fharness-engineering-coding-agents",[440],"Harness Engineering für Coding-Agenten"," beschreibt den Aufbau). Verlange für jede Änderung eine menschliche Freigabe und verfolge Nacharbeit, etwa Änderungen, die innerhalb eines festen Zeitfensters zurückgenommen oder wieder geöffnet werden.",{"type":146,"level":152,"id":443,"text":444},"data-protection","Datenschutz",{"type":142,"content":446},[447],"Artikel 28 DSGVO gilt, wenn ein Anbieter personenbezogene Daten in deinem Auftrag verarbeitet. Der Auftragsverarbeiter braucht einen schriftlichen Vertrag, der Gegenstand und Dauer der Verarbeitung, Art und Zweck sowie die Art der personenbezogenen Daten festlegt. Er darf keinen weiteren Auftragsverarbeiter ohne deine vorherige schriftliche Genehmigung hinzuziehen, sei es eine gesonderte oder eine allgemeine. Nimm den Anbieter des Agenten unter diesen Vertrag, bevor personenbezogene Daten in einen Prompt gelangen. Dazu gehören Namen in Tickets, Kundendatensätze in Testdaten und personenbezogene Daten in Logs.",{"type":142,"content":449},[450,451,455],"Auch die Vertragsbedingungen zählen. Die kommerziellen Bedingungen von Anthropic sagen, dass Anthropic keine Modelle auf Kundeninhalten aus seinen Diensten trainieren darf. Der Team-Tarif sieht standardmäßig kein Modelltraining mit deinen Inhalten vor. Kunden im EWR, in der Schweiz oder im Vereinigten Königreich schließen ihren Vertrag mit Anthropic Ireland. Die Dokumentation zum Datenstandort beschreibt Inferenz nur in den USA zum 1,1-fachen Standardpreis und sonst globales Routing zum Standardpreis. Auf der Seite, die ich gelesen habe, fand ich keine rein EU-basierte Option. Frag deshalb schriftlich danach. Meine Notiz zu ",{"tag":317,"to":452,"children":453},"\u002Fblog\u002Fgdpr-llm-api-eu-data-residency",[454],"DSGVO und Datenstandort bei LLM-APIs"," behandelt die EU-Optionen ausführlicher.",{"type":146,"level":147,"id":132,"text":133},{"type":142,"content":458},[459],"Meine Faustregel ist die Kette unten. Arbeite sie der Reihe nach durch und halte beim ersten Nein an. Die ersten drei Fragen entscheiden, ob das Setup sicher betrieben werden kann. Die letzte entscheidet, ob es günstiger ist.",{"type":339,"attrs":461,"inner":464,"caption":465},{"viewBox":462,"role":342,"aria-labelledby":463},"0 0 720 390","d1-decide-t d1-decide-d","\u003Ctitle id=\"d1-decide-t\">Entscheiden, ob ein Senior mit Agenten genügt\u003C\u002Ftitle>\u003Cdesc id=\"d1-decide-d\">Eine Kette von fünf Schritten, von oben nach unten gelesen. Ist der Umfang nicht schriftlich festgelegt, kommt zuerst die Spezifikation. Fangen die Tests keine Regressionen, kommen zuerst Tests und CI. Kann eine zweite Person nicht prüfen und ausliefern, kommt ein Reviewer oder ein Rahmenvertrag dazu. Liegt der Nettogewinn nicht über dem Break-even, bleibt das Team, oder die Agentur wird beauftragt. Bestehen alle Prüfungen, wird die Arbeit übernommen und jedes Quartal neu gemessen.\u003C\u002Fdesc>\u003Ctext x=\"700\" y=\"22\" text-anchor=\"end\" class=\"d-label\">Oben starten, beim ersten Nein stoppen\u003C\u002Ftext>\u003Crect x=\"20\" y=\"40\" width=\"300\" height=\"46\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"170\" y=\"68\" text-anchor=\"middle\" class=\"d-text\">Ist der Umfang schriftlich festgelegt?\u003C\u002Ftext>\u003Cpath d=\"M320 63 H392\" class=\"d-line-accent\" \u002F>\u003Cpath d=\"M400 63 l-9 -5 v10 z\" class=\"d-head-accent\" \u002F>\u003Ctext x=\"332\" y=\"57\" class=\"d-label\">nein\u003C\u002Ftext>\u003Crect x=\"400\" y=\"40\" width=\"300\" height=\"46\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"550\" y=\"59\" text-anchor=\"middle\" class=\"d-text\">Spezifikation zuerst schreiben\u003C\u002Ftext>\u003Ctext x=\"550\" y=\"76\" text-anchor=\"middle\" class=\"d-small\">Product Owner oder Team schreibt sie\u003C\u002Ftext>\u003Cpath d=\"M170 86 V103\" class=\"d-line\" \u002F>\u003Cpath d=\"M170 112 l-5 -9 h10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"180\" y=\"98\" class=\"d-label\">ja\u003C\u002Ftext>\u003Crect x=\"20\" y=\"112\" width=\"300\" height=\"46\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"170\" y=\"140\" text-anchor=\"middle\" class=\"d-text\">Fangen die Tests Regressionen?\u003C\u002Ftext>\u003Cpath d=\"M320 135 H392\" class=\"d-line-accent\" \u002F>\u003Cpath d=\"M400 135 l-9 -5 v10 z\" class=\"d-head-accent\" \u002F>\u003Ctext x=\"332\" y=\"129\" class=\"d-label\">nein\u003C\u002Ftext>\u003Crect x=\"400\" y=\"112\" width=\"300\" height=\"46\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"550\" y=\"131\" text-anchor=\"middle\" class=\"d-text\">Tests und CI zuerst reparieren\u003C\u002Ftext>\u003Ctext x=\"550\" y=\"148\" text-anchor=\"middle\" class=\"d-small\">Ein roter Test stoppt den Merge\u003C\u002Ftext>\u003Cpath d=\"M170 158 V175\" class=\"d-line\" \u002F>\u003Cpath d=\"M170 184 l-5 -9 h10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"180\" y=\"170\" class=\"d-label\">ja\u003C\u002Ftext>\u003Crect x=\"20\" y=\"184\" width=\"300\" height=\"46\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"170\" y=\"212\" text-anchor=\"middle\" class=\"d-text\">Kann eine zweite Person ausliefern?\u003C\u002Ftext>\u003Cpath d=\"M320 207 H392\" class=\"d-line-accent\" \u002F>\u003Cpath d=\"M400 207 l-9 -5 v10 z\" class=\"d-head-accent\" \u002F>\u003Ctext x=\"332\" y=\"201\" class=\"d-label\">nein\u003C\u002Ftext>\u003Crect x=\"400\" y=\"184\" width=\"300\" height=\"46\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"550\" y=\"203\" text-anchor=\"middle\" class=\"d-text\">Reviewer oder Rahmenvertrag ergänzen\u003C\u002Ftext>\u003Ctext x=\"550\" y=\"220\" text-anchor=\"middle\" class=\"d-small\">Kein Single Point of Failure\u003C\u002Ftext>\u003Cpath d=\"M170 230 V247\" class=\"d-line\" \u002F>\u003Cpath d=\"M170 256 l-5 -9 h10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"180\" y=\"242\" class=\"d-label\">ja\u003C\u002Ftext>\u003Crect x=\"20\" y=\"256\" width=\"300\" height=\"46\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"170\" y=\"284\" text-anchor=\"middle\" class=\"d-text\">Ist der Nettogewinn über Break-even?\u003C\u002Ftext>\u003Cpath d=\"M320 279 H392\" class=\"d-line-accent\" \u002F>\u003Cpath d=\"M400 279 l-9 -5 v10 z\" class=\"d-head-accent\" \u002F>\u003Ctext x=\"332\" y=\"273\" class=\"d-label\">nein\u003C\u002Ftext>\u003Crect x=\"400\" y=\"256\" width=\"300\" height=\"46\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"550\" y=\"275\" text-anchor=\"middle\" class=\"d-text\">Team behalten oder Agentur beauftragen\u003C\u002Ftext>\u003Ctext x=\"550\" y=\"292\" text-anchor=\"middle\" class=\"d-small\">Gleicher Umfang und Maßstab\u003C\u002Ftext>\u003Cpath d=\"M170 302 V319\" class=\"d-line\" \u002F>\u003Cpath d=\"M170 328 l-5 -9 h10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"180\" y=\"314\" class=\"d-label\">ja\u003C\u002Ftext>\u003Crect x=\"20\" y=\"328\" width=\"300\" height=\"46\" rx=\"10\" class=\"d-mint\" \u002F>\u003Ctext x=\"170\" y=\"356\" text-anchor=\"middle\" class=\"d-text\">Übernehmen und quartalsweise messen\u003C\u002Ftext>",[466],"Beim ersten Nein anhalten. Ein unsicheres Setup ist nicht günstiger, egal wie hoch der gemessene Gewinn ist.",{"type":146,"level":147,"id":135,"text":136},{"type":275,"ordered":469,"items":470},true,[471,473,475,477,479,481],[472],"Halte die Ausgangsbasis fest. Drei Monate lang notierst du, wie viele Tage vereinbarter Arbeit diese Person liefert und wie lange ein Ticket bis zur Produktion braucht.",[474],"Starte einen zweiwöchigen Pilot an einem klar abgegrenzten Projekt mit Agenten. Miss den Gewinn vom Ticket bis zur Auslieferung gegen die Ausgangsbasis, nicht das gefühlte Tempo.",[476],"Füll das Kostenmodell mit echten Zahlen aus und vergleiche es mit einem schriftlichen Angebot einer Agentur für denselben Umfang.",[478],"Unterschreib den Auftragsverarbeitungsvertrag und bestätige Training, Aufbewahrung und Verarbeitungsstandort schriftlich, bevor Kundendaten in einen Prompt gelangen.",[480],"Benenne eine zweite Person, die Agentenarbeit prüft und ausliefert, und halte fest, was passiert, wenn der Senior nicht da ist.",[482],"Miss jedes Quartal neu. Tools ändern sich schneller als Studien, und die Folgestudie von METR zeigt, wie schwer sich die Zahl genau bestimmen lässt.",{"type":142,"content":484},[485],"Dafür braucht es keine Plattform. Es braucht eine Ausgangsbasis, einen gemessenen Gewinn und einen unterschriebenen Vertrag, in dieser Reihenfolge.",{"type":146,"level":147,"id":138,"text":139},{"type":275,"ordered":469,"items":488},[489,494,497,501,505,509,512,516,520,523,526,529,533,536,540,544],[490],{"tag":491,"href":36,"children":492},"a",[493],"METR: KI und erfahrene Open-Source-Entwickler, Anfang 2025",[495],{"tag":491,"href":39,"children":496},[38],[498],{"tag":491,"href":42,"children":499},[500],"METR: Design des Produktivitätsexperiments, Februar 2026",[502],{"tag":491,"href":45,"children":503},[504],"Peng et al.: kontrolliertes Experiment mit GitHub Copilot, arXiv 2302.06590",[506],{"tag":491,"href":48,"children":507},[508],"Cui et al.: drei Feldexperimente mit Softwareentwicklern",[510],{"tag":491,"href":51,"children":511},[50],[513],{"tag":491,"href":54,"children":514},[515],"Google Cloud: Highlights des DORA-Berichts 2024",[517],{"tag":491,"href":57,"children":518},[519],"Stack Overflow: Developer Survey 2025, KI",[521],{"tag":491,"href":60,"children":522},[59],[524],{"tag":491,"href":63,"children":525},[62],[527],{"tag":491,"href":66,"children":528},[65],[530],{"tag":491,"href":69,"children":531},[532],"DSGVO, Verordnung (EU) 2016\u002F679, Artikel 28",[534],{"tag":491,"href":72,"children":535},[71],[537],{"tag":491,"href":75,"children":538},[539],"Claude: Preise",[541],{"tag":491,"href":78,"children":542},[543],"Claude Platform: Datenstandort",[545],{"tag":491,"href":81,"children":546},[547],"GitHub Copilot: Pläne und Preise",[549,626,681,760],{"slug":550,"published":551,"minutes":6,"category":7,"tags":552,"keywords":558,"about":567,"sources":579,"cover":620,"og":621,"expertise":84,"locales":622,"lang":87,"title":623,"description":624,"coverAlt":625},"spec-driven-development-coding-agents","2026-09-30",[553,554,555,556,557],"Spec-driven development","Coding agents","Acceptance criteria","Plan mode","AI engineering",[559,560,561,562,563,564,565,566],"spec-driven development","spec driven development coding agents","acceptance criteria for coding agents","AI coding agent plan mode","GitHub Spec Kit","Kiro specs requirements design tasks","vibe coding vs spec-driven development","EARS requirements syntax",[568,571,573,576],{"name":569,"url":570},"Vibe coding","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FVibe_coding",{"name":563,"url":572},"https:\u002F\u002Fgithub.com\u002Fgithub\u002Fspec-kit",{"name":574,"url":575},"EARS (Easy Approach to Requirements Syntax)","https:\u002F\u002Falistairmavin.com\u002Fears\u002F",{"name":577,"url":578},"Kiro","https:\u002F\u002Fkiro.dev",[580,583,585,588,591,594,596,599,602,605,607,609,612,614,617],{"title":581,"url":582},"Birgitta Böckeler: Understanding Spec-Driven-Development: Kiro, spec-kit, and Tessl (martinfowler.com, 15 October 2025)","https:\u002F\u002Fmartinfowler.com\u002Farticles\u002Fexploring-gen-ai\u002Fsdd-3-tools.html",{"title":584,"url":572},"GitHub Spec Kit: README",{"title":586,"url":587},"GitHub Spec Kit: spec-driven.md methodology","https:\u002F\u002Fgithub.com\u002Fgithub\u002Fspec-kit\u002Fblob\u002Fmain\u002Fspec-driven.md",{"title":589,"url":590},"Kiro documentation: specs","https:\u002F\u002Fkiro.dev\u002Fdocs\u002Fspecs\u002F",{"title":592,"url":593},"Kiro: Introducing Kiro","https:\u002F\u002Fkiro.dev\u002Fblog\u002Fintroducing-kiro\u002F",{"title":595,"url":575},"Alistair Mavin: EARS, the Easy Approach to Requirements Syntax",{"title":597,"url":598},"Anthropic: Best practices for Claude Code","https:\u002F\u002Fcode.claude.com\u002Fdocs\u002Fen\u002Fbest-practices",{"title":600,"url":601},"Cline documentation: Plan and Act","https:\u002F\u002Fdocs.cline.bot\u002Ffeatures\u002Fplan-and-act",{"title":603,"url":604},"OpenAI: Codex slash command reference","https:\u002F\u002Flearn.chatgpt.com\u002Fdocs\u002Freference\u002Fslash-commands",{"title":606,"url":36},"METR: early-2025 AI and experienced open-source developer productivity (July 2025)",{"title":608,"url":42},"METR: We are changing our developer productivity experiment design (February 2026)",{"title":610,"url":611},"Thoughtworks Technology Radar: Spec-driven development","https:\u002F\u002Fwww.thoughtworks.com\u002Fradar\u002Ftechniques\u002Fspec-driven-development",{"title":613,"url":570},"Wikipedia: Vibe coding",{"title":615,"url":616},"Anthropic: Claude API pricing","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fabout-claude\u002Fpricing",{"title":618,"url":619},"Anthropic: Prompt caching","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fbuild-with-claude\u002Fprompt-caching","\u002Fimages\u002Fblog\u002Fspec-driven-development-coding-agents\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fspec-driven-development-coding-agents\u002Fog.jpg",[86,87,88],"Spec-driven Development für Coding-Agenten: den Plan vor dem Code festlegen","Vibe Coding scheitert an echten Codebasen. Schreib eine Spec mit Akzeptanzkriterien, Plan und Tasks, lass den Agenten abhaken und prüfe vor dem ersten Code.","Titelbild zu Spec-driven Development: eine Pipeline von Spec und Plan zu Tasks und Verifikation, mit einem Review-Gate vor jedem Code.",{"slug":627,"published":628,"minutes":629,"category":7,"tags":630,"keywords":636,"about":646,"sources":656,"cover":675,"og":676,"expertise":84,"locales":677,"lang":87,"title":678,"description":679,"coverAlt":680},"mcp-tool-design-lessons-jira-server","2026-09-18",10,[631,632,633,634,635],"MCP","Tool design","Context engineering","Jira","Agents",[637,638,639,640,641,642,643,644,645],"MCP tool design","MCP best practices","MCP tool descriptions","agent tool selection","MCP context bloat","how many tools should an MCP server have","MCP tool definition token cost","MCP error handling isError","Jira MCP server",[647,650,653],{"name":648,"url":649},"Model Context Protocol","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FModel_Context_Protocol",{"name":651,"url":652},"Jira (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FJira_(software)",{"name":654,"url":655},"Intelligent agent","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FIntelligent_agent",[657,660,663,666,669,672],{"title":658,"url":659},"Writing effective tools for agents – with agents (Anthropic)","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fwriting-tools-for-agents",{"title":661,"url":662},"Introducing advanced tool use on the Claude Developer Platform (Anthropic)","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fadvanced-tool-use",{"title":664,"url":665},"Code execution with MCP (Anthropic)","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fcode-execution-with-mcp",{"title":667,"url":668},"MCP vs CLI: context window cost (Blocks.ai)","https:\u002F\u002Fblocks.ai\u002Fblog\u002Fmcp-vs-cli-context-window-cost",{"title":670,"url":671},"Demystifying evals for AI agents (Anthropic)","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents",{"title":673,"url":674},"MCP 2026-07-28 specification: Tools","https:\u002F\u002Fmodelcontextprotocol.io\u002Fspecification\u002F2026-07-28\u002Fserver\u002Ftools","\u002Fimages\u002Fblog\u002Fmcp-tool-design-lessons-jira-server\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fmcp-tool-design-lessons-jira-server\u002Fog.jpg",[86,87,88],"MCP-Tool-Design: Lehren aus einem Jira-Server mit 20 Tools","MCP-Tool-Design für Agenten: Token-Kosten der Tool-Definitionen, wann man Tools zusammenlegt, Benennung, knappe Ausgaben und ein Auswahl-Eval.","Netzwerkdiagramm mit einem Jira-MCP-Server als Nabe und fünf Satelliten: Suche, Anlegen, Transition, Kommentare und Testläufe",{"slug":682,"published":683,"minutes":684,"category":7,"tags":685,"keywords":688,"about":699,"sources":705,"cover":754,"og":755,"expertise":84,"locales":756,"lang":87,"title":757,"description":758,"coverAlt":759},"ai-agent-memory-design","2026-09-10",13,[686,633,687,13],"AI agent memory","Memory poisoning",[689,690,691,692,693,694,695,696,697,698],"AI agent memory design","long-term memory for AI agents","episodic semantic procedural memory LLM","agent memory architecture","ChatGPT memory vs Claude memory","Claude memory tool","AI memory poisoning","LLM context compaction","AI agent memory GDPR","short-term vs long-term memory agents",[700,701,702],{"name":654,"url":655},{"name":25,"url":26},{"name":703,"url":704},"Prompt injection","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FPrompt_injection",[706,709,712,715,718,721,724,727,730,733,736,739,742,745,748,751],{"title":707,"url":708},"Anthropic docs: Memory tool","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fagents-and-tools\u002Ftool-use\u002Fmemory-tool",{"title":710,"url":711},"Anthropic docs: Context editing","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fbuild-with-claude\u002Fcontext-editing",{"title":713,"url":714},"Anthropic Engineering: Effective context engineering for AI agents","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-context-engineering-for-ai-agents",{"title":716,"url":717},"Sumers et al.: Cognitive Architectures for Language Agents (CoALA)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2309.02427",{"title":719,"url":720},"Packer et al.: MemGPT, Towards LLMs as Operating Systems","https:\u002F\u002Farxiv.org\u002Fabs\u002F2310.08560",{"title":722,"url":723},"Park et al.: Generative Agents, Interactive Simulacra of Human Behavior","https:\u002F\u002Farxiv.org\u002Fabs\u002F2304.03442",{"title":725,"url":726},"Unit 42: When AI Remembers Too Much, persistent behaviors in agents memory","https:\u002F\u002Funit42.paloaltonetworks.com\u002Findirect-prompt-injection-poisons-ai-longterm-memory\u002F",{"title":728,"url":729},"From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents (preprint)","https:\u002F\u002Farxiv.org\u002Fhtml\u002F2606.04329v1",{"title":731,"url":732},"The Hacker News: ChatGPT macOS flaw could have enabled long-term spyware via memory function","https:\u002F\u002Fthehackernews.com\u002F2024\u002F09\u002Fchatgpt-macos-flaw-couldve-enabled-long.html",{"title":734,"url":735},"Vectorize: OWASP ASI06, Memory and Context Poisoning explained","https:\u002F\u002Fvectorize.io\u002Farticles\u002Fowasp-asi06",{"title":737,"url":738},"Claude Help Center: Use chat search and memory to build on previous context","https:\u002F\u002Fsupport.claude.com\u002Fen\u002Farticles\u002F11817273-use-claude-s-chat-search-and-memory-to-build-on-previous-context",{"title":740,"url":741},"OpenAI Help Center: Memory in ChatGPT","https:\u002F\u002Fhelp.openai.com\u002Fen\u002Farticles\u002F8590148-memory-faq",{"title":743,"url":744},"OpenAI Help Center: Dots privacy, security, and safety FAQs","https:\u002F\u002Fhelp.openai.com\u002Fen\u002Farticles\u002F20001529-dots-privacy-security-and-safety-faqs",{"title":746,"url":747},"Flavio Copes: A deep dive into OpenAI dots (quotes the dots documentation on memory)","https:\u002F\u002Fflaviocopes.com\u002Fopenai-dots\u002F",{"title":749,"url":750},"GDPR Article 5: Principles relating to processing of personal data","https:\u002F\u002Fgdpr-info.eu\u002Fart-5-gdpr\u002F",{"title":752,"url":753},"GDPR Article 17: Right to erasure","https:\u002F\u002Fgdpr-info.eu\u002Fart-17-gdpr\u002F","\u002Fimages\u002Fblog\u002Fai-agent-memory-design\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fai-agent-memory-design\u002Fog.jpg",[86,87,88],"Memory für KI-Agenten entwerfen: Ebenen, Schreibregeln, Poisoning und DSGVO","So entwirfst du das Gedächtnis von KI-Agenten: Kontext, Session, Langzeit, was du speicherst und nie speicherst, Retrieval, Compaction, Poisoning, DSGVO.","Diagramm: verschachtelte Gedächtnisebenen eines KI-Agenten, vom Arbeitskontext über den Session-Zustand bis zum episodischen und semantischen Langzeitgedächtnis.",{"slug":761,"published":762,"minutes":763,"category":7,"tags":764,"keywords":769,"about":779,"sources":788,"cover":813,"og":814,"expertise":84,"locales":815,"lang":87,"title":816,"description":817,"coverAlt":818},"harness-engineering-coding-agents","2026-09-04",8,[765,554,766,767,768],"Harness engineering","Code quality","Mutation testing","TDD",[770,771,772,773,774,775,776,777,778],"harness engineering","harness engineering coding agents","AI code quality","coding agent guardrails","mutation testing AI generated tests","red\u002Fgreen TDD with AI agents","guides and sensors coding agents","how to make AI agent pull requests mergeable","can I trust tests written by AI",[780,782,785],{"name":767,"url":781},"https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FMutation_testing",{"name":783,"url":784},"Test-driven development","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FTest-driven_development",{"name":786,"url":787},"Static program analysis","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FStatic_program_analysis",[789,792,795,798,801,804,807,810],{"title":790,"url":791},"Birgitta Böckeler: Harness engineering for coding agent users (Apr 2026)","https:\u002F\u002Fmartinfowler.com\u002Farticles\u002Fharness-engineering.html",{"title":793,"url":794},"Birgitta Böckeler: Maintainability sensors for coding agents (May 2026)","https:\u002F\u002Fmartinfowler.com\u002Farticles\u002Fsensors-for-coding-agents.html",{"title":796,"url":797},"Simon Willison: Agentic Engineering Patterns","https:\u002F\u002Fsimonwillison.net\u002Fguides\u002Fagentic-engineering-patterns\u002F",{"title":799,"url":800},"Simon Willison: First run the tests","https:\u002F\u002Fsimonwillison.net\u002Fguides\u002Fagentic-engineering-patterns\u002Ffirst-run-the-tests\u002F",{"title":802,"url":803},"Anthropic: Effective harnesses for long-running agents (Nov 2025)","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-harnesses-for-long-running-agents",{"title":805,"url":806},"Claude Code docs: How Claude remembers your project","https:\u002F\u002Fcode.claude.com\u002Fdocs\u002Fen\u002Fmemory",{"title":808,"url":809},"Stryker Mutator documentation","https:\u002F\u002Fstryker-mutator.io\u002Fdocs\u002F",{"title":811,"url":812},"Infection: command line options","https:\u002F\u002Finfection.github.io\u002Fguide\u002Fcommand-line-options.html","\u002Fimages\u002Fblog\u002Fharness-engineering-coding-agents\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fharness-engineering-coding-agents\u002Fog.jpg",[86,87,88],"Harness Engineering: Guides und Sensors, die Agent-PRs mergebar machen","Harness Engineering für Coding-Agenten: Guides und Sensors, wo jede Prüfung laufen soll, Rot\u002FGrün-TDD und Mutationstests für die Tests des Agenten.","Konzentrische Ringe um das Modell eines Coding-Agenten: Verhalten, Architekturtauglichkeit und Wartbarkeit, von außen nach innen",1791636873405]