Tools/KI-Agenten
Aider im Test: Pair Programming im Terminal, git zuerst
Ein Test von Aider 0.86.2, ein Apache-2.0-Terminal-Pair-Programmierer mit ehrlichem Benchmark — und ohne Release seit acht Monaten.
- Art
- Coding agent
- Preis
- Free · BYO API key
Balázs Csorba··10 Min. Lesezeit
- Coding agent
- Terminal
- Git workflow
- BYO key
- Open source

Das Wichtigste in Kürze
- Aider 0.86.2 erschien am 12. Februar 2026 und ist die einzige Version seit August 2025; auf PyPI ist eine einzige Person als Maintainer eingetragen.
- Der Polyglot-Benchmark läuft 225 Exercism-Übungen und druckt neben dem Score die Kosten des vollständigen Laufs — mehr Transparenz, als die meisten Modell-Ranglisten zeigen.
- Die neuesten Benchmark-Einträge sind vom 3. Oktober 2025 datiert, die Rangliste kann die Modelle des Jahres 2026 also nicht bewerten.
- Jeder gelungene Edit wird zu einem git-Commit mit generierter Nachricht; das Review bleibt normal, die Historie bleibt laut, bis zusammengefasst wird.
- Der Kontext wird vom Entwickler statt vom Tool zusammengesetzt: Die Token-Kosten sind dadurch berechenbar, die Suche über Dateien hinweg bleibt Handarbeit.
Aider ist ein Apache-2.0-Terminal-Pair-Programmierer: Der Entwickler beschreibt die Änderung, Aider editiert die vorliegenden Dateien und committet das Ergebnis. Die Position hier ist, dass es nach wie vor der am besten konstruierte der kostenlosen Coding-CLIs für genau einen Auftrag ist — kontrollierbare, prüfbare Änderungen in einem bestehenden Repository — und dass sein Problem 2026 nicht die Qualität ist, sondern das Tempo: ein Release seit August 2025 und eine Benchmark-Seite, deren neueste Einträge ein Jahr alt sind.
Es konkurriert mit Claude Code, Cursor, Cline und den Editor-integrierten Assistenten, aber zu anderen Bedingungen. Diese Produkte wickeln ein Modell in einen Agenten, der Aufgaben plant und ausführt; Aider bietet ein Editierprotokoll. Der Entwickler behält die Modellwahl, den Editor und die Form der Historie — genau deshalb spricht es Teams mit bestehendem Review-Prozess an und genau deshalb enttäuscht es alle, die erwarten, dass das Tool die Arbeit allein zu Ende bringt.
Was es ist
Das Design ist schmal und bewusst. Aider läuft in einer Shell innerhalb eines git-Repositories, baut eine Karte der Codebasis, um zu entscheiden, was das Modell sehen muss, und wendet dessen Antwort als Datei-Edit an statt als Chat-Text. Das Gespräch ist die Eingabe, das Diff ist das Produkt.
- Lizenz Apache-2.0, veröffentlicht als
aider-chatauf PyPI, aktuelle Version 0.86.2 vom 12. Februar 2026, Python 3.10 bis 3.12. - Etwa 49.400 Stars, 5.000 Forks und 13.138 Commits auf GitHub, dazu rund 1.400 offene Issues und 517 offene Pull Requests.
- Der Provider wird pro Sitzung oder in der Konfigurationsdatei gewählt: OpenAI, Anthropic, Gemini, DeepSeek, xAI, Azure, Bedrock, Vertex, OpenRouter, GitHub Copilot, Ollama oder ein OpenAI-kompatibler Endpunkt.
- Die Repository-Karte entsteht aus tree-sitter-Parsing und reist mit jeder Anfrage mit, so sieht das Modell Definitionen, ohne dass der ganze Baum in den Chat wandert.
- Edits erfolgen im Edit-Format, für das das Modell gewählt wurde: ganze Datei, Diff, fenced Diff oder der Architect-Modus, der Planung und Editierung auf zwei Modelle verteilt.
- Jede gelungene Änderung wird zu einem git-Commit mit generierter Nachricht, und Lint- und Testbefehle können nach jedem Edit laufen, dessen Fehler zurück in den Chat gehen.
- Der Watch-Modus reagiert auf
AI!- undAI?-Kommentare in den Dateien, so lässt sich eine Änderung im Editor anstoßen, ohne das Fenster zu wechseln.
Aus dem Design folgen zwei Dinge. Review bleibt normales git: Die Einheit der KI-Arbeit ist ein Commit, also funktionieren revert, bisect und blame bei maschinell geschriebenem Code weiter. Und Aider hält keinen Zustand über das Repository hinaus — kein Cloud-Projekt, keinen serverseitigen Index, kein Konto — was die Einführung billig macht und das Kontextmanagement vollständig beim Entwickler lässt.
So funktioniert es
Jede Runde schickt drei Dinge an das Modell: die Chat-Historie, die Dateien der Sitzung und die Repository-Karte. Die Karte ist eine gerankte Gliederung der Definitionen im Repository, begrenzt auf ein Token-Budget, das die Startmeldung ausgibt; so arbeitet Aider in einer Codebasis, die größer als das Kontextfenster ist, ohne vorzutäuschen, sie komplett gelesen zu haben.
Die Schleife schließt mit den Prüfungen, denen der Entwickler ohnehin vertraut. Lint- und Testbefehle laufen nach jedem Edit, ein Exit-Code ungleich null kommt als zu behebender Fehler in den Chat, und der Commit folgt der Reparatur. Aider erzwingt nichts: Die eigene Fehlerseite hält fest, dass es nur Token-Limit-Fehler des Providers meldet und dass die angezeigten Token-Zahlen Schätzungen sind.
Erste Schritte
Die Installation sind zwei Befehle. Die Sitzung unten ist der komplette Arbeitsablauf: im Repository starten, das Modell benennen, die zu editierenden Dateien übergeben und die Lint- und Testbefehle anhängen, die ohnehin laufen würden. Schlüssel kommen aus der Umgebung oder aus dem api-key-Schalter.
python -m pip install aider-install
aider-install
cd your-repo
export ANTHROPIC_API_KEY=sk-ant-...
# name the files to edit; everything else stays out of the context
aider src/billing/invoice.py src/billing/tax.py \
--model sonnet \
--lint-cmd "ruff check" \
--test-cmd "pytest -q" --auto-testZwei Gewohnheiten trennen eine billige Sitzung von einer teuren. Nur Dateien hinzufügen, die wirklich editiert werden, denn hinzugefügte Dateien werden in jeder Runde erneut geschickt; und Modelle bevorzugen, die mit einem Diff antworten, statt Modelle, die ganze Dateien neu schreiben sollen, denn Ausgabe-Tokens sind es, woran eine große Änderung zuerst scheitert. Wenn eine Änderung mehr Dateien umfasst, als ein Prompt tragen sollte, arbeitet der Architect-Modus mit einem Planungs- und einem Editiermodell.
Was es tatsächlich kostet
Das Tool ist kostenlos, die gesamte Rechnung landet auf dem API-Konto, und die Modellwahl wird zum einzigen Kostenhebel. Der eigene Benchmark druckt die Kosten eines vollständigen Laufs neben den Score und ist damit die am wenigsten hypothetische Kostenlage, die es für diese Art von Arbeit gibt:
- Ein vollständiger Lauf über 225 Übungen mit gpt-5 bei hoher Reasoning-Stufe kostete 29,08 $ und bestand 88,0 %.
- Derselbe Lauf mit Gemini 2.5 Pro und 32.000 Thinking-Tokens kostete 49,88 $ bei 83,1 %.
- DeepSeek-V3.2 erreichte im Reasoner-Modus 74,2 % für 1,30 $ und im Chat-Modus 70,2 % für 0,88 $.
- claude-3-7-sonnet ohne Thinking bestand 60,4 % für 17,72 $ — eine gute Illustration, dass mehr Ausgeben nicht dasselbe wie besseres Editieren ist.
- Aiders Startseite meldet rund 15 Milliarden Token pro Woche durch ihre Nutzer; die Zahl ist selbst berichtet, sie zeigt aber die Größenordnung.
Ein Arbeitstag liegt weit unter diesen Zahlen, weil ein Benchmark 225 Übungen von Anfang bis Ende wiederholt, aber die Form bleibt: Jede Runde zahlt die Repository-Karte plus die Dateien der Sitzung, unabhängig davon, ob der Provider das Präfix cached. Sitzungshygiene ist das Budget.
Der Benchmark hinter der Empfehlung
Die veröffentlichte Rangliste ist in diesem Feld ungewöhnlich, weil sie das Modell misst und nicht das Tool: 225 Exercism-Übungen in C++, Go, Java, JavaScript, Python und Rust, Ende-zu-Ende gelöst, mit zwei Bestehensquoten, dem Anteil wohlgeformter Edit-Format-Antworten und den Kosten des Laufs. Die Methodik ist bis zum Commit-Hash dokumentiert, und deshalb tragen die Modell-Empfehlungen des Projekts Gewicht.
| Modell | Bestehensquote | Kosten des Laufs | Edit-Format |
|---|---|---|---|
| gpt-5 mit hohem Reasoning | 88,0 % | 29,08 $ | diff |
| Gemini 2.5 Pro, 32k Thinking | 83,1 % | 49,88 $ | diff-fenced |
| o3 high mit gpt-4.1 als Editor | 78,2 % | 17,55 $ | architect |
| DeepSeek-V3.2 Reasoner | 74,2 % | 1,30 $ | diff |
| claude-3-7-sonnet, ohne Thinking | 60,4 % | 17,72 $ | diff |
Der Vorbehalt ist die Frische. Die neuesten Einträge dieser Seite sind vom 3. Oktober 2025 datiert, wer im Oktober 2026 liest, sieht also eine Jahr alte Rangliste von Modellen, die inzwischen ersetzt wurden. Die Methode bleibt wertvoll, die Tabelle nicht, und wer sich ein Modell daraus wählt, stöbert im Regal des letzten Jahres.
Wo es schwächelt
Die Schwächen sind strukturell. Der Kontext wird von Hand zusammengesetzt: Die Repository-Karte zeigt Definitionen, aber eine Änderung, die ein fremdes Subsystem kreuzt, hängt weiter davon ab, dass der Entwickler weiß, was hinzuzufügen ist, und nichts im Tool plant Arbeit über Dateien hinweg. Der Funktionsumfang endet beim Editieren — das Dokumentationsverzeichnis kennt Linting, Tests, Spracheingabe, Bilder und Watch-Modus, aber keine Seite für MCP-Server, Plugins oder ein Skill-System; alles jenseits von Datei-Editen wird vom Entwickler verdrahtet. Dann das Tempo: PyPI nennt für das Paket eine einzige Person als Maintainer, das vorherige Release brauchte sechs Monate, und rund 1.400 Issues und 517 Pull Requests sind offen.
| Tool | Wo es läuft | Modellwahl | Was es kostet |
|---|---|---|---|
| Aider | Terminal, jeder Editor | Jeder Provider oder lokales Modell | Kostenlos, nur API-Verbrauch |
| Claude Code | Terminal | Claude-Modelle | API-Verbrauch oder Abo |
| Cursor | Eigener Editor | Modelle des Anbieters | Abo |
| Cline | VS-Code-Erweiterung | Die meisten Provider, eigener Schlüssel | Kostenlos, nur API-Verbrauch |
Diese Tabelle ist eine Aussage über Kontrolle, nicht über Leistung. Claude Code und Cursor erledigen mehr einer Aufgabe unaufgefordert, und der Preis ist eine engere Modellmenge und im Fall von Cursor ein Editor, der dem Anbieter gehört. Aiders Angebot ist das Spiegelbild — maximale Kontrolle über die Schleife, minimales Produkt darum herum — und genau ein Team, das ohnehin jeden Diff reviewt, will es haben.
Fazit
Aider ist der richtige Terminal-Agent für Entwickler, die ein Editierprotokoll statt eines autonomen Kollegen wollen, und der falsche für alle, die erwarten, dass ein Tool eine Aufgabe vom Ticket bis zum gemergten Pull Request trägt. Seine Konstruktion — Edit-Formate, Repository-Karte, Benchmark, git-Disziplin — liegt weiterhin vor dem Großteil des Feldes. Das Risiko liegt im Projektdynamik, und die Lizenz mildert es nicht.
- Wähle es, wenn jede Änderung ein prüfbarer Commit sein muss und KI-Edits im Log exakt wie menschliche Änderungen aussehen sollen.
- Wähle es, wenn die Modellwahl Pflicht ist: regulierte Daten, ein bestehendes Unternehmensabkommen oder ein lokales Modell hinter Ollama.
- Wähle es, wenn der Entwickler entscheiden will, was in den Kontext gehört, weil diese Verantwortung nie ins Tool wandert.
- Wähle es nicht, wenn die Aufgabe einen Agenten braucht, der mehrstufige Arbeit plant, einen Browser steuert oder sich über Plugins und MCP erweitert.
- Wähle kein Modell aus der veröffentlichten Rangliste, ohne es neu zu messen; die neuesten Einträge stammen aus dem Oktober 2025.
Ein weiterer Punkt ist Umkehrbarkeit. Nichts im Arbeitsablauf ist proprietär — Dateien, Prompts, Konfiguration und Historie liegen alle im Repository —, die Einführung des Tools lässt sich also ohne Reste rückgängig machen. Das ist ein stärkeres Argument als jeder Benchmark, und es gilt nicht für einen Agenten, der in einem Editor lebt. Wer Aider in eine größere Hülle einbettet, findet die umliegenden Muster in den Notizen zur Harness-Engineering für Coding-Agenten.
Aider never enforces token limits, it only reports token limit errors from the API provider. The token counts that aider reports are estimates.
Quellen
Häufige Fragen
Ist Aider kostenlos?
Das Tool selbst ist kostenlos: Apache-2.0, kein Konto, keine Lizenz, keine Funktionsgrenze. Man bringt einen API-Schlüssel mit und zahlt den Anbieter. Die eigene Kosten-Spalte des Benchmarks nennt 0,88 $ für einen vollständigen Lauf über 225 Übungen mit DeepSeek chat und 29,08 $ mit gpt-5 bei hohem Reasoning — die konkreteste Preisangabe, die es für diese Art von Arbeit gibt.
Aider oder Claude Code?
Aider gewinnt, wenn Modellwahl, ein bestehender Editor und ein Commit pro Änderung Voraussetzungen sind; es verzichtet auf Aufgabenplanung, Plugins und MCP. Claude Code erledigt mehr einer Aufgabe unaufgefordert und kostet entweder API-Tokens oder ein Abo, das Modellmenge ist enger. Teams, die ohnehin jeden Diff reviewen, tendieren zum ersten, Teams, die das Tool die ganze Aufgabe tragen lassen wollen, zum zweiten.
Wie entscheidet Aider, was das Modell sieht?
In jede Runde gehen drei Eingaben: die Chat-Historie, die Dateien der Sitzung und eine Repository-Karte aus tree-sitter-Parsing der Codebasis. Die Karte wird auf ein Token-Budget begrenzt, das die Startmeldung ausgibt. Weil hinzugefügte Dateien jedes Mal mitgeschickt werden, sind die praktischen Regeln /tokens, /drop und /clear.
Läuft Aider mit lokalen Modellen?
Ja, über Ollama, LM Studio oder jeden OpenAI-kompatiblen Endpunkt, und lokale Modelle sind der einzige Weg, ihn ohne API-Kosten zu betreiben. Der Preis ist Edit-Qualität: schwächere Modelle liefern häufiger fehlerhafte Edits, und Aider kennt die Edit-Formate ganze Datei, Diff und fenced Diff, damit ein schwächeres Modell die leichtere Aufgabe bekommt. Die Rangliste des Projekts zeigt große Qualitätsunterschiede zwischen Modellklassen bei denselben Übungen.