Startseite › KI, die PRs aus Fehlern entwirft
Leitfaden · Autonome Entwicklung
KI, die Pull-Requests aus Ihren Fehlerberichten entwirft
Der Workflow, für den Sie tatsächlich bezahlen.
Manuelle Fehlersichtung im Jahr 2026 sieht so aus:
- Sentry-Alarm wird ausgelöst.
- Jemand erhält die Benachrichtigung (wartet bis zum Morgen, wenn außerhalb der Geschäftszeiten).
- Ingenieur öffnet Sentry, liest den Stack-Trace, öffnet die Codebasis.
- Liest den umgebenden Code, um zu verstehen, was passiert.
- Wenn der Fix offensichtlich ist, schreibt er ihn.
- Wenn nicht, öffnet er Slack, um herauszufinden, wer diese Datei zuletzt bearbeitet hat.
- Öffnet einen PR mit Kontext.
- Zusammenführen.
Best Case: 30 Minuten pro Fehler. Realistischer Fall für einen Portfolio-Betreiber: 2 Stunden pro Fehler, da "öffnet die Codebasis" das Laden von Kontext zu einem Produkt beinhaltet, das Sie seit Wochen nicht mehr angesehen haben.
Für 15 Produkte mit Dutzenden von Fehlern pro Tag ist dies eine Vollzeitstelle. Oder es ist ein Backlog, der jede Woche wächst.
Was ein KI-Mitarbeiter stattdessen tut.
- Sentry-Alarm wird ausgelöst.
- Der KI-Mitarbeiter liest den Alarm, den Stack-Trace, den umgebenden Code, git blame, aktuelle Commits und den Slack-Kontext.
- Bestimmt: echter Fehler oder Rauschen? (Filtert fehlerhafte Tests, Drittanbieter-API-Störungen, bekannte Duplikate.)
- Wenn es ein echter Fehler ist: entwirft den Fix, öffnet einen PR für den richtigen Branch, fügt Kontext zur PR-Beschreibung hinzu, taggt den Reviewer.
- Ingenieur prüft (normalerweise 5 bis 20 Zeilen), genehmigt oder bearbeitet.
- Zusammenführen.
Zeitersparnis: 90 % für einfache Korrekturen, 60 % für komplexe Korrekturen.
Auf Portfolio-Ebene ist dies der Unterschied zwischen „wir haben eine dedizierte Fehler-Triage“ und „wir liefern die Korrekturen, sobald sie eintreffen.“ Siehe autonome Operationen für das breitere Muster.
Worauf bei einer KI zu achten ist, die PRs entwirft.
- 1. Liest den tatsächlichen Code, nicht nur den Fehler. Produkte, die nur die Fehlermeldung sehen, produzieren halluzinierte Korrekturen.
- 2. Liest den Git-Verlauf. Wer hat diese Datei zuletzt bearbeitet? Produkte ohne Git-Kenntnis führen bereits behobene Fehler erneut ein.
- 3. Verwendet die PR-Muster Ihres Teams. Deskriptive Commit-Nachrichten, Tests wo erforderlich.
- 4. Filtert Rauschen. Nicht jeder Alarm ist ein echter Fehler.
- 5. Portfolio-bewusst, nicht Repo-bewusst. Für ein einzelnes Produkt funktioniert jede Coding-KI (Cursor, Claude Code, Codex). Für ein Portfolio von mehr als 5 Produkten muss die KI verstehen, welches Produkt, welches Repo, welches Team.
- 6. Geht elegant mit falsch-positiven PRs um. Das Schließen falscher PRs sollte ein Klick sein.
Produkte, die dies 2026 tun.
Qualia
KI-Mitarbeiter auf Portfolio-Ebene. Liest Sentry über alle Ihre Produkte hinweg und entwirft PRs für die richtigen Repos. Entwickelt für Teams von 2 bis 10 Personen, die 3 bis 20 Produkte betreiben.
Viktor
Teil seiner Rolle als „Ingenieur“-KI-Mitarbeiter. Am stärksten für Teams, die einen benannten KI-Ingenieur pro Team wünschen. Nicht Portfolio-umfassend. Siehe Qualia vs Viktor.
Cursor / Claude Code plus benutzerdefinierte Automatisierung
DIY-Einrichtung. Funktioniert, wenn Sie über die Engineering-Zeit verfügen, um es zu entwickeln.
Sentry AI Autofix
Sentrys eigene Beta. Beschränkt auf Sentry, an die Roadmap dieses Produkts gebunden.
GitHub Copilot Workspace
Gut für vorgeschlagene Korrekturen; erfordert menschliche Initiierung. Nicht autonom.
Devin / Cognition
Allgemeiner autonomer Coding-Agent. Für die meisten PR-Entwurfsworkflows überdimensioniert.
So bewerten Sie, bevor Sie sich festlegen.
- Schritt 1. Wählen Sie 10 echte Sentry-Fehler aus den letzten 30 Tagen aus. Mischen Sie einfache und komplexe.
- Schritt 2. Füttern Sie jeden dem AI-Mitarbeiter. Bitten Sie ihn, einen PR zu entwerfen.
- Schritt 3. Bewerten Sie jeden PR: Korrektheit, Vollständigkeit, Konvention, Kontext.
- Schritt 4. Vergleichen Sie Produkte. Ein Produkt, das 8 von 10 richtig macht und die anderen 2 elegant handhabt, ist besser als eines, das 10 von 10 bei einfachen Fehlern richtig macht, aber bei komplexen halluziniert.
Häufige Fehler.
- Bereitstellung ohne Überprüfungs-Gate. Lassen Sie niemals von KI entworfene PRs automatisch zusammenführen.
- Die KI nicht mit der Git-Historie verbinden. Eine KI, die nur den Fehler sieht, führt bereits behobene Fehler erneut ein.
- Zu aggressives Filtern. „Nur echte Fehler“ übersieht Randfälle. „Alles“ ist Rauschen. Iterieren Sie 2 Wochen lang.
- Annahme des Portfolio-Umfangs von einem Repo-Umfang-Produkt. Tools für Einzel-Repos (Cursor, Copilot) können nicht nativ "welches Produkt, welches Repo" verwalten.
Häufig gestellte Fragen.
Schreibt die KI tatsächlich gute Korrekturen?
Für einfache Korrekturen (Null-Checks, Typumwandlung, fehlende Imports) ja. Bei komplexen Korrekturen sollte die KI Unsicherheit signalisieren, anstatt selbstbewusst falsche Korrekturen zu produzieren.
Kann ich dies zusammen mit Cursor oder Claude Code verwenden?
Ja. Die meisten Portfolio-Betreiber nutzen Cursor für interaktives Coding und einen KI-Mitarbeiter für die autonome Triage.
Was, wenn die KI zu viele PRs öffnet?
Konfigurieren Sie den Filter so, dass er nur oberhalb eines Schwellenwerts auslöst. Iterieren Sie wöchentlich.
Ersetzt dies Ingenieure?
Nein. Es ersetzt die Zeit, die Ingenieure für die Triage aufwenden.
Wie viel kostet das?
Portfolio-basierte Produkte beinhalten dies als eine Funktion. Dedizierte Bugfixing-Produkte berechnen pro Korrektur oder pro Repo.
Was, wenn ich nur ein Produkt habe?
Ein Tool für ein einzelnes Repo könnte ausreichen. Der Portfolio-Umfang ist ab 3+ Produkten relevant.
Wie lange dauert es, bis es nützlich ist?
Tage für die ersten PRs. Wochen für die Filterkalibrierung. Monate, bis die Feedbackschleife es durchgängig besser macht als ein Ingenieur mittleren Niveaus bei der Triage.