WikiSkill von Google Research ermöglicht es KI-Agenten, Aufzeichnungen über Fehlschläge und Erfolge zu behalten und so die Leistung bei wiederholten Aufgaben zu verbessern, ohne die zugrunde liegenden Modelle neu zu trainieren.

Google Research hat WikiSkill vorgestellt, ein Framework, das KI-Agenten dabei helfen soll, sich bei wiederholten Aufgaben zu verbessern, indem es festhält, was funktioniert hat und was nicht. Anstatt die Parameter eines Modells zu aktualisieren, zeichnet das System Ausführungserfahrungen in einer persistenten, wikiähnlichen Wissensbasis auf und verwandelt ausgewählte Erkenntnisse in wiederverwendbare Anweisungen.
Der Ansatz adressiert eine zentrale Schwäche heutiger KI-Agenten: Informationen, die während eines Laufs gesammelt werden, werden oft verworfen, wenn die Aufgabe endet. In der berichteten Forschung erzielte WikiSkill deutliche Verbesserungen in mehreren Benchmarks, auch wenn es sich dabei um eine Forschungsevaluierung und nicht um einen kommerziellen Produktstart oder eine unabhängig verifizierte Bereitstellung handelt.
WikiSkill organisiert den Arbeitsbereich eines Agenten in drei Schichten. Die Rohschicht behält vollständige Ausführungsprotokolle einschließlich Tool-Aufrufen und deren Ergebnisse. Laut der von The Decoder berichteten Forschungsbeschreibung sind diese Materialien unveränderlich und liefern die Belege für spätere Analysen.
Die Wiki-Schicht destilliert diese Protokolle zu strukturiertem Wissen. Sie kann wiederkehrende Fehlermuster, erfolgreiche Strategien und Lektionen aus früheren Versuchen festhalten. Anders als die aktiven Anweisungen, die der Agent verwendet, ist diese Schicht darauf ausgelegt, dauerhaft zu bestehen und sich mit der Zeit zu erweitern.
Die Fähigkeits-Schicht enthält die prozedurale Anleitung, die der Agent tatsächlich nutzt. Diese Anweisungen werden als „Agent Skills“ verpackt, sodass das System ändern kann, wie es an eine Aufgabe herangeht, ohne die Trainingsgewichte des Modells zu verändern. Fähigkeiten können zurückgesetzt werden, wenn ein Update die Leistung verringert, während das zugrunde liegende Wiki die Aufzeichnung dessen behält, was versucht wurde.
Der Workflow trennt das Sammeln von Erfahrungen von der Aktualisierung von Anweisungen. Ein Inferenz-Agent führt Aufgaben aus und erzeugt Protokolle. Ein „Wiki Maintainer“ analysiert diese Protokolle, während ein „Skill Proposer“ die gesammelten Informationen nutzt, um Änderungen vorzuschlagen. Ein Gatekeeping-Mechanismus bewertet den Vorschlag dann auf einem separaten Validierungsdatensatz. Wenn die vorgeschlagene Fähigkeit nicht hilft, wird sie abgelehnt, aber das fehlgeschlagene Experiment bleibt für zukünftige Vorschläge verfügbar.
Dieses Design ist eher mit persistenter externer Erinnerung und iterativer Prompt- oder Workflow-Optimierung vergleichbar als mit kontinuierlichem Lernen innerhalb eines Modells. The Decoder merkte an, dass das zugrunde liegende Modell nach der Bereitstellung nicht wirklich lernt; stattdessen schreibt das System bessere Anweisungen und ruft sie bei späteren Läufen ab.
Die Forschenden evaluierten WikiSkill in fünf Bereichen: mathematisches Schlussfolgern, Websuche, Tabellenkalkulationsbearbeitung, Fragebeantwortung zu Dokumenten und interaktive Aufgaben in einer virtuellen Umgebung. Zu den berichteten Modellen gehörten mehrere Qwen-Varianten, Gemma-4-31B und Gemini-3.5-Flash.
Laut den von The Decoder zitierten Studienergebnissen steigerte WikiSkill den durchschnittlichen Wert von Gemini-3.5-Flash von 49,5 % auf 68,1 %. Qwen-3.6-27B stieg im selben Vergleich von 39,4 % auf 63,3 %. Die berichteten Zugewinne waren bei einigen Einzelaufgaben größer: Gemini-3.5-Flash verbesserte sich bei LiveMath von 33,0 % auf 72,6 % und bei SpreadSheet von 50,5 % auf 76,6 %.
Dies sind Aussagen aus Forschungs-Benchmarks, kein Beleg dafür, dass WikiSkill in der Produktion dieselben Gewinne liefern wird. Die Auswertung wurde Berichten zufolge dreimal unabhängig durchgeführt, und das Framework wurde in der Studie mit anderen Methoden zur Fähigkeitsentwicklung verglichen. Das verfügbare Quellenmaterial liefert nicht genügend Details, um den vollständigen experimentellen Aufbau, die Betriebskosten oder die Leistung des Systems unter sich ändernden realen Daten zu beurteilen.
Auch die Leistung variierte je nach Aufgabe. Mathematik- und Tabellenkalkulationsaufgaben zeigten die stärksten Verbesserungen, während OfficeQA, das lange Dokumentkontexte umfasst, deutlich weniger profitierte. Die Forschenden führten schwächere Ergebnisse kleinerer Modelle teilweise darauf zurück, dass sie Schwierigkeiten haben, entwickelte, mehrstufige Suchstrategien über lange Kontexte hinweg auszuführen. In diesen Fällen fielen die Modelle manchmal auf ihr Standardverhalten zurück.
Die Ergebnisse legen nahe, dass persistenter Speicher die Fähigkeitsgrenzen eines Modells nicht aufhebt. Ein System kann zwar erfolgreich ein nützliches Verfahren dokumentieren, dieses aber dennoch nicht zuverlässig ausführen, insbesondere wenn das Verfahren viele Schritte, lange Kontextfenster oder mehrere Tool-Interaktionen umfasst.
Für KI-Entwickler weist WikiSkill auf eine praktische Alternative zum erneuten Trainieren hin, wenn ein Agent wiederholt auf dieselbe Art von Aufgabe stößt. Ein Coding-Assistent, Forschungsagent oder Tabellenkalkulations-Operator könnte validierte Verfahren speichern, erfolglose Tool-Aufrufe dokumentieren und seinen Workflow schrittweise verfeinern. Dadurch könnte die Notwendigkeit sinken, jede Lektion in einen immer größer werdenden System-Prompt aufzunehmen, sofern der Speicher strukturiert und selektiv abgerufen wird.
Die Trennung zwischen Wiki-Schicht und Fähigkeits-Schicht ist besonders relevant für produktive Systeme. Teams könnten einen vollständigen Prüfpfad bewahren und gleichzeitig nur validierte Anweisungen das Live-Verhalten beeinflussen lassen. Rücksetzungen würden Experimente weniger riskant machen als das direkte Bearbeiten eines Prompts oder einer Agentenrichtlinie, auch wenn die Qualität des Maintainers und des Gatekeeping-Prozesses weiterhin darüber entscheidet, ob schlechte Lehren in den aktiven Fähigkeitsbestand gelangen.
Das Framework könnte auch die Modellökonomie beeinflussen. Die Studie berichtet, dass kleinere Modelle mit WikiSkill in einigen Szenarien die Leistung größerer Modelle ohne das Framework erreichen können. Sollte dieses Muster außerhalb der getesteten Benchmarks Bestand haben, könnten Unternehmen dauerhafte Fähigkeiten nutzen, um Inferenzkosten zu senken oder größere Modelle für schwierige Fälle vorzuhalten. Diese Schlussfolgerung bleibt jedoch bedingt: Die Quelle weist die Gesamtkosten des Systems nicht aus, einschließlich Protokollspeicherung, Wartung, Validierungsläufen und zusätzlicher Modellaufrufe.
Übertragbarkeit ist ein weiterer möglicher Vorteil. Die berichtete Forschung fand heraus, dass von einem Modell entwickelte Fähigkeiten manchmal von einem anderen genutzt werden konnten und gelegentlich besser abschnitten als Fähigkeiten, die das empfangende Modell selbst erstellt hatte. Die Übertragung war jedoch nicht universell, sodass Organisationen Fähigkeiten gegen jedes Modell, jede Aufgabe und jede Tool-Umgebung testen müssten, anstatt anzunehmen, dass ein erfolgreiches Verfahren portierbar ist.
Für Enterprise-KI-Teams ist die wichtigste operative Frage die Governance. Ein dauerhafter Nachweis von Agentenfehlern kann die Zuverlässigkeit verbessern, aber er kann auch falsche Schlussfolgerungen, sensible Informationen oder veraltete Verfahren bewahren. Der berichtete Gatekeeping-Mechanismus adressiert Leistungsrückgänge, nicht unbedingt Datenschutz, Autorisierung oder Sicherheit. Jede produktive Implementierung müsste Kontrollen dafür enthalten, was in das Wiki aufgenommen wird, wer es einsehen darf und wann angesammeltes Wissen abläuft.
Das nächste Signal wird sein, ob Google Research ausführlichere technische Details, Code oder breitere Evaluierungen für WikiSkill veröffentlicht. Solche Materialien würden helfen, den Rechenaufwand, den Speicherbedarf, das Validierungsdesign und das Verhalten bei Verteilungsverschiebungen zu klären.
Entwickler sollten auch auf Ergebnisse bei länger laufenden Agenten und weniger strukturierten Unternehmens-Workflows achten. Die aktuelle Evidenz ist am stärksten für Mathematik- und Tabellenkalkulationsaufgaben und schwächer für dokumentenbasierte Langkontextarbeit. Tests in Kundenservice-Abläufen, Software-Repositories und Multi-User-Umgebungen würden zeigen, ob die Methode über Benchmark-Szenarien hinaus generalisiert.
Eine weitere Frage ist, ob dauerhafte Fähigkeiten nützlich bleiben, wenn sich Tools, Websites und Datenformate verändern. Ein aus einer Oberfläche erlernter Ablauf kann nach einem Anwendungsupdate schädlich werden. Kennzahlen für das Alter von Fähigkeiten, ihre Herkunft, die Häufigkeit von Rücksetzungen und die Erkennung veralteter Erinnerungen wären daher ebenso wichtig wie die reine Aufgabenpräzision.
WikiSkill ist weniger deshalb bemerkenswert, weil es kontinuierliches Lernen löst, sondern weil es einen disziplinierten Workaround für eine der sichtbarsten Grenzen von Agenten bietet. Das Framework behandelt Erfahrung als technischen Vermögenswert: Protokoll bewahren, Lektion zusammenfassen, Änderung vorschlagen und vor der Bereitstellung testen.
Dieses Muster ist vielversprechend für Teams, die KI-Agenten entwickeln, doch die berichteten Gewinne sollten als frühe Forschungsergebnisse gelesen werden. Die schwierige Arbeit in der Produktion wird darin bestehen, zu entscheiden, welchen Lektionen man vertrauen kann, wie viel Speicher beibehalten werden soll und wie verhindert werden kann, dass ein Agent immer besser darin wird, eine veraltete oder falsche Strategie zu wiederholen.