Warum ein ehemaliger AlphaGo-Forscher sagt, dass heutige LLMs noch immer nicht schlussfolgern

Der ehemalige AlphaGo-Forscher Thore Graepel argumentiert, dass LLMs überprüfbare Glaubenszustände und Suchverfahren benötigen, nicht einfach längere Gedankengänge.

AI News

Large Language Models sind besser darin geworden, schrittweise Antworten zu erzeugen. Doch diese scheinbare Überlegung entspricht nicht zwangsläufig echtem Schlussfolgern, so Thore Graepel, ein ehemaliger Forscher von Google DeepMind und zentrales Mitglied des AlphaGo-Teams.

In einer vom MIT Technology Review veröffentlichten Analyse argumentiert Graepel, dass aktuelle LLMs grundlegend weiterhin Systeme zur Vorhersage des nächsten Tokens sind. Vertrauenswürdige maschinelle Intelligenz werde eine separate Schlussfolgerungsarchitektur benötigen, die Überzeugungen aufzeichnet, mögliche Erklärungen prüft, ihre Schlussfolgerungen anhand von Belegen aktualisiert und ihren Entscheidungsprozess überprüfbar macht.

Das Argument ist relevant, da Entwickler und Unternehmenskunden von KI Modelle zunehmend für Programmierung, Forschung, Diagnose, Planung und andere Aufgaben einsetzen, bei denen eine plausible Antwort nicht ausreicht. Graepels Vorschlag ist weder eine Produktankündigung noch ein neues Benchmark-Ergebnis. Es handelt sich um eine technische Kritik eines prominenten Forschers, der Google DeepMind kürzlich verlassen hat und eine andere Richtung für die KI-Entwicklung fordert.

Das Argument hinter der Schlagzeile

Graepels zentrale Unterscheidung besteht zwischen flüssiger Mustervervollständigung und deliberativem Schlussfolgern. Ein LLM erzeugt ein Token nach dem anderen auf Grundlage statistischer Beziehungen, die es aus Daten gelernt hat. Dieser Prozess kann nützliche Erklärungen, mathematische Lösungen und Code hervorbringen, doch der zugrunde liegende Mechanismus bleibt derselbe, selbst wenn das Modell Zwischenschritte erzeugt.

Diese Zwischenschritte werden üblicherweise als Gedankengang bezeichnet. Graepel räumt ein, dass ein Gedankengang die Leistung verbessern kann, insbesondere in Mathematik und Programmierung. Sein Einwand lautet, dass die Erzeugung von mehr Text kein unabhängiges Schlussfolgerungssystem schafft. Das Modell verlängert weiterhin eine Sequenz durch die Vorhersage des nächsten Tokens, anstatt eine explizite Menge von Aussagen oder Hypothesen zu bearbeiten.

Er nennt drei Schwachstellen. Aktuellen Modellen fehlt im Allgemeinen ein dauerhaftes und überprüfbares Protokoll darüber, was sie glauben, wie sicher sie sind, welche Belege jede Behauptung stützen und welche Fragen ungelöst bleiben. Außerdem verbinden sie gespeichertes Wissen mit den Operationen, mit denen dieses Wissen bearbeitet wird, innerhalb der Gewichte des neuronalen Netzes, statt Wissen und Schlussfolgern sauber zu trennen. Schließlich geben ihre schriftlichen Erklärungen möglicherweise nicht getreu wieder, wie eine Antwort entstanden ist.

Das letzte Problem ist für Systeme mit hohen Risiken besonders folgenreich. Wenn eine KI in der Medizin, im Ingenieurwesen oder in der wissenschaftlichen Forschung einen Fehler macht, müssen Nutzer feststellen können, ob das Versagen auf schlechte Belege, eine ungültige Annahme oder eine fehlerhafte Schlussfolgerung zurückgeht. Eine überzeugende Erklärung, die nach der Antwort erzeugt wurde, liefert diese diagnostischen Informationen möglicherweise nicht.

Was AlphaGo anders machte

Graepel nutzt AlphaGo, um die Art von Architektur zu veranschaulichen, die moderne KI seiner Ansicht nach benötigt. Während seines Spiels gegen den südkoreanischen Meister Lee Sedol im Jahr 2016 spielte AlphaGo einen ungewöhnlichen Zug, der als Zug 37 bekannt wurde. Der Zug wirkte zunächst wie ein Fehler, doch AlphaGo gewann schließlich das Spiel und das Match mit 4:1.

Der entscheidende Punkt, so Graepel, ist, dass der Zug nicht allein aus Intuition entstand. AlphaGo kombinierte ein neuronales Policy-Netzwerk, das vielversprechende Züge einschätzte, mit einem Suchsystem, das mögliche Fortsetzungen untersuchte. Die Suche erstellte einen Spielbaum mit alternativen Positionen und zukünftigen Zügen und bewertete diese Zweige, bevor sie eine Aktion auswählte.

In diesem Design lieferten neuronale Netze schnelle Einschätzungen, während die Suche eine strukturierte Überlegung ermöglichte. Graepel vergleicht diese Anordnung mit der verhaltensbezogenen Unterscheidung zwischen schnellem, intuitivem Denken und langsamerem, analytischem Denken. Die beiden Komponenten unterstützten sich gegenseitig: Die Intuition schränkte die Möglichkeiten ein, während die Suche diese Möglichkeiten anhand künftiger Folgen prüfte.

Der Vergleich hat Grenzen. Go bietet ein definiertes Brett, eine feste Menge legaler Aktionen und Regeln, die das Ergebnis jedes Zugs bestimmen. Offene Probleme in Wissenschaft oder Wirtschaft bieten diese Bedingungen nicht. Der Zustand der Welt ist unvollständig, verfügbare Aktionen variieren und Folgen können unsicher sein.

Dennoch, so Graepel, bietet die Architektur eine nützliche Vorlage. Ein allgemeines Schlussfolgerungssystem könnte einen „epistemischen Zustand“ aufrechterhalten – ein strukturiertes Protokoll gesicherter Behauptungen, Zweifel, verworfener Erklärungen, offener Fragen und unterstützender Belege. Jeder Schlussfolgerungsschritt würde diesen Zustand aktualisieren, statt lediglich weiteren erzeugten Text anzuhängen.

Belege und Behauptungen

Die stärksten Aussagen in dieser Geschichte stammen aus Graepels Analyse im MIT Technology Review, nicht aus einem neu berichteten Experiment oder einer unabhängigen Produktbewertung. Der Artikel liefert historische und architektonische Details zu AlphaGo, präsentiert jedoch kein neues Benchmark, das aktuelle LLMs mit einem vorgeschlagenen System epistemischer Zustände vergleicht.

Graepel verweist außerdem auf Forschungsergebnisse, denen zufolge Sprachmodelle Erklärungen erzeugen können, die die Prozesse, die zu ihren Antworten geführt haben, nicht zuverlässig widerspiegeln. Der vorliegende Artikel nennt keine spezifischen Studien, Datensätze oder Modellergebnisse in ausreichender Detailtiefe, um das Ausmaß oder die Allgemeingültigkeit dieses Effekts hier zu beurteilen.

Diese Unterscheidung ist wichtig. Die Kritik bedeutet nicht, dass aktuelle Modelle nutzlos oder unfähig wären, mehrstufige Probleme zu lösen. Sie bedeutet, dass die Leistung bei einer Aufgabe nicht automatisch als Beweis dafür gelten sollte, dass ein Modell im selben Sinne schlussfolgert wie ein System, das Alternativen, Belege und Änderungen von Überzeugungen explizit verfolgt.

Der Artikel stellt außerdem Graepels eigene Entwicklungsrichtung vor. Er schlägt vor, LLMs zu verwenden, um Strategien vorzuschlagen, über APIs oder Code mit Werkzeugen zu interagieren und zu beurteilen, ob Behauptungen durch Belege gestützt werden. Ein unabhängiger Prüfer würde dann bewerten, ob jeder Schritt die Unsicherheit tatsächlich verringert, bevor das System sein Wissen aktualisieren darf.

Worauf als Nächstes zu achten ist

Für KI-Entwickler wird das praktische Signal darin bestehen, ob neue Systeme über längere Prompts und längere erzeugte Denkprotokolle hinausgehen. Entwickler sollten auf Architekturen achten, die überprüfbare Zwischenzustände aufrechterhalten, faktisches Gedächtnis von Schlussfolgerungsverfahren trennen und protokollieren, wie Belege eine Schlussfolgerung verändern.

Auch der Einsatz von Werkzeugen wird ein wichtiges Feld sein. Ein System, das Code ausführen, Datenbanken abfragen, Dokumente abrufen oder ein Experiment entwerfen kann, könnte zuverlässiger werden, wenn diese Aktionen mit expliziten Tests verbunden sind, statt als bloße Verzierung einer Sprachmodellantwort zu dienen. Die entscheidende Frage lautet nicht einfach, ob ein Agent ein Werkzeug aufruft, sondern ob das Ergebnis einen strukturierten Glaubenszustand auf nachvollziehbare Weise verändert.

Unternehmenskunden sollten Anbieter außerdem fragen, wie sie Modellentscheidungen prüfen, Fehler reproduzieren und abgerufene Belege von generierten Behauptungen unterscheiden. Bestehende Schnittstellen für Gedankengänge können eine Antwort stärker durchdacht erscheinen lassen, ohne den zugrunde liegenden Prozess überprüfbarer zu machen.

Forscher müssen unterdessen zeigen, ob von AlphaGo inspirierte Architekturen offene Aufgaben bewältigen können, ohne zu teuer oder zu langsam zu werden. Die Pflege und Bewertung vieler Hypothesen kann die Zuverlässigkeit verbessern, aber auch Rechenaufwand, Latenz, technische Komplexität und den Aufwand für die Validierung jeder Aktualisierung erhöhen.

Die Perspektive von Creati.ai

Graepels Intervention ist am besten als Herausforderung an die Art zu verstehen, wie die KI-Branche Fortschritt bezeichnet. Bessere Ergebnisse bei Reasoning-Benchmarks und ausführlichere Erklärungen sind wertvoll, beweisen aber für sich genommen nicht, dass ein Modell über einen überprüfbaren Schlussfolgerungsprozess verfügt.

Die schwierigere Prüfung ist praktischer Natur: Kann ein System Unsicherheit bewahren, die Belege hinter einer Schlussfolgerung offenlegen, seine Überzeugungen bei neuen Informationen überarbeiten und zeigen, wo ein Fehler aufgetreten ist? Wenn KI wissenschaftliche Entdeckungen, die Medizin und andere Arbeitsabläufe mit weitreichenden Folgen unterstützen soll, könnten diese Fähigkeiten ebenso wichtig sein wie die reine Modellgröße. Die nächste Generation von KI-Systemen wird nicht nur nach den Antworten beurteilt werden, die sie erzeugt, sondern auch danach, ob Nutzer den Weg zu diesen Antworten prüfen und ihm vertrauen können.

Anzeigen