Vals, unterstützt von Andreessen Horowitz, hat 40 Millionen Dollar eingesammelt, um vertrauliches, auf Aufgaben basierendes KI-Benchmarking für Unternehmen und Bundesbehörden zu entwickeln, da ältere Tests s…

KI-Benchmarking-Startup Vals versucht, die Modellauswertung nach einer von Andreessen Horowitz angeführten Series-A-Finanzierungsrunde über 40 Millionen Dollar in eine praktischere und vertrauenswürdigere Ebene des KI-Marktes zu verwandeln. Das Unternehmen argumentiert, dass viele etablierte Tests nicht mehr ausreichen, um zunehmend leistungsfähigere Modelle zu bewerten, insbesondere wenn Unternehmen das Testmaterial im Voraus sehen können.
Vals bewertet KI-Systeme anhand komplexer, bereichsspezifischer Aufgaben und verlässt sich nicht nur auf öffentliche Prüfungen des allgemeinen Wissens. Der Ansatz soll Modellentwicklern helfen, Schwächen zu erkennen, Käufern den Vergleich von Systemen für tatsächliche Arbeit erleichtern und Regulierungsbehörden oder Investoren aussagekräftigere Belege zu Leistung und Risiko liefern.
Vals wurde 2024 gegründet, nachdem Mitgründer und CEO Rayan Krishnan beobachtet hatte, dass akademische Benchmarks mit den neuen Fähigkeiten der Modelle nicht Schritt hielten. In von TechCrunch berichteten Kommentaren sagte Krishnan, die Branche veröffentliche leistungsfähige Modelle schneller, als traditionelle Bewertungssysteme sie messen könnten.
Die Tests des Unternehmens sollen professionelle Arbeit in Bereichen wie Recht, Finanzwesen und Programmierung nachbilden. Statt nur zu fragen, ob ein Modell schwierige Fragen beantworten kann, prüft Vals nach eigenen Angaben, ob das System in einem bestimmten Fachgebiet Arbeit von mit menschlicher Leistung vergleichbarer Qualität erzeugen kann.
Ein bemerkenswertes Merkmal ist, dass Vals die in seinen Tests verwendeten konkreten Materialien nicht öffentlich offenlegt. Die Begründung des Unternehmens lautet, dass vollständig öffentliche Benchmarks zu Zielen für Optimierung oder Training werden können. Ein Modell kann auf einem Test scheinbar besser werden, ohne dass sich die Leistung bei breiteren, ungesehenen Aufgaben vergleichbar verbessert.
Vals sagt außerdem, dass seine Bewertungen nicht nur erfolgreiche Aufgabenerfüllung, sondern auch schädliche oder unerwünschte Ergebnisse berücksichtigen. Zu den genannten Interessensgebieten zählen Cybersicherheit, Biosicherheit, psychische Gesundheit, rekursive Selbstverbesserung und das Kriegsrecht. Die vorliegenden Informationen enthalten keine Details zur Methodik, zu Bewertungssystemen oder zu unabhängigen Validierungen für eines dieser Programme.
Auf die Series A folgte zuvor eine Seed-Runde unter Führung von 8VC und Bloomberg Beta. TechCrunch berichtete, dass die jüngste Finanzierung von Vals im Monat vor dem Artikel im September 2026 abgeschlossen wurde und das Unternehmen nun ein Team von 25 Personen hat, nach acht zu Jahresbeginn.
Diese Wachstumszahlen sowie die Behauptung des Unternehmens, der Umsatz sei achtmal höher als im Vorjahr, wurden über Krishnan berichtet und sollten als vom Unternehmen gemeldete Kennzahlen und nicht als unabhängig geprüfte Belege betrachtet werden. Das verfügbare Quellenmaterial nennt weder Vals’ Kunden noch den Gesamtumsatz, das Testvolumen oder die Anzahl der bewerteten Modelle.
Das Unternehmen verdient Geld, indem es KI-Entwicklern Gebühren für die Bewertung ihrer Modelle berechnet. Das schafft eine potenziell nützliche, aber heikle Beziehung: Die Partei, die den Test bezahlt, ist auch die Partei, deren System beurteilt wird. Vals stellt den Dienst als Entwicklungs- und Qualitätskontrollwerkzeug dar und vergleicht ihn mit der Bezahlung für eine standardisierte Prüfung, die zeigt, wo Verbesserungen nötig sind.
Das Unternehmen hat außerdem ein Programm gestartet, das sich auf die Bereitstellung von Modellbewertungen für Bundesbehörden konzentriert. Das Quellenmaterial nennt nicht, welche Behörden teilnehmen oder ob das Programm öffentliche Ergebnisse hervorgebracht hat.
Für KI-Entwickler hängt der Wert einer Bewertung davon ab, ob sie die Leistung außerhalb der Testumgebung vorhersagt. Ein öffentlicher Benchmark kann leicht zu kommunizieren sein, ist aber möglicherweise weniger nützlich, wenn Modelle auf seine Fragen hin optimiert wurden oder der Test abstraktes Wissen statt einen realen Arbeitsablauf misst.
Das auf Aufgaben basierende Modell von Vals könnte für Käufer von Enterprise-KI relevanter sein, die Systeme für Rechtsprüfung, Finanzanalyse, Softwareentwicklung oder andere operative Aufgaben auswählen. Für einen Käufer kann weniger die Position eines Modells auf einem allgemeinen Ranking wichtig sein als die Frage, ob es einen definierten Workflow korrekt, konsistent und mit akzeptablen Fehlerbildern ausführt.
Damit wird Bewertungsqualität zu einer Einsatzfrage und nicht nur zu einer Marketingfrage. Produktteams müssen wissen, wo ein Modell versagt, wie oft menschliches Eingreifen erforderlich ist und ob ein scheinbar starkes Ergebnis Sicherheits- oder Zuverlässigkeitsprobleme verbirgt. Vertrauliche Tests können Benchmark-Manipulation reduzieren, machen aber externe Prüfung auch schwieriger. Käufer benötigen genug methodische Transparenz, um zu verstehen, was ein Score bedeutet, ohne die Testantworten selbst zu erhalten.
Die wirtschaftliche Bedeutung könnte wachsen, wenn KI-Systeme tiefer in Geschäftsprozesse eingebettet werden. Wenn Modellbewertungen Beschaffung, öffentliche Einreichungen, Investitionsentscheidungen oder aufsichtsrechtliche Prüfungen beeinflussen, geraten die Organisationen, die diese Bewertungen erstellen, unter Druck, Unabhängigkeit, Wiederholbarkeit und Widerstandsfähigkeit gegen Interessenkonflikte nachzuweisen.
Die Argumentation für Vals stützt sich vor allem auf das von ihm identifizierte Problem und auf den vom Unternehmen beschriebenen Ansatz. TechCrunch berichtete Krishnans Darstellung eines Marktes, in dem ältere Benchmarks mit modernen Modellen nicht mehr Schritt halten, doch die Quelle liefert keine Vergleichsergebnisse, die zeigen, dass die Tests von Vals prädiktiver oder schwerer zu manipulieren sind als konkurrierende Systeme.
Es gibt auch keine unabhängigen Belege in der verfügbaren Berichterstattung dafür, dass Vals zum bevorzugten Evaluator der Branche geworden ist. Die Finanzierung durch Andreessen Horowitz und frühere Geldgeber ist ein Signal für das Vertrauen von Investoren, kein Beweis für Benchmark-Genauigkeit oder Marktdurchdringung. Ebenso deuten das berichtete Umsatzwachstum und die Ausweitung auf Bewertungen für Bundesbehörden zwar auf vom Unternehmen behauptete Dynamik hin, belegen aber keine breite Kundenakzeptanz.
Vals wird zudem mit Konkurrenz von Modellentwicklern, Forschungslabors, offenen Benchmark-Communities, spezialisierten Testfirmen und internen Evaluationsteams konfrontiert sein. Einige Organisationen bevorzugen möglicherweise transparente öffentliche Tests, während andere für private Bewertungen zahlen, die ihre eigenen Daten und Arbeitsabläufe widerspiegeln. Die Herausforderung des Unternehmens besteht darin zu zeigen, dass sein kontrollierter Prozess Erkenntnisse liefert, die Kunden weder durch interne Tests noch über bestehende Evaluationsplattformen erhalten können.
Die klarsten Signale werden öffentliche Belege dafür sein, wie Vals Modelle bewertet und ob diese Bewertungen mit der Leistung in der Produktion korrelieren. Käufer sollten auf offengelegte Methodik, Wiederholbarkeitsstudien, unter konsistenten Bedingungen durchgeführte Modellvergleiche und Beispiele achten, bei denen Bewertungen Deployment- oder Beschaffungsentscheidungen verändert haben.
Das Programm für Bundesbehörden ist ein weiterer wichtiger Test. Genannte Teilnehmer, veröffentlichte Ergebnisse oder formelle Beschaffungsbeziehungen würden stärkere Belege liefern als eine bloße Ankündigung. Die geplante Einstellung und Büroerweiterung des Unternehmens könnten auf anhaltende kommerzielle Aktivität hinweisen, doch Kundenbindung und wiederkehrendes Bewertungsvolumen werden wichtiger sein als die Mitarbeiterzahl.
Der Markt sollte auch beobachten, ob Vals Vertraulichkeit wahren kann, ohne zu einer Blackbox zu werden. Wenn seine Bewertungen Aussagen zu Sicherheit, Leistungsfähigkeit oder Investitionswert beeinflussen, werden unabhängige Aufsicht und klare Erklärungen der Bewertung zentrale Bestandteile seiner Glaubwürdigkeit sein.
Vals tritt zu einem günstigen Zeitpunkt in den Markt ein: KI-Unternehmen benötigen zunehmend Bewertungen, die die Arbeit widerspiegeln, die Menschen tatsächlich ausführen, während Käufer immer skeptischer gegenüber Leaderboard-Gewinnen werden, die sich nicht in verlässliche Implementierungen übersetzen lassen. Der Fokus auf verdeckte Tests und bereichsspezifische Aufgaben adressiert reale Schwächen des öffentlichen Benchmarkings.
Aber ein vertrauenswürdiger Standard erfordert mehr als Risikokapital und schnelles Wachstum. Vals muss zeigen, dass seine privaten Bewertungen rigoros, reproduzierbar und ausreichend transparent sind, damit Kunden und Außenstehende ihre Bedeutung einschätzen können. Die nächste Phase des Unternehmens wird weniger durch die Ambitionen seines Benchmark-Katalogs bestimmt als durch die Frage, ob seine Ergebnisse Entscheidungen darüber, welche KI-Modelle gebaut, gekauft und eingesetzt werden sollen, zuverlässig verbessern.