Vals, AI 벤치마킹을 조작에 더 강하게 만들기 위해 4,000만 달러 조달

Andreessen Horowitz의 지원을 받는 Vals가 기업과 연방 기관을 위한 비공개·과제 기반 AI 벤치마킹을 구축하기 위해 4,000만 달러를 조달했다. 기존 테스트는 이미…

AI News

AI 벤치마킹 스타트업 Vals는 Andreessen Horowitz가 주도한 4,000만 달러 규모의 시리즈 A를 유치한 뒤, 모델 평가를 AI 시장의 더 실용적이고 신뢰할 수 있는 계층으로 바꾸려 하고 있다. 회사는 기업이 시험 자료를 미리 볼 수 있는 상황에서는 특히, 기존의 많은 테스트가 점점 더 강력해지는 모델을 판단하기에 더 이상 충분하지 않다고 주장한다.

Vals는 일반 상식에 대한 공개 시험에만 의존하지 않고, 복잡한 도메인별 과제에서 AI 시스템을 평가한다. 이 접근법은 모델 개발자가 약점을 파악하도록 돕고, 구매자가 실제 업무에 쓸 시스템을 비교하도록 돕고, 규제기관이나 투자자에게 성능과 위험에 대한 더 의미 있는 증거를 제공하도록 설계됐다.

AI 평가를 위한 다른 모델

2024년 설립된 Vals는 공동 창업자이자 CEO인 Rayan Krishnan이 학술 벤치마크가 새로운 모델 역량을 따라잡기 어려워하고 있다는 점을 관찰한 뒤 만들어졌다. TechCrunch가 전한 발언에서 Krishnan은 업계가 전통적인 평가 시스템이 측정할 수 있는 속도보다 더 빨리 유능한 모델을 내놓고 있다고 말했다.

이 회사의 테스트는 법률, 금융, 코딩 같은 분야의 전문 업무를 닮도록 설계됐다. Vals는 모델이 어려운 질문에 답할 수 있는지만 묻는 대신, 특정 분야에서 사람의 산출물과 견줄 만한 품질의 작업을 만들어낼 수 있는지를 살펴본다고 말한다.

눈에 띄는 특징은 Vals가 테스트에 사용된 구체적인 자료를 공개하지 않는다는 점이다. 회사의 논리는 완전히 공개된 벤치마크가 최적화나 학습의 표적이 될 수 있다는 것이다. 모델은 테스트에서는 좋아진 것처럼 보이지만, 더 넓고 보지 못한 작업에서는 비슷한 수준의 향상을 보여주지 못할 수 있다.

Vals는 또 평가가 성공적인 과제 완료뿐 아니라 유해하거나 바람직하지 않은 결과도 고려한다고 말한다. 보고된 관심 분야에는 사이버보안, 생물안보, 정신 건강, 재귀적 자기 개선, 무력충돌법이 포함된다. 제공된 자료에는 각 프로그램의 방법론, 채점 체계, 독립적 검증에 대한 자세한 설명은 없다.

자금 조달과 성장 수치가 보여주는 것

시리즈 A에 앞서 8VC와 Bloomberg Beta가 주도한 초기 시드 라운드가 있었다. TechCrunch는 Vals의 최신 자금 조달이 2026년 9월 기사 직전 달에 마무리됐고, 회사 팀 규모는 연초 8명에서 현재 25명으로 늘었다고 보도했다.

이 성장 수치와 지난해 대비 매출이 8배 늘었다는 회사의 주장은 Krishnan을 통해 전달된 것이며, 독립적으로 감사된 증거가 아니라 회사가 보고한 지표로 봐야 한다. उपलब्ध한 자료에는 Vals의 고객, 총매출, 테스트 물량, 평가한 모델 수가 나와 있지 않다.

회사는 AI 개발자에게 모델 평가 비용을 청구해 수익을 낸다. 이는 잠재적으로 유용하지만 미묘한 관계를 만든다. 시험 비용을 내는 쪽이 곧 그 시험을 통해 평가받는 쪽이기 때문이다. Vals는 이 서비스를 개발 및 품질 관리 도구로 제시하며, 개선이 필요한 부분을 드러내는 표준화 시험 비용을 지불하는 것에 비유한다.

회사는 연방 기관에 모델 평가를 제공하는 프로그램도 시작했다. 자료에는 어떤 기관이 참여하는지, 혹은 그 프로그램이 공개 결과를 냈는지는 명시되지 않는다.

벤치마크 중립성이 구매자에게 중요한 이유

AI 개발자에게 평가의 가치는 그것이 시험 환경 밖의 성능을 예측하느냐에 달려 있다. 공개 벤치마크는 설명하기 쉽지만, 모델이 그 질문에 맞게 조정됐거나 시험이 실제 업무 흐름이 아닌 추상적 지식을 측정한다면 덜 유용할 수 있다.

Vals의 과제 기반 모델은 법률 검토, 금융 분석, 소프트웨어 개발, 기타 운영 업무용 시스템을 선택하는 엔터프라이즈 AI 구매자에게 더 관련성이 높을 수 있다. 구매자는 일반 랭킹에서의 순위보다, 정의된 워크플로를 정확하고 일관되게, 그리고 허용 가능한 실패 양식으로 수행하는지를 더 중요하게 여길 수 있다.

그렇게 되면 평가의 품질은 단순한 마케팅이 아니라 배포의 문제가 된다. 제품 팀은 모델이 어디서 무너지는지, 얼마나 자주 인간의 개입이 필요한지, 겉보기에는 뛰어난 결과가 안전성이나 신뢰성 문제를 숨기고 있는지 알아야 한다. 비공개 테스트는 벤치마크 조작을 줄일 수 있지만, 외부 검증도 더 어렵게 만든다. 구매자는 테스트 정답을 받지 않으면서도 점수가 무엇을 의미하는지 이해할 수 있을 만큼의 방법론적 투명성이 필요하다.

AI 시스템이 비즈니스 프로세스에 깊게 통합될수록 상업적 이해관계는 더 커질 수 있다. 모델 평가가 조달, 공시, 투자 결정, 규제 검토에 영향을 미치기 시작하면, 그런 평가를 만드는 조직은 독립성, 재현성, 이해상충에 대한 저항성을 입증하라는 압력을 받게 된다.

증거, 한계, 경쟁 압력

Vals의 논거는 주로 회사가 지적한 문제와 제시한 접근 방식에 기반한다. TechCrunch는 오래된 벤치마크가 최신 모델을 따라가지 못하는 시장에 대한 Krishnan의 설명을 보도했지만, Vals의 테스트가 경쟁 시스템보다 더 예측력이 높거나 조작이 더 어려운지를 보여주는 비교 결과는 제시하지 않았다.

또한 공개된 보도에는 Vals가 업계 선호 평가자로 자리 잡았다는 독립적 증거도 없다. Andreessen Horowitz와 초기 후원자들로부터의 투자는 투자자 신뢰의 신호일 뿐, 벤치마크 정확성이나 시장 채택의 증거는 아니다. 마찬가지로 보도된 매출 성장과 연방 기관 평가 확장은 회사가 주장하는 모멘텀을 보여주지만, 광범위한 고객 수용을 입증하지는 않는다.

Vals는 모델 개발사, 연구소, 공개 벤치마크 커뮤니티, 전문 테스트 기업, 내부 평가 팀과도 경쟁해야 한다. 어떤 조직은 투명한 공개 테스트를 선호할 수 있고, 다른 조직은 자신의 데이터와 워크플로를 반영하는 비공개 평가에 비용을 지불할 수 있다. 회사의 과제는 통제된 프로세스가 내부 테스트나 기존 평가 플랫폼으로는 얻을 수 없는 통찰을 제공한다는 점을 입증하는 것이다.

앞으로 주목할 점

가장 명확한 신호는 Vals가 모델을 어떻게 채점하는지, 그리고 그 점수가 실제 운영 성과와 상관관계가 있는지를 보여주는 공개 증거가 될 것이다. 구매자들은 공개된 방법론, 재현성 연구, 일관된 조건에서 수행된 모델 비교, 그리고 평가가 배포나 조달 결정을 바꾼 사례를 지켜봐야 한다.

연방 기관 프로그램도 중요한 시험대다. 참여 기관이 명시되거나, 발표된 결과나 공식 조달 관계가 있다면 단순한 발표보다 더 강한 증거가 된다. 회사의 채용 계획과 사무실 확장은 지속적인 상업 활동을 보여줄 수 있지만, 직원 수보다 고객 유지율과 반복 평가 물량이 더 중요할 것이다.

시장은 또한 Vals가 블랙박스가 되지 않으면서 기밀성을 유지할 수 있는지도 주목해야 한다. 안전성, 역량, 투자 가치에 관한 주장에 그 평가가 영향을 미친다면, 독립적 감독과 명확한 채점 설명이 신뢰성의 핵심이 될 것이다.

Creati.ai 시각

Vals는 지금이 적절한 시점에 시장에 들어오고 있다. AI 기업들은 사람들이 실제로 수행하는 업무를 반영하는 평가를 점점 더 필요로 하고 있으며, 구매자들은 신뢰할 수 있는 배포로 이어지지 않는 랭킹 상승에 점점 더 회의적이다. 숨겨진 테스트와 도메인별 과제에 집중하는 것은 공개 벤치마킹의 실제 약점을 다루고 있다.

하지만 신뢰할 수 있는 표준이 되려면 벤처 자금과 빠른 성장만으로는 부족하다. Vals는 비공개 평가가 엄격하고, 재현 가능하며, 고객과 외부인이 그 의미를 판단할 수 있을 만큼 충분히 투명하다는 점을 입증해야 한다. 회사의 다음 단계는 벤치마크 카탈로그의 야심보다, 그 결과가 어떤 AI 모델을 만들고, 사고, 배포할지에 대한 결정을 얼마나 신뢰성 있게 개선하느냐에 의해 더 많이 정의될 것이다.

광고