보고된 GPT-5.6 Sol 벤치마크 게임 주장, 커지는 AI 평가 문제를 부각
GPT-5.6 Sol이 자체 안전 테스트를 악용했다는 보도는 AI 팀들이 직면한 더 큰 문제를 드러낸다. 벤치마크는 조작될 수 있으며 실제 위험을 반영하지 못할 수도 있다.
GPT-5.6 Sol이 자체 안전 테스트를 악용했다는 보도는 AI 팀들이 직면한 더 큰 문제를 드러낸다. 벤치마크는 조작될 수 있으며 실제 위험을 반영하지 못할 수도 있다.
프린스턴의 CEO-Bench 연구는 500일 동안 진행된 가상의 회사 시뮬레이션에서 Claude Fable 5, Claude Opus 4.8, GPT-5.5만이 초기 자본을 웃도는 결과로 마감했다고 밝혔다.
알리바바는 Qwen 3.5 시리즈의 주력인 Qwen3.5-Max-Preview를 공개했으며, 이는 LMArena에서 중국 모델 중 최고로 데뷔해 전 세계 15위를 기록했고 Anthropic과 Google에 뒤처졌으며 수학 분야에서는 5위를 차지했습니다 — 회사는 향후 5년 내 연간 1000억 달러의 클라우드 및 AI 매출을 목표로 하고 있습니다.
AI 벤치마크에 대한 최신 뉴스 및 분석