Insilico Medicine, 신약 발견용 AI 벤치마크 서비스 출시
Insilico Medicine은 최전선 AI와 파운데이션 모델을 실제 신약 발견 및 개발 과제에 대해 테스트하는 DDD Benchmark as a Service를 출시했다.
Insilico Medicine은 최전선 AI와 파운데이션 모델을 실제 신약 발견 및 개발 과제에 대해 테스트하는 DDD Benchmark as a Service를 출시했다.
Moonshot의 Kimi K3는 Code Arena: Frontend에서 선두를 차지했지만 FrontierMath Tier 4에서는 OpenAI와 Anthropic의 상위 모델들에 뒤처지며 모델 강점이 고르지 않음을 보여줬다.
보도에 따르면 5개 AI 랩이 8월 1일을 기한으로 공통 jailbreak 점수 체계를 지지하고 있으며, 이는 더 비교 가능한 AI 모델 안전 테스트를 향한 초기 단계다.
OpenAI는 AI 랩들이 생물학 워크플로로 진출하는 가운데, 더 높은 수준의 과학적 추론을 측정하기 위한 게놈 벤치마크 GeneBench-Pro를 공개했다.
인기 있는 무료 AI 모델 리더보드 스타트업 Arena는 지난해 9월 상용 서비스를 출시했으며, 현재 1억 달러 규모의 사업으로 성장했다.
CAISI의 평가는 DeepSeek V4 Pro가 중국에서 가장 강력한 모델이지만, 여전히 미국의 선도적인 프론티어 AI 시스템에는 뒤처진다고 밝혔다.
엄격한 새로운 벤치마크에서 투자은행 업무에 대한 주요 AI 모델들을 테스트한 결과, 단 하나의 출력도 고객에게 바로 제공할 수 있는 수준으로 간주되지 않았다. 다만 절반의 은행가들은 이를 출발점으로서 가치 있다고 보았다.
새로운 벤치마크는 최고 수준의 AI 모델조차 복잡한 차트를 분석할 때 정확도가 약 50% 떨어지며, 시각적 추론의 핵심 한계를 드러낸다고 밝혔다.
업그레이드된 Google Gemini 3 Deep Think 모델이 최신 벤치마크 테스트에서 OpenAI의 GPT-5.2와 Anthropic의 Claude Opus 4.6보다 우수한 성능을 보였습니다.
Claude Opus 4.6은 Terminal-Bench에서 65.4%, OSWorld에서 72.7%라는 획기적인 성과를 달성하여 실제 업무 응용에서 Gemini 3 Flash를 능가합니다.
AI 벤치마크에 대한 최신 뉴스 및 분석