NVIDIA, AI 에이전트 평가를 도구 호출 정확도 너머로 확장
NVIDIA는 도구 호출 정확도를 넘어 실제 환경에서 전체 작업을 테스트하는 AI 에이전트 평가 프레임워크를 제시하며, 실용적인 지표를 제안한다.
인공지능의 최신 업데이트 및 스토리
NVIDIA는 도구 호출 정확도를 넘어 실제 환경에서 전체 작업을 테스트하는 AI 에이전트 평가 프레임워크를 제시하며, 실용적인 지표를 제안한다.
OpenAI는 맞춤형 로펌 워크플로우, 연결된 데이터, 기밀 고객 업무를 위한 제어 기능을 기반으로 한 법률 AI 제품 Astra for Law를 공개했다.
아마존이 메타의 Muse가 Amazon.com에서 쇼핑하는 것을 차단하면서, AI 에이전트가 리테일 플랫폼과 고객 데이터에 어떻게 접근하는지를 둘러싼 더 큰 분쟁이 격화됐다.
NVIDIA는 로컬 컴퓨팅, 개발자 교육, 스타트업 자금 조달이 아프리카 전역에서 확대되면서 이집트가 AI 프로젝트를 실제 운영 단계로 옮기고 있다고 말한다.
TechCrunch가 Disrupt 2026에서 Startup Battlefield 200을 심사할 5명의 투자자를 발표하며, 기업용, AI, 산업 전문성을 스타트업 경연에 더합니다.
OpenAI는 V7이 GPT-5.6을 사용해 흩어진 회사 파일을 출처 링크가 달린 컨텍스트로 바꿔 에이전트를 위한 새로운 기업 메모리 모델을 제시한다고 말합니다.
Anthropic은 Claude가 후속 모델 개발을 돕고 있다고 말하며, AI 지원 연구, 감독, 그리고 연구실 내부에서 진전을 어떻게 측정하는지에 대한 질문을 제기하고 있다.
Reuters 보도에 따르면 Anthropic은 잠재적 IPO 전에 새 AI 모델 출시를 검토하고 있으며, 이는 투자자들의 주목과 제품 경쟁 구도에 영향을 줄 수 있다.
Anthropic과 OpenAI 에이전트 사건은 브뤼셀의 AI 보고 체계가 빠르게 움직이는 시스템의 실패를 책임 공백이 커지기 전에 포착할 수 있는지 시험하고 있다.
SK hynix가 인프라 수요 증가 속에 AI 컴퓨팅, 데이터 센터, 광학 인터커넥트를 겨냥한 실리콘밸리 벤처 조직을 출범했다.
Anthropic은 모델과 안전장치를 시험하기 위해 Accenture의 Faculty를 자사 연구실 안으로 들여오며, 독립적인 AI 안전 감시의 새로운 실험을 시작한다.
Anthropic은 Bay Area에서 생물학 연구용 웻랩을 운영한다고 확인했으며, AI 모델을 실험과 연결하는 한편 안전과 감독에 대한 의문도 불러일으켰다.