NVIDIA, Nemotron 3 Super와 NeMo RL 가이던스로 기업용 플레이북에 에이전트 강화학습을 밀어 넣다
NVIDIA는 RLVR과 GRPO가 이제 기업 AI 에이전트에 실용적이라고 말하며, Nemotron 3 Super와 NeMo RL을 도메인 특화 신뢰성 향상과 연결하고 있다.
NVIDIA는 RLVR과 GRPO가 이제 기업 AI 에이전트에 실용적이라고 말하며, Nemotron 3 Super와 NeMo RL을 도메인 특화 신뢰성 향상과 연결하고 있다.
General Intuition은 수백만 시간의 게임플레이로 학습한 AI를 확장하기 위해 3억 2천만 달러를 조달했으며, 행동 데이터가 AI의 실제 세계 추론 능력 개발에 도움이 될 수 있다고 보고 있다.
전 Google DeepMind 연구원 데이비드 실버는 런던 기반 스타트업 Ineffable Intelligence를 위해 Sequoia Capital이 주도하는 기록적인 10억 달러 규모의 시드 라운드를 모금하고 있으며, 이 회사는 대형 언어 모델이 아닌 강화학습을 사용해 초지능을 구축하는 것을 목표로 한다.
강화 학습에 대한 최신 뉴스 및 분석