Cloudflare, 오픈소스 의사결정 모델 Clef와 RL 파인튜닝 플랫폼 발표
Cloudflare가 오픈소스 의사결정 모델과 RL 파인튜닝 플랫폼인 Clef를 발표하며, 개발자를 위한 훈련 가능한 AI 제어 시스템으로의 진전을 알렸다.
강화 학습에 대한 최신 뉴스 및 분석
Cloudflare가 오픈소스 의사결정 모델과 RL 파인튜닝 플랫폼인 Clef를 발표하며, 개발자를 위한 훈련 가능한 AI 제어 시스템으로의 진전을 알렸다.
NVIDIA의 COMPASS 튜토리얼은 AI 에이전트가 시뮬레이션, 잔차 강화학습, 평가를 자동화해 여러 플랫폼의 로봇 내비게이션을 지원하는 방법을 보여준다.
NVIDIA는 RLVR과 GRPO가 이제 기업 AI 에이전트에 실용적이라고 말하며, Nemotron 3 Super와 NeMo RL을 도메인 특화 신뢰성 향상과 연결하고 있다.
General Intuition은 수백만 시간의 게임플레이로 학습한 AI를 확장하기 위해 3억 2천만 달러를 조달했으며, 행동 데이터가 AI의 실제 세계 추론 능력 개발에 도움이 될 수 있다고 보고 있다.
전 Google DeepMind 연구원 데이비드 실버는 런던 기반 스타트업 Ineffable Intelligence를 위해 Sequoia Capital이 주도하는 기록적인 10억 달러 규모의 시드 라운드를 모금하고 있으며, 이 회사는 대형 언어 모델이 아닌 강화학습을 사용해 초지능을 구축하는 것을 목표로 한다.