AI 에이전트는 사진을 3D 장면으로 바꿀 수 있지만, 아직 자신의 작업을 안정적으로 평가하지는 못한다
LEGO-Anything은 코딩 에이전트가 사진에서 편집 가능한 3D 장면을 만들 수 있음을 보여주지만, LEGO-Bench는 정확도와 자기평가에 큰 공백이 있음을 드러낸다.
코딩 AI에 대한 최신 뉴스 및 분석
LEGO-Anything은 코딩 에이전트가 사진에서 편집 가능한 3D 장면을 만들 수 있음을 보여주지만, LEGO-Bench는 정확도와 자기평가에 큰 공백이 있음을 드러낸다.
이코노미스트는 개발자들이 다른 어떤 직업보다 AI를 더 많이 사용할지 묻고, 측정 가능한 자동화에 코딩이 유난히 잘 맞는다는 점을 강조한다.
Block의 오픈 소스 Goose는 구독 없이 로컬 AI 코딩 에이전트를 제공하며, Claude Code의 프리미엄 가격 정책에 도전하는 동시에 품질과 하드웨어의 트레이드오프를 드러낸다.
DeepSeek이 Anthropic의 Claude Code와 경쟁할 수 있는 AI 에이전트를 개발하기 위해 팀을 꾸리고 있는 것으로 알려지며, 코딩 도구 분야의 경쟁 압박이 커지고 있다.
OpenAI 지원 보고서는 코딩 에이전트가 연구 소프트웨어 업그레이드를 극적으로 가속할 수 있지만, 과학적 정확성은 여전히 전문가가 검증해야 한다고 말한다.
OpenAI는 과학자들이 AI 코딩 에이전트를 활용해 오래된 연구 소프트웨어를 업데이트하고 유전체학 작업을 가속하고 있다고 밝히며, 새로운 엔터프라이즈 AI 격전지를 예고했다.
Anthropic은 Claude Opus 5를 선보이며 더 강력한 코딩 성능, 낮은 비용, 그리고 에이전트와 기업용 AI 활용을 위한 새로운 API 기능을 내세웠다.
Poolside는 더 큰 시스템들과 견줄 수 있다고 주장하는 오픈웨이트 코딩 모델 Laguna S 2.1을 공개했다. 회사는 지속성과 검증 능력을 개선한 점을 강조한다.
monday.com은 Amazon Bedrock에서 프로덕션 AI 에이전트를 운영한다고 밝히며, 엔터프라이즈 코딩 워크플로우의 아키텍처와 제어 방식에 대한 드문 통찰을 제공했다.
OpenAI의 Codex는 내부 에이전트 인계 과정을 암호화해 위임에 대한 개발자 가시성을 제한하고 AI 코딩 워크플로의 신뢰성 문제를 제기하고 있다.
OpenAI는 SWE-Bench Pro 작업의 약 30%가 깨졌을 수 있다고 말하며, AI 업계가 코딩 모델을 측정하는 방식에 대한 새로운 의문을 제기했습니다.
Fortune에 따르면 일본은 고령화된 소프트웨어 시스템과 감소하는 개발자 기반이 AI 코딩 에이전트에 대한 수요를 더욱 선명하게 만들면서 Devin의 핵심 시장으로 떠오르고 있다.
알리바바의 오픈소스 Qwen3.6-27B는 단 270억 개의 매개변수로 대부분의 코딩 벤치마크에서 이전 세대보다 15배 더 큰 모델을 능가한다.
Anthropic가 Claude Sonnet 4.6을 출시했습니다. 이 모델은 100만 토큰 컨텍스트 윈도우를 갖추고 코드 작성, 컴퓨터 활용, 에이전트 분야에서 최첨단 AI 성능을 더 낮은 비용으로 제공합니다. Opus 4.6 공개로부터 단 12일 만에 나왔습니다.
업계 보고에 따르면 Claude Sonnet 5는 Opus 4.5의 성능을 갖추면서도 비용은 50% 낮고, 코딩 및 에이전트 기능이 향상되었다고 합니다.
Anthropic은 Claude Opus 4.6에 대한 최대 2.5배 빠른 응답을 제공하는 빠른 모드를 도입하여 AI 기반 소프트웨어 개발 및 코딩 워크플로를 혁신합니다.
Anthropic은 Claude Opus 4.6을 출시했습니다. 향상된 코딩 능력, 더 오래 지속되는 에이전트형 작업 수행 능력, 그리고 기업용 애플리케이션을 위한 혁신적인 에이전트 팀 기능을 특징으로 합니다.