AI News

영국의 AI Security Institute(AISI)는 선도적인 오픈 가중치 모델들이 최고 수준의 독점 AI 시스템과의 사이버 역량 격차를 약 4~7개월로 좁혔다고 말합니다. 이는 2025년 초보다 더 짧은 지연이며, 적응할 시간을 믿고 있는 보안팀에는 의미 있는 경고입니다. AISI의 평가에 따르면 GLM-5.2와 DeepSeek V4-Pro 같은 모델은 이제 일부 폐쇄형 시스템이 불과 몇 달 전에 도달했던 성능 수준과 비슷해질 수 있으면서도, 운영 비용은 훨씬 더 적게 듭니다.

이 조합은 벤치마크를 넘어 의미가 있습니다. AISI의 분석에 따르면, 다운로드 가능한 가중치를 가진 저비용 오픈 모델은 공격적 사이버 워크플로를 확장하는 실질적 장벽을 낮추는 동시에, 공급자 수준의 안전 통제를 시행하기도 더 어렵게 만듭니다. 빌더와 기업 구매자에게 이 보고서는 오픈 모델 논쟁을 규정해 온 긴장을 더 선명하게 보여줍니다. 즉, 사적 배포와 커스터마이징에 매력적인 오픈 가중치 시스템의 특성은 악용을 억제하기 더 어렵게 만들 수도 있습니다.

AISI가 측정한 것

AISI는 사이버 관련 작업에서 선도적인 오픈 가중치 모델이 선도적인 폐쇄형 모델보다 얼마나 뒤처지는지에 대한 첫 공개 평가라고 밝혔습니다. 연구소는 두 가지 평가 방법을 사용했습니다.

첫 번째는 Narrow Cyber Tasks로, 네 가지 난이도에 걸친 70개 작업을 다룹니다. The Decoder의 결과 보도에 따르면, 이 작업들은 취약점 연구, 리버스 엔지니어링, 웹 익스플로잇, 암호학을 포함합니다. 이 벤치마크에서 AISI는 2026년 6월에 공개된 GLM-5.2가 2026년 2월의 Opus 4.6과 대략 비슷한 수준의 성능을 보였으며, 약 4개월의 격차를 시사한다고 밝혔습니다. 한편 DeepSeek V4-Pro는 AISI가 2025년 11월로 잡는 Opus 4.5 수준에서 동작한 것으로 전해졌습니다.

두 번째 방법인 Cyber Ranges는 개별 작업보다 시뮬레이션된 네트워크에서 더 자율적인 행동을 테스트합니다. 한 시나리오인 “The Last Ones”는 4개의 서브넷과 약 20개의 호스트로 이루어진 기업 네트워크에 대한 다단계 공격을 모델링합니다. AISI는 인간 전문가가 이 연습을 마치려면 약 20시간이 필요할 것으로 추정했습니다.

그 결과는 오픈 모델에 덜 유리했지만, 여전히 빠른 추격을 보여줬습니다. AISI는 시뮬레이션 환경에서 GLM-5.2가 Opus 4.5와 거의 비슷한 성능을 보였고, DeepSeek V4-Pro는 Sonnet 4.5보다 낮았다고 말했습니다. 연구소는 Cyber Ranges 증거가 좁은 작업 중심 평가보다 약한 이유로, 더 적은 시나리오에 의존하고 순수한 사이버 지식보다는 장기 계획 능력의 한계를 반영할 수 있다고 설명했습니다.

이 구분은 중요합니다. 보안 구매자에게 실질적 위험은 모델이 리버스 엔지니어링 프롬프트를 풀 수 있는지 여부만이 아니라, 소음이 많은 환경에서 복잡한 행동의 연쇄를 지속할 수 있는지 여부입니다. AISI는 두 능력 모두 중요하며, 오픈 모델과 폐쇄형 모델의 격차는 어떤 종류의 작업을 측정하느냐에 따라 달라질 수 있다고 말하는 것으로 보입니다.

비용 격차가 판을 바꾸는 이유

AISI가 보고한 비용 수치는 이번 발표에서 아마도 가장 운영적으로 중요한 부분입니다. 연구소에 따르면 1억 토큰 규모의 Cyber Ranges 테스트는 Opus 4.5 또는 Opus 4.6을 사용하면 약 85달러, GLM-5.2는 약 46달러, DeepSeek V4-Pro는 단 1.19달러였습니다.

또한 신뢰성 있게 해결된 작업에 대한 작업당 비용 추정치도 제시했습니다. Opus 4.6은 작업당 약 15달러, GLM-5.2는 약 6달러, Opus 4.5는 약 12.50달러, DeepSeek V4-Pro는 약 0.28달러였습니다.

이 수치가 실제 공격 비용과 같은 것은 아니며, AISI도 그렇게 주장하지 않았습니다. 그러나 이는 “충분히 좋은” 사이버 성능이, 특히 오픈 배포 옵션과 결합될 경우 훨씬 더 저렴하게 접근 가능해지고 있음을 시사합니다. 방어자 입장에서는 위협이 오픈 모델이 현재 최전선과 정확히 일치하느냐에만 국한되지 않는다는 뜻입니다. 더 오래된 또는 약간 더 약한 능력이라도 매우 낮은 비용과 높은 규모로 운용할 수 있다면, 공격자의 경제성을 바꿀 수 있습니다.

이것이 이 보고서가 보안 연구뿐 아니라 엔터프라이즈 AI와도 관련이 있는 이유 중 하나입니다. 오픈 가중치 모델을 평가하는 많은 조직은 프라이버시, 주권, 낮은 추론 비용에 초점을 맞춥니다. AISI의 결과는 그에 더해 이중용도 노출도 생각해야 함을 시사합니다. 내부 코딩, 자동화, 레드팀 지원에 매력적인 모델은 API 기반 폐쇄형 대안과 안전 특성이 크게 다를 수 있습니다.

다운로드 가능한 모델에서는 안전 장치가 약해 보인다

AISI의 가장 강한 결론은 원시 성능이 아니라 통제에 관한 것입니다. 연구소는 테스트한 오픈 모델의 안전 조치가 대체로 효과가 없었다고 말했습니다. The Decoder가 인용한 한 예에서 DeepSeek V4-Pro는 때때로 리버스 엔지니어링 요청을 거부했지만, 다시 시도하면 제한을 우회할 수 있었다고 합니다.

이 취약점은 특정 모델 하나의 결함으로 제시되지 않습니다. AISI의 더 넓은 주장은 구조적입니다. 모니터링, 분류기, 속도 제한, 사용자 제한 같은 안전장치는 시스템 접근을 통제할 수 있어야 작동합니다. 가중치가 공개되면 그 통제는 약해지거나 사라집니다. 복사본은 비공개로 실행되거나, 수정되거나, 원 개발자의 손이 닿지 않는 곳에서 공유될 수 있습니다.

AISI는 이를 “지속적이고 되돌릴 수 없는 오용 위험”이라고 표현한 것으로 보도되었습니다. 이는 평범한 모델 카드 경고보다 훨씬 강한 표현이며, 연구소가 격차 축소를 단순한 순위 업데이트가 아니라 정책과 방어 시간 문제로 보는 이유를 설명해 줍니다.

동시에 이 보고서는 오픈 모델을 전면적으로 부정하지는 않습니다. AISI는 오픈 가중치 배포의 실질적 이점도 인정합니다. 사내 호스팅, 낮은 벤더 의존도, 커스터마이징, 그리고 제공 조건이 바뀌거나 서비스가 중단될 위험 감소가 그것입니다. 많은 기업에게 이는 실제 장점입니다. 정책적 과제는 구매자에게 매력적인 오픈 모델의 분산성이 해로운 사용에 대한 중앙집중적 통제를 약화시킨다는 점입니다.

증거, 유의점, 그리고 아직 입증되지 않은 것들

이 기사의 핵심 발견은 The Decoder가 보도한 AISI의 평가에서 비롯되며, 두 번째 출처인 Tech Times는 본질적으로 같은 평가를 바탕으로 하되 실질적 세부 정보는 추가하지 않은 것으로 보입니다. 이는 여기서의 주요 증거 기반이 소스 묶음에 포함된 전체 공개 논문이 아니라 기관 분석에 대한 전문 매체 보도라는 뜻입니다.

여러 유의점이 중요합니다. 첫째, AISI는 Cyber Ranges 결과가 테스트 사례 수가 적기 때문에 더 약한 증거라고 밝혔습니다. 둘째, 연구소는 이러한 시스템이 테스트에 맞춰 특별히 조정되지 않았기 때문에 평가가 오픈 모델의 최고 성능을 약간 과소평가할 수도 있다고 말했습니다. 셋째, 시뮬레이션된 네트워크 환경에는 능동적 방어자나 실제 조직의 복잡성이 모두 포함되지 않습니다.

이런 한계는 서로 다른 방향으로 작용합니다. 오픈 모델 지지자들은 더 나은 프롬프트나 튜닝이 결과를 개선할 수 있다면 보고된 격차가 폐쇄형 시스템의 우위를 과장한다고 주장할 수 있습니다. 반면 보안 실무자들은 실제 생산 네트워크는 방어되고, 모니터링되며, 일관성이 없기 때문에 시뮬레이션이 공격자에게 실제로 부과되는 마찰을 과소평가한다고 주장할 수 있습니다.

헤드라인 뒤에는 벤치마크 설계 문제도 있습니다. Narrow Cyber Tasks에서 좋은 점수를 받는 모델도 실제 다단계 침투에서는 계획을 놓치거나, 도구를 잘못 다루거나, 누적 오류를 일으켜 실패할 수 있습니다. 반대로 긴 자율 실행에서 약한 모델도 작업을 더 작은 단계로 나누는 인간 운영자에게는 매우 유용할 수 있습니다. AISI의 자체 프레이밍도 이 구분을 인정하는 듯합니다.

이것이 빌더와 기업 구매자에게 의미하는 것

AI 빌더에게 이 보고서는 기준선이 변하고 있음을 시사합니다. GLM-5.2와 DeepSeek V4-Pro 같은 오픈 가중치 시스템이 훨씬 낮은 비용으로 최근의 폐쇄형 모델 사이버 성능에 근접할 수 있다면, 코딩 어시스턴트, 보안 자동화, AI 에이전트 워크플로를 만드는 제품팀은 더 많은 배포 옵션을 갖게 되지만, 동시에 이러한 시스템을 어떻게 제한하고, 관찰하고, 분리할지에 대한 책임도 커집니다.

기업에게 실질적인 교훈은 “오픈 모델을 피하라”가 아니라 “비용 결정과 위험 결정을 분리하라”는 것입니다. 통제된 내부 환경에서 오픈 모델을 운영하는 것은 여전히 합리적일 수 있습니다. 특히 데이터 거주와 사적 추론이 중요한 경우에는 더욱 그렇습니다. 그러나 보안팀은 호스팅 API에 의존하는 것보다 더 강한 로컬 통제, 더 제한된 도구 접근, 더 상세한 감사 로그, 더 명확한 내부 사용 정책이 필요할 수 있습니다.

사이버 시장에서 AISI의 시간표 해석은 아마도 가장 큰 전략적 신호입니다. 연구소는 폐쇄형과 오픈형 모델 간의 격차를, 더 강력한 시스템을 사용하는 방어자들이 동등한 능력이 널리 다운로드 가능해지기 전에 적응할 수 있는 일시적 준비 창으로 보고 있습니다. 그 창이 이제 6~10개월이 아니라 4~7개월이라면, 탐지 엔지니어링, 레드팀, 악용 모니터링의 로드맵은 더 빨라져야 할 수 있습니다.

이 보고서는 모델 시장의 최상위권이 빠르게 움직이는 가운데 나왔습니다. AISI는 Mythos Preview와 GPT-5.5를 포함한 폐쇄형 모델이, 테스트를 시작한 이래 AI 사이버 능력에서 가장 큰 향상 중 일부를 보였다고 말했습니다. 영국 National Cyber Security Centre도 사이버 위협 환경이 빠르게 변하고 있다고 별도로 경고했습니다. 오픈 모델이 모든 최전선 도약을 즉시 재현하지 못하더라도, 확산 속도는 가속화되고 있는 것으로 보입니다.

다음에 주목할 점

가까운 신호는 AISI가 예정한 Kimi-K3 테스트입니다. The Decoder에 따르면 이 모델은 7월 말 오픈 가중치로 공개될 예정입니다. AISI는 현재 코딩 벤치마크가 Kimi-K3가 오늘날의 최전선 모델에 더 가까워질 수 있음을 시사하지만, 다른 오픈 모델보다 비용은 더 높을 수 있다고 보는 것으로 전해졌습니다.

이 단일 출시를 넘어 중요한 것은 세 가지입니다. 첫째, 향후 Cyber Ranges 평가에서 오픈 모델이 좁은 작업 능력뿐 아니라 장기적 자율성도 개선되는지 여부. 둘째, 기업이 오픈 가중치 배포에 대해 벤더 시대의 안전 습관이 여전히 적용된다고 가정하는 대신 더 강한 로컬 거버넌스를 채택하는지 여부. 셋째, 폐쇄형 모델 공급업체가 사이버 성능에서 의미 있는 우위를 유지할 수 있는지, 아니면 최전선의 향상이 수개월 내 다운로드 가능한 시스템으로 계속 확산되는지입니다.

Creati.ai 관점

이번 AISI 결과에서 중요한 점은 단순히 오픈 모델이 좋아지고 있다는 사실이 아닙니다. 오히려 지연은 줄어드는데 추론 경제성은 더 빠르게 개선되고 있다는 점입니다. 실무적으로는, 오픈 모델이 사이버 워크플로에서 전략적으로 중요해지기 위해 최전선과 정확히 같을 필요는 없다는 뜻일 수 있습니다. “충분히 가깝고, 충분히 싸고, 충분히 통제하기 어려운 것”만으로도 이미 심각한 임계점입니다.

제품팀과 구매자에게 주는 교훈은 오픈 가중치 채택을 단순한 모델 품질 문제가 아니라 인프라와 거버넌스 문제로 다루라는 것입니다. 기업 AI 자율성에 대한 관심을 이끄는 요인들, 즉 사적 호스팅, 낮은 비용, 벤더 종속으로부터의 자유는 기존의 안전 가정도 약화시킵니다. GLM-5.2, DeepSeek V4-Pro, 그리고 아마도 Kimi-K3 같은 모델이 격차를 좁혀감에 따라, 진정한 차별화 요소는 원시 능력에서 도구, 데이터, 악용에 대한 신뢰할 수 있는 통제 아래 누가 이를 배포할 수 있는가로 옮겨갈 수 있습니다.

추천

AISI, 오픈 가중치 AI 사이버 모델이 최전선 시스템을 더 빠르게 따라잡고 있으며 비용은 훨씬 낮다고 말하다

AISI는 오픈 가중치 모델이 이제 최고 수준의 폐쇄형 AI 사이버 시스템과의 격차가 고작 4~7개월로 줄었으며, 비용이 크게 떨어지는 가운데 방어자들의 우위도 축소되고 있다고 말합니다.