전체

시큐어 코드 워리어, AI 생성 코드가 코드베이스당 평균 15개의 취약점 유발

AI 소프트웨어 거버넌스 및 개발자 보안 역량 강화 분야의 선도 기업인 시큐어 코드 워리어(Secure Code Warrior)는 새로운 모델이 등장할 때마다 진화하는 AI 코딩 보안의 살아있는 벤치마크인 ‘SCW AI 트러스트 인덱스(SCW AI Trust Index)’를 발표했다.

이 인덱스는 조직이 AI 생성 코드가 도입하는 보안 리스크를 이해하고 관리할 수 있도록 지원한다. 이번 연구는 호주
RMIT대학교와 공동 개발하고 시큐어 코드 워리어가 확장한 방법론을 기반으로 한다. 선도적인 대규모 언어 모델(LLM)이 안전하지 않은 코드를 생성하는 빈도에 대한 종합적인 벤치마크를 제시하며, AI 지원 개발을 확장하는 모든 기업에 중대한 시사점을 제공한다.

오픈AI(OpenAI), 앤트로픽(Anthropic), 구글, 알리바바 등 16개 첨단(프런티어) 모델이 생성한 1760개의 완전한 코드베이스에 대한 평가를 기반으로 한 조사 결과에 따르면 AI 생성 코드는 코드베이스당 평균 15개의 확인된 취약점을 포함하며, 이 중 평균 4.3개는 ‘심각(severe)’ 수준으로 분류된다.

개발자들이 코드 생성을 프런티어 LLM에 계속 맡김에 따라 보안 리더는 개발자가 어떤 보안 리스크를 떠안게 되는지, 그리고 그 리스크가 모델별, 프레임워크별 또는 두 요소의 상호작용에 따라 어떻게 달라지는지 파악하는 것이 중요해졌다. SCW AI 트러스트 인덱스는 AI 생성 코드 보안에 대한 실증적 측정을 도입하며, 일회성 스냅샷이 아닌 새로운 모델이 등장함에 따라 진화하는 살아있는 벤치마크를 제공한다.

이제 조직은 SCW AI 트러스트 인덱스를 활용해 다음과 같은 방법으로 AI 기반 소프트웨어 개발의 리스크를 이해하고 완화할 수 있다.

· 실제 보안 데이터를 사용한 AI 코딩 모델 비교
· 반복되는 취약점 패턴 식별
· 실증 데이터를 통한 AI 생성 코딩 리스크 정량화

피터 단히외(Pieter Danhieux) 시큐어 코드 워리어 공동 설립자 겸 최고경영자(CEO)는 “당사가 테스트한 모든 AI 모델은 예측 가능하고 반복적으로 발생하는 보안 격차와 약점 패턴을 남긴다”며 “개발자들 역시 보안 점수 때문에 선호하는 모델을 포기하지 않을 것이라는 점에서 예측 가능하다. SCW AI 트러스트 인덱스는 CISO와 보안 리더가 이미 사용 중인 모델을 관리할 수 있도록 특별히 구축됐다”고 설명했다.

이어 그는 “확인된 ‘승자’는 없지만 이 데이터는 내재된 보안 격차를 고려해 AI 도구를 진정으로 안전하게 관리하고, 현대화된 보안 프로그램에서 적절한 가드레일과 개발자 학습 경로를 구현하는 데 필요한 핵심 인사이트를 제공한다”며 “AI 생성 코드에는 인간이 작성한 코드에 항상 적용해 온 것과 동일한 정밀 검토가 필요하며, 이제 마침내 정확히 어디를 살펴봐야 하는지 알려주는 데이터를 확보하게 됐다”고 말했다.

시큐어 코드 워리어의 연구는 AI 생성 코드 보안 리스크가 무작위가 아니라 측정 가능하고, 예측 가능하며, AI 모델, 프레임워크 및 취약점 유형 전반에 걸쳐 일관된 패턴으로 집중돼 있음을 보여준다. 주요 결과는 다음과 같다.

· AI 생성 취약점, 무작위 오류가 아닌 예측 가능한 패턴 보여

- 1760개의 AI 생성 코드베이스 전반에서 시큐어 코드 워리어는 86개의 고유한 공통 취약점(CWE)을 식별했으며, 가장 흔한 약점은 로깅 실패, 인젝션 취약점, 안전하지 않은 설계, 취약한 접근 제어를 중심으로 군집화됐다. 가장 만연한 단일 CWE는 CWE-532(민감 정보의 로그 파일 삽입)로, 8543건의 실제 취약점(true positives)이 확인됐다. 이러한 반복적인 패턴은 AI 생성 보안 리스크가 측정 가능하고, 반복 가능하며, 예측할 수 있음을 입증한다.

· 모든 AI 모델은 고유의 보안 지문 보유

- 평가된 모든 프레임워크 전반에서 모델들은 무작위 실패가 아닌 반복되는 취약점 패턴을 일관되게 나타냈다. SCW AI 트러스트 인덱스는 각 모델이 반복 가능한 개방형 웹 애플리케이션 보안 프로젝트(OWASP) 취약점 카테고리 조합을 생성함을 보여주며, 조직이 보안 약점이 발생할 가능성이 가장 높은 곳을 예측할 수 있게 한다.

· 일관되게 가장 안전한 코드를 생성하는 단일 AI 모델은 없어

- 모델 성능은 사용되는 프레임워크에 따라 크게 달라진다. GPT-5.1은 자바 엔터프라이즈 API(Java Enterprise API), 클로드 소넷 4.5(Claude Sonnet 4.5)는 자바 스프링(Java Spring), 클로드 오퍼스 4.8(Claude Opus 4.8)은 파이썬 장고(Python Django), GPT-5.5는 C#(.NET), 클로드 페이블 5(Claude Fable 5)는 C에서 우위를 점하고 있다. 보안 결과는 모델뿐만 아니라 개발 맥락(환경)의 영향을 동시에 받는다.

· 보안 결과는 모델 비용과 무관

- 이 연구는 API 비용과 안전한 코딩 성능 간에 일관된 관계가 없음을 확인했다. 예를 들어 GPT-5.1은 실행당 5.60달러로 가장 높은 트러스트 인덱스 점수 중 하나를 달성한 반면 훨씬 더 비싼 모델들이 더 약한 보안 결과를 나타냈다. 조직은 가격이 아닌 측정 가능한 보안 성능을 기준으로 AI 모델을 평가해야 한다.

SCW AI 트러스트 인덱스는 조직이 AI 생성 코드의 동작 방식을 이해하고, 리스크가 발생하는 지점을 식별하며, 개발자가 처음부터 더 안전한 코드를 생성할 수 있도록 지원함으로써 시큐어 코드 워리어의 미션을 한 단계 발전시킨다. 시큐어 코드 워리어는 AI 가시성, 거버넌스, 적응형 개발자 학습을 결합해 조직이 보안을 희생하지 않으면서 AI 지원 소프트웨어 개발을 자신 있게 확장할 수 있도록 돕는다.

전체 연구 결과는 웹사이트(
www.securecodewarrior.com/product/ai-trust-index)에서 확인할 수 있다.

시큐어 코드 워리어 소개

시큐어 코드 워리어(Secure Code Warrior)는 AI 소프트웨어 거버넌스 및 개발자 보안 역량 강화 분야의 선도 기업으로, 기업이 소프트웨어 개발 수명 주기(SDLC) 전반에 걸쳐 AI 기반 소프트웨어 개발을 통제할 수 있도록 지원한다. 10년간 축적된 개발자 보안 전문성을 기반으로 AI 가시성, 정책 집행, 맞춤형 학습을 제공함으로써 프로덕션 전에 취약점을 방지하고 소프트웨어 품질을 강화한다.

이 보도자료는 해당 기업에서 원하는 언어로 작성한 원문을 한국어로 번역한 것이다. 그러므로 번역문의 정확한 사실 확인을 위해서는 원문 대조 절차를 거쳐야 한다. 처음 작성된 원문만이 공식적인 효력을 갖는 발표로 인정되며 모든 법적 책임은 원문에 한해 유효하다.

공유하기