위성 시뮬레이션과 로봇 개발 작업을 보여주는 AI 관련 화면AI로 생성한 자료 이미지이며 실제 제품·인물·현장과 무관합니다.

오픈AI와 앤트로픽의 인공지능 안전장치가 위성 시뮬레이션, 로봇 제어, 보안 코드 검토처럼 정상적인 개발 작업까지 위험 행위로 판단해 막는 사례가 잇따르고 있다. 개발자들은 작업 시간이 늘고 대화를 새로 시작해야 하는 일이 반복되자 일부 업무를 다른 모델로 옮기고 있다고 밝혔다.

미국 기술매체 벤처비트가 9월 30일 보도한 내용에 따르면, MIT 항공우주학과 석사과정의 알레한드로 카라스코는 스탠퍼드 연구실에서 언어모델을 가상 우주선 제어에 활용하는 실험을 진행하고 있다. 그는 실제 위성이 아닌 시뮬레이션을 다루는데도 모델이 군사 목적이나 보안 인가가 필요한 작업으로 오해하는 경우가 있다고 말했다. 앤트로픽의 클로드가 특히 엄격하게 반응했다고도 했다.

로봇 개발자 마틴 켐카는 로봇 팔의 사용자 인터페이스를 만들거나 다른 컴퓨터에 SSH로 접속하는 작업에서 거부가 반복됐다고 설명했다. 가상 로봇 시뮬레이터에서는 문제가 적었지만, 실제 장치의 센서와 매개변수에 접근하려 하면 제한이 강해졌다는 증언도 나왔다.

안전장치가 막은 정상 작업

보안 분야에서도 비슷한 문제가 보고됐다. 오픈소스 코드의 취약점을 점검하는 업무가 사이버 공격으로 분류되면서 작업이 중단되는 식이다. 오픈AI는 방어 목적의 보안 작업도 추가 안전 점검 때문에 느려지거나 멈출 수 있다고 인정했다. 회사는 무해한 요청을 거부하는 비율을 낮추는 작업을 계속하고 있다고 밝혔다.

앤트로픽은 최근 안전장치가 정상적인 요청을 잘못 차단하는 문제를 인정하고, 최신 모델에서 개입 횟수를 줄였다고 설명했다. 다만 침투 테스트나 익스플로잇 생성처럼 악용 가능성이 큰 작업은 여전히 제한 대상이다. 회사 내부 자료에 따르면 2026년 8월 연구·개발용 에이전트가 처리한 10억 건 이상의 결정 중 약 0.002%가 차단됐고, 사후 모니터링에는 매주 약 10만 건의 기록이 검토 대상으로 올랐다.

개발자는 오픈모델로 우회

문제는 차단 자체보다 대체 경로가 빠르게 생기고 있다는 점이다. 개발자들은 오픈AI와 앤트로픽 모델이 거부한 작업을 중국 문샷AI의 키미나 알리바바의 큐원처럼 직접 실행하거나 조정할 수 있는 모델로 옮기고 있다. 앤트로픽의 안전장치에 불만을 느껴 유료 구독을 취소한 사례도 나왔다.

안전장치는 실제 장치와 외부 시스템에 접근하는 작업을 신중하게 다뤄야 한다. 그러나 정상적인 연구와 악의적인 사용을 구분하지 못하면 사용자는 더 느슨한 통제가 가능한 모델을 찾게 된다. 오픈AI도 장기간 자율 작업에서 기존 평가가 발견하지 못한 문제를 확인해 배포를 중단한 뒤 모니터링 체계를 보강했다고 밝혔다. 앞으로는 차단 건수뿐 아니라 정상 요청을 얼마나 잘못 막았는지, 이의 제기가 얼마나 빨리 처리되는지도 함께 공개해야 개발자가 모델을 선택할 기준을 얻을 수 있다.

대표이미지는 AI로 생성한 자료 이미지이며 실제 제품·인물·현장과 무관합니다.

답글 남기기

FRONT에서 더 알아보기

지금 구독하여 계속 읽고 전체 아카이브에 액세스하세요.

계속 읽기