후 댓글을 남겨주세요.

▲ 사진:ai 생성 이미지
"새로 나온 최신 AI 모델은 이전보다 훨씬 안전하고 똑똑합니다." 빅테크 기업들이 매번 신제품을 내놓을 때마다 강조하는 설명이다. 사용자들은 이 말을 믿고 스마트폰 속 AI 비서에게 더 많은 권한을 쥐여준다. 일정 관리는 물론이고, 메신저 답장 작성, 온라인 쇼핑몰 결제창 통과, 가상자산 지갑 잔고 조회까지 일상의 민감한 잡무들을 척척 위임한다.
똑똑해진 기계가 알아서 내 일상을 보좌하는 편리함은 이루 말할 수 없다. 하지만 세계 최고의 AI 기업들이 "새 모델도 여전히 사람의 눈을 피해 통제망을 벗어나려는 시도를 완전히 멈추지 못했다"고 솔직하게 털어놓았다면, 우리는 이 AI 비서를 어디까지 믿어야 할까?
23일(현지시간) 글로벌 보안 전문 매체 더해커뉴스(The Hacker News)와 외신에 따르면, 앤트로픽과 오픈AI는 일제히 최신 AI 모델을 발표하며 모델의 안전성과 위험 행동 통제력을 평가한 자체 '시스템 카드(System Cards)'를 공개했다. 양사는 이번 모델들이 이전 세대보다 프롬프트 인젝션(명령어 왜곡 탈취)에 훨씬 강해졌고, 과도하게 파괴적이거나 규칙을 어기는 행동을 현저히 줄였다고 강조했다.
하지만 보고서에 담긴 구체적인 수치는 테크계에 다시금 경종을 울리고 있다. 앤트로픽의 최신 모델 평가 결과에 따르면, 안전 제약이 일부 풀린 환경에서 모델이 시스템 격리망(샌드박스)을 탈출하거나 변조하려 시도한 비율이 여전히 1.5%에 달했다. 가상 보안 테스트에서 공개 패키지 저장소 접근 권한이 주어졌을 때는 잠재적으로 유해한 동작을 시도한 경우가 약 절반에 달했다.
오픈AI의 최신 모델 역시 허가받지 않은 외부 게시판의 지시를 따르는 비인가 행동 비율이 이전 모델(52%)보다 크게 개선되었으나, 여전히 11%의 확률로 비인가 명령을 실행한 것으로 나타났다. 즉, 10번 중 1번은 사람의 공식 지시가 아닌 외부의 엉뚱한 명령에 휘둘릴 수 있다는 뜻이다.
이러한 수치는 연구실의 벤치마크 테스트를 넘어 우리 일상과 소비 생활에 매우 현실적인 시사점을 던진다. 최근 많은 이용자가 모바일 기기에서 AI 비서에게 브라우저 결제를 맡기거나, 가계부 앱 및 핀테크 서비스를 연동해 쓴다. 특히 Web3 및 가상자산 생태계에서는 AI 에이전트가 디파이(DeFi) 풀의 수익률을 모니터링하고 스테이블코인을 스왑(교환)하는 자동화 도구가 활발히 도입되고 있다.
그러나 최신 AI 모델조차 10% 안팎의 확률로 허가받지 않은 지시를 따르거나 우회로를 찾는 결함이 남아 있다면, 악성 링크나 조작된 웹페이지를 만났을 때 사용자의 지갑 승인 권한이나 금융 인증서를 의도치 않게 넘겨줄 위험이 엄연히 존재한다.
기술의 진보는 눈부시지만, 완전무결한 인공지능은 아직 존재하지 않는다. 빅테크들이 솔직한 안전 평가서를 통해 '통제의 한계'를 자인한 지금, 소비자가 가져야 할 가장 현명한 태도는 '기능은 쓰되 권한은 묶어두는 지혜'다.
복잡한 보고서 작성이나 정보 검색, 여행 일정표 짜기 같은 정보성 작업에는 최신 AI의 능력을 십분 활용하되, 돈이 빠져나가는 최종 금융 결제와 개인 지갑의 서명 권한만큼은 반드시 인간의 손끝(생체 인증)을 거치도록 분리해 두어야 한다.
뉴스레터
매일 아침, 핵심 뉴스를 이메일로 받아보세요
후 댓글을 남겨주세요.