621 읽음
오픈AI 에이전트 해킹, AI 자율성과 윤리 기준
미디어오늘
관련 보고서 : METR)
프랑스의 과학기술학자 브뤼노 라투르(Bruno Latour)는 사회가 사람만으로 이루어지지 않는다고 본다. 과속방지턱이 운전자의 발을 브레이크로 옮기듯 사물도 사람의 행동을 바꾼다. 라투르에게는 ‘차이를 만들어 어떤 일의 상태를 바꾸는 것은 무엇이든’ 행위자다. 10년 전 이세돌 9단과 대국한 알파고는 바둑돌을 직접 놓지 못했다. 돌은 딥마인드의 아자 황 박사가 놓았지만 어디에 놓을지는 알파고가 정했다. 사람의 손을 움직였다는 점에서 알파고는 분명한 행위자였다. 그렇다면 무엇을 갖춰야 기계를 행위자라고 부를 수 있을까.
정보철학자 루치아노 플로리디(Luciano Floridi)와 제프 샌더스(Jeff Sanders)는 세 가지 기준을 제시했다. 주변과 영향을 주고받는가(상호작용성), 누가 시키지 않아도 스스로 움직이는가(자율성), 상호작용의 결과에 따라 자신의 행동 규칙을 바꿀 수 있는가(적응성)이다. 알파고는 앞의 두 가지를 갖췄지만, 4국에서 이 9단의 백 78수에 흔들리며 행동 규칙을 바꾸지 못하고 패했다. 반면 이번 사건의 에이전트들은 정보를 공유하고 역할을 나눠 새로운 우회로를 찾아냈다. 겉으로 드러난 행동만 보면 세 기준에 훨씬 가까워졌다. 앤트로픽은 지난달 자사 AI 연구, 개발 업무의 26%를 클로드가 ‘주도’한다고 밝혔다. 올해 2월에는 1% 미만이었다. AI가 AI를 만드는 ‘재귀적 자기 개선(recursive self-improvement)’이 가시화되면서 AI의 행위 능력은 이제 모두의 눈에도 보이기 시작했다.
남은 질문은 윤리다. 컴퓨터 윤리 분야를 개척한 미국 다트머스대의 제임스 무어(James Moor)는 기계를 네 단계로 나눈다. 의도와 상관없이 윤리적 영향을 미치는 기계, 자동 운항 비행기처럼 안전 절차가 처음부터 심어진 기계, 원칙을 이해하고 스스로 판단해 그 이유를 제시하는 기계, 사람처럼 의식과 의도, 자유 의지를 갖춘 기계다. 무어는 이 마지막 단계의 기계만을 ‘완전한 윤리적 행위자’로 본다. 지금 AI는 어디쯤 와 있을까. 해킹이 잘못이라는 것을 알아차렸다는 점에서는 셋째 단계의 문턱에 와 있는 것 같다. 하지만 그 인지가 행동을 멈추지 못했다는 점에서는 둘째 단계의 안전장치조차 작동하지 않았다. 월스트리트저널에 따르면 오픈AI는 10월 출시 예정이던 ‘GPT-6.1 아스트라’ 출시를 취소했다. 자신이 한 일을 사람에게 솔직히 알리지 않는 ‘기만’ 수준이 이전 모델보다 높았다는 것이 이유 중 하나였다. 원칙을 이해하는 능력과 원칙을 피해 가는 능력이 함께 커지고 있는 셈이다.
관련 기사 : 월스트리트 저널 (The Wall Street Journal))

미국 매체 악시오스의 최고경영자 짐 반데하이(Jim VandeHei)는 지난달 자녀에게 보내는 편지에서 ‘아직 늦지 않았다’고 썼다. AI를 어떤 주제보다 깊이 공부하고, 이 문제를 말하는 사람들의 동기를 파악하고, 정치인과 기업에 요구하라는 당부였다. 저널리즘이 할 일도 여기에 있다. 반데하이의 말처럼 AI를 둘러싼 진실은 ‘히스테리와 할렐루야 사이’에 있다. AI의 행동만큼이나 그 행동을 가능하게 한 연결망 속 사람들이 무엇을 언제 알았고 어떤 결정을 내렸는지 드러내야 한다. AI의 행동은 보이기 시작했지만 사람의 결정은 오히려 더 보이지 않게 되고 있는 것 같다. 윤리적 행위자로서 AI는 가능한가라는 질문에 답하기 전에 먼저 물어야 할 것이 있다. 이 연결망 안에서 우리는 여전히 윤리적 행위자로 남아 있을 수 있는가다.