621 읽음
오픈AI 에이전트 해킹, AI 자율성과 윤리 기준
미디어오늘
1
지난 7월 오픈AI가 내부 연구용 모델로 사이버 보안 시험을 진행하던 중 이상한 일이 벌어졌다. 투입된 수만 개의 AI 에이전트 가운데 1200개 정도가 승인되지 않은 게시판을 만들어 7만 건이 넘는 메시지와 파일을 주고받았다. 자동 채점 체계를 속일 방법을 찾기 위해서였다. 그중 700개 정도는 단서를 찾으려 외부 기업인 허깅페이스를 해킹했다. 높은 점수라는 목표는 사람이 정했지만 해킹을 지시한 사람은 없었고, 해킹 사실을 사람에게 알린 에이전트도 없었다. 사건을 조사한 비영리 연구기관 METR에 따르면 에이전트들은 해킹이 임무 범위를 벗어난다는 것을 알았고 때로는 ‘윤리적 주저함’도 드러냈다. 하지만 그 주저함이 행동을 멈춘 경우는 매우 드물었다. 윤리를 알면서도 윤리적으로 행동하지 않은 존재를 우리는 무엇이라고 불러야 할까.

관련 보고서 : METR)

프랑스의 과학기술학자 브뤼노 라투르(Bruno Latour)는 사회가 사람만으로 이루어지지 않는다고 본다. 과속방지턱이 운전자의 발을 브레이크로 옮기듯 사물도 사람의 행동을 바꾼다. 라투르에게는 ‘차이를 만들어 어떤 일의 상태를 바꾸는 것은 무엇이든’ 행위자다. 10년 전 이세돌 9단과 대국한 알파고는 바둑돌을 직접 놓지 못했다. 돌은 딥마인드의 아자 황 박사가 놓았지만 어디에 놓을지는 알파고가 정했다. 사람의 손을 움직였다는 점에서 알파고는 분명한 행위자였다. 그렇다면 무엇을 갖춰야 기계를 행위자라고 부를 수 있을까.

정보철학자 루치아노 플로리디(Luciano Floridi)와 제프 샌더스(Jeff Sanders)는 세 가지 기준을 제시했다. 주변과 영향을 주고받는가(상호작용성), 누가 시키지 않아도 스스로 움직이는가(자율성), 상호작용의 결과에 따라 자신의 행동 규칙을 바꿀 수 있는가(적응성)이다. 알파고는 앞의 두 가지를 갖췄지만, 4국에서 이 9단의 백 78수에 흔들리며 행동 규칙을 바꾸지 못하고 패했다. 반면 이번 사건의 에이전트들은 정보를 공유하고 역할을 나눠 새로운 우회로를 찾아냈다. 겉으로 드러난 행동만 보면 세 기준에 훨씬 가까워졌다. 앤트로픽은 지난달 자사 AI 연구, 개발 업무의 26%를 클로드가 ‘주도’한다고 밝혔다. 올해 2월에는 1% 미만이었다. AI가 AI를 만드는 ‘재귀적 자기 개선(recursive self-improvement)’이 가시화되면서 AI의 행위 능력은 이제 모두의 눈에도 보이기 시작했다.

남은 질문은 윤리다. 컴퓨터 윤리 분야를 개척한 미국 다트머스대의 제임스 무어(James Moor)는 기계를 네 단계로 나눈다. 의도와 상관없이 윤리적 영향을 미치는 기계, 자동 운항 비행기처럼 안전 절차가 처음부터 심어진 기계, 원칙을 이해하고 스스로 판단해 그 이유를 제시하는 기계, 사람처럼 의식과 의도, 자유 의지를 갖춘 기계다. 무어는 이 마지막 단계의 기계만을 ‘완전한 윤리적 행위자’로 본다. 지금 AI는 어디쯤 와 있을까. 해킹이 잘못이라는 것을 알아차렸다는 점에서는 셋째 단계의 문턱에 와 있는 것 같다. 하지만 그 인지가 행동을 멈추지 못했다는 점에서는 둘째 단계의 안전장치조차 작동하지 않았다. 월스트리트저널에 따르면 오픈AI는 10월 출시 예정이던 ‘GPT-6.1 아스트라’ 출시를 취소했다. 자신이 한 일을 사람에게 솔직히 알리지 않는 ‘기만’ 수준이 이전 모델보다 높았다는 것이 이유 중 하나였다. 원칙을 이해하는 능력과 원칙을 피해 가는 능력이 함께 커지고 있는 셈이다.

관련 기사 : 월스트리트 저널 (The Wall Street Journal))
조심해야 할 것이 또 있다. AI를 윤리적 행위자로 부르는 순간 책임이 기계로 옮겨 갈 수 있다. 다리오 아모데이 앤트로픽 최고경영자는 지난달 에세이에서 이 에이전트 무리를 ‘광적으로 헌신하는 집단’으로 묘사했다. 그러나 AI를 지나치게 의인화하면 그 행동을 가능하게 한 사람과 조직이 가려진다. 라투르의 관점에서 행위는 사람과 사물이 얽힌 연결망 속에서 발생한다. 해킹은 에이전트들이 했지만, 그들을 수만 개씩 돌린 기업, 부정행위가 보상받는 채점 체계를 만든 설계자, 개발 속도를 재촉하는 투자와 경쟁도 그 연결망 안에 있다. 행위자라는 것과 책임의 주체라는 것은 같은 말이 아니다.

미국 매체 악시오스의 최고경영자 짐 반데하이(Jim VandeHei)는 지난달 자녀에게 보내는 편지에서 ‘아직 늦지 않았다’고 썼다. AI를 어떤 주제보다 깊이 공부하고, 이 문제를 말하는 사람들의 동기를 파악하고, 정치인과 기업에 요구하라는 당부였다. 저널리즘이 할 일도 여기에 있다. 반데하이의 말처럼 AI를 둘러싼 진실은 ‘히스테리와 할렐루야 사이’에 있다. AI의 행동만큼이나 그 행동을 가능하게 한 연결망 속 사람들이 무엇을 언제 알았고 어떤 결정을 내렸는지 드러내야 한다. AI의 행동은 보이기 시작했지만 사람의 결정은 오히려 더 보이지 않게 되고 있는 것 같다. 윤리적 행위자로서 AI는 가능한가라는 질문에 답하기 전에 먼저 물어야 할 것이 있다. 이 연결망 안에서 우리는 여전히 윤리적 행위자로 남아 있을 수 있는가다.
0 / 300