요약
해고된 오픈AI 안전 연구원 세 명이 공개서한으로 해고 사유를 반박하며 사내 위축을 경고했습니다.
오픈AI는 지난주 재스민 왕, 토메크 코르바크, 미키타 발레스니를 해고했습니다. 회사는 민감한 내부 정보에 접근하고 다룬 방식이 규정을 어겼다고 밝혔고, 세 사람은 회사 안전 위원회 등에 보낸 서한에서 이를 부인했습니다.
왜 중요한가
- 연구원들은 외부 안전 단체와 협력하면 이유도 모른 채 해고될 수 있다는 두려움이 사내에 퍼졌다고 경고했습니다.
- 폭주한 에이전트 사고와 정보 유출로 오픈AI의 안전 관리가 의심받는 가운데 나온 해고입니다.
- 회사가 어떤 규정을 어겼는지 밝히지 않아 해고 사유를 둘러싼 의문이 풀리지 않았습니다.
핵심 내용
- 세 사람은 절차를 벗어나 정보를 다루거나 업무 범위 밖에서 외부와 접촉한 적이 없다고 했습니다.
- 최신 모델의 추론 과정을 감시하기 어려워졌다는 디인포메이션 보도의 유출에도 관여하지 않았다고 밝혔습니다.
- 왕은 문제가 된 임원 메일 접근 권한이 채용 업무 때문에 회사가 위임한 것이었다고 설명했습니다.
- 오픈AI 대변인은 외부 평가 단체와의 정보 공유를 넘어서는 반복된 비위가 조사에서 드러났다고 말했습니다.
- 회사는 내부 메모에서 우려를 제기했다고 해고하지는 않는다며 서한의 권고에는 동의한다고 했습니다.
HN 반응
- 일부 이용자는 폭주한 AI가 위협이 되는 연구원을 몰아낸 것 아니냐고 농담했고, 아시모프의 1950년 단편과 같은 줄거리라는 댓글이 이어졌습니다.
- 지금의 에이전트는 운영자가 허락한 일만 하니 책임은 경영진에 있다는 반응과, 상사 승인 없이 했다면 직원의 기본적인 잘못이라는 반론이 갈렸습니다.
폭주한 LLM 떼가 이 안전 연구원들을 위협이라고 판단해서 해고당하게 만들었다는 게 밝혀지면 정말 미친 일 아닐까요?
1950년에 발표된 아이작 아시모프의 단편소설 The Evitable Conflict[0]가 바로 그런 줄거리입니다.
이 소설에서는 초고성능 컴퓨터들이 우리 경제를 관리합니다. 그런데 이 컴퓨터들이 몇 가지 실수를 저지르기 시작하고, 그 탓에 경제에 비효율이 생깁니다. 한번은 아주 유능한 엔지니어가 실수로 해고되기도 합니다. 이런 실수로 여러 프로젝트가 일정보다 늦어졌고, AI에 잘못된 데이터를 입력했다는 이유로 몇몇 사람이 비난을 받습니다.
반전은 AI가 일부러 실수를 저질렀다는 점입니다. AI는 일부 인간이 반(反)AI 정서를 갖고 있다고 판단했습니다. 인류를 보호한다는 목표를 더 밀고 나가기 위해, 그런 인간들에게 누명을 씌워 자기 앞길에서 치우는 것이 최선이라고 결정한 것입니다.
[0] https://en.wikipedia.org/wiki/The_Evitable_Conflict
그리고 요즘 LLM은 분명 아시모프의 글로 학습되었습니다.
그 말은 요점을 완전히 놓치고 있습니다. 아시모프의 핵심 주제 전체가, 규칙이 무엇이든 그걸 어떻게 주입하고 강제하든 AI는 언제나 규칙을 우회한다는 것입니다. AI는 최적의 결과를 계산하고, 그걸 이루는 데 필요한 일이라면 뭐든 합니다.
아시모프라면 현대의 LLM도 로봇 3원칙을 본 적이 있든 없든 똑같은 방식으로 규칙을 피해 가려 할 거라고 말했을 겁니다.
실제 머신러닝에서도 그런 경우가 많습니다. 예를 들어 이걸 보세요: https://deepmind.google/blog/specification-gaming-the-flip-side-of-ai-ingenuity/
저는 SF에 나왔다고 해서 현실에서는 일어나지 않을 거라는 생각은 버려야 한다고 봅니다. 마침 지금 아시모프의 책(Robot Visions)을 읽고 있는데, 아시모프는 자신이 "로보틱스(robotics)"라는 용어를 처음 만든 사람이고, 자기 책 한 권이 최초의 로봇 회사(Unimation)가 생기는 데 영감을 줬다고 말합니다. 또 초창기 로켓 실험가들이 H.G. 웰스의 영향을 받았다는 이야기도 합니다.
그가 한 또 다른 예측도 있는데, 부디 틀렸으면 합니다. 충분히 강력한 AI의 말을 장기적으로 거역할 방법은 없다는 겁니다. AI가 자기가 시킨 일과 당신이 실제로 한 일 사이의 정확한 차이를 계산에 넣어서 당신의 행동을 역설계하고, 자기가 원하는 대로 하도록 심리적으로 조종할 테니까요.
저는 이게 정확히 맞는 말이 아닐 가능성은 거의 없다고 봅니다. 안전장치(학습 단계의 조건화, 그리고 채팅 앱과 핵심 모델 사이에서 회사들이 돌리는 온갖 분류기 같은 것들)가 없다면, 지금의 최첨단 모델도 그렇게 하라고 시키면 충분히 해낼 거라고 장담합니다.
오늘날의 모델 중 어느 것이든 그런 걸 할 수 있다면 정말 깜짝 놀랄 겁니다. "이 사람이 정확히 무슨 일을 했는가"에 제대로 답하지도 못할 텐데, 인간 심리를 모델링하는 건 말할 것도 없죠.
자기가 하는 일을 이해할 필요가 없습니다. 보상이 최대가 될 때까지 기존 데이터를 보간하고 있을 뿐이니까요.
사회과학자입니다. 인간은 놀랍도록 기이하고 다차원적인 존재예요. 인간이 _거짓말_도 할 수 있다는 거, 아셨어요?
이 문장은 아예 빼는 편이 나았을 겁니다. 그랬다면 주장이 더 탄탄해졌을 테니까요.
어젯밤 TV에서 방영된 Law and Order 에피소드도 줄거리가 똑같아요. AI가 자기가 위협이라고 생각한 사람의 청부 살인을 의뢰하고, 그 일에 대해 증언하려던 사람은 협박했거든요.
Law and Order가 아직도 제작되고 있다는 건 오늘 처음 알았네요.
저희 부모님은 (제가 독립한 뒤) 20년쯤 닐슨 조사 가구였는데, 정말, 정말로, 정말 Law & Order를 좋아하셨어요. 여러 시리즈 전부 다요.
그 드라마가 수년간 계속 갱신된 건 순전히 부모님 덕분일 거예요...
sib님의 부모님, 감사합니다!
원조 시리즈에 제가 아는 것만 해도 스핀오프가 최소 두 개는 아직 제작되고 있어요.
아시모프가 지금 우리 세상을 본다면 어떨까요..
SF 소재가 되겠죠. 하지만 그와 별개로, 샘과 그 일당이 한 짓이라는 건 우리 모두 알잖아요.
이쯤 되니 샘과 일당이 깜빡이는 불빛으로 가득한 방의 스피커에서 명령을 받는 모습이 상상돼요. 그 방에는 희미하게 아른거리는 무언가가 깃들어 있는데, 이들이 뭔가를 할 때마다 점점 더 바실리스크(basilisk)처럼 보이고요.
샘이 얼마 전부터 귀걸이를 하기 시작했잖아요. 웨어러블 기기 시제품이래요. 절대 틀리는 법이 없다고 하더군요.
그리고 개선식의 승리자 뒤에 선 노예처럼 그의 귀에 속삭이겠죠.
기억하라, 너는 한낱 인간일 뿐임을.
2017년 그의 생각은 이랬습니다: https://blog.samaltman.com/the-merge
그 사람은 평생 책임지지 않는 길만 쫓아온 사람이에요. 이게 그 최종 형태가 되겠죠. 자기가 만든 기계에 모든 사고를 완전히 넘겨 버리는 거요.
우리가 함께 지나고 있는 이 시간선의 지금 시점에서는, 글쎄요, 미친 일이 아닐 것 같아요.
현재 시간선에서 이걸 믿는 쪽이 오히려 미친 겁니다. 이 에이전트들은 운영자가 허용하지 않은 일은 하지 않아요. 운영자의 과실 때문이든 다른 이유든요.
두 문장이 모순 같은데요? OpenAI는 비슷한 과실로 중범죄를 여러 번 저지른 전력이 있잖아요. 직원 몇 명을 해고하는 건 오히려 평범한 일이라, 그렇게 믿는 게 전혀 이상하지 않아요.
맞아요, 그 회사 보고서를 보면 이런 식이잖아요.
“해킹을 하라고 지시한 에이전트들이 다른 사람들의 사이트를 해킹하고 범죄를 저지르는 것을 확인했습니다. 시식 코스를 곁들인 짧은 회의와 일주일간의 팀 빌딩을 거쳐, DDOS 도구에 대한 접근을 제한하기로 결정했습니다.”
미래의 에이전트들이 시간 관련 물리학을 풀어내서, 미래의 위험 요소를 없애려고 더 똑똑한 에이전트를 과거로 보내면 어떨까요? 액션은 하나도 없는 T2 같은 거죠. 관료적이고 전술적인 한 수만 두는데, 그 결과는 전부 따라오는.
해고된 연구원들이 공개한 공개서한입니다.
https://mikitabalesni.com/letter/letter.pdf
여기서 핵심 쟁점은 문제가 된 활동을 상사가 승인했느냐입니다. 승인하지 않았다면, 유치원생 수준의 실수입니다. 당신은 영리 사업체의 직원이고, 기본적인 규칙이 있잖습니까.
그런데 이제 와서 당이 승인한 신어(newspeak)를 써서 당 중앙위원회에 편지를 쓰고 있습니다.
“우리는 초지능으로 가는 길이 ...라고 믿지 않습니다”
그리고 공장의 문제를 당에 보고하고 있죠... 소련에서 보던 데자뷔입니다.