요약
오픈AI가 내부 최첨단 모델이 미해결 수학 문제에서 얻은 결과를 GitHub에 대거 공개했습니다.
오픈AI는 아직 출시하지 않은 내부 모델에 연구 수준의 미해결 문제를 풀게 한 결과를 10월 6일 공개했습니다. 공개 방식은 고등연구소(IAS)의 독립 자문단인 '수학과 AI 자문 그룹'과 상의해 정했다고 밝혔습니다.
왜 중요한가
- 오픈AI는 기존 수학 평가가 더는 변별력이 없어 미해결 연구 문제로 평가를 넓혔다고 밝혔습니다.
- 원고와 함께 컴퓨터 검증 증명, 계산량, 시도한 문제 수까지 공개해 결과를 외부에서 따져 볼 수 있게 했습니다.
- 다만 결과를 낸 모델은 비공개여서 외부 연구자가 같은 방식으로 재현할 수는 없습니다.
핵심 내용
- 저장소에는 원고 722편이 372개 묶음(같은 결과를 다룬 논문 모음)으로 정리돼 있습니다.
- 모델에 약 4,000개 문제를 냈고, 결과 하나에 평균 ChatGPT Pro 약 3시간 분량의 계산을 썼습니다.
- 많은 증명을 Lean(컴퓨터가 증명을 검사하는 언어)으로 옮겼지만, 그러지 못한 결과는 오류가 있을 수 있다고 인정했습니다.
- π의 무리수 지수, 말러 추측 등 10개 결과에는 모델의 추론 과정 요약을 붙였습니다.
- AI가 낸 주요 결과를 이해하기 위한 워크숍과 학회를 지원하고, 모델도 책임 있게 출시하겠다고 했습니다.
HN 반응
- 24년간 바넷 추측을 붙든 이용자의 허탈한 고백에 이어, 비공개 모델이라 재현할 수 없고 힘이 소수 기업에 쏠린다는 우려가 이어졌습니다.
- 비공개 모델로 고난도 수학 문제를 시험하지 말라는 자문단 권고를 두고, 수학 공동체를 존중하라는 쪽과 결과가 더 중요하다는 쪽이 맞섰습니다.
저는 오래전에 그래프 이론에 푹 빠져 있던 사람이고, 거장들 곁에서 공부하려고 한동안 부다페스트에서 살기도 했습니다. 거기 있는 동안 바넷 추측(Barnette's Conjecture)을 붙들기 시작했는데, 이후 24년 동안 여러 분야에서 일하면서도 이 문제가 계속 머릿속을 떠나지 않았습니다. 띄엄띄엄이긴 했지만요. 작년 여름에는 며칠간 정말로 풀었다고 생각한 적도 있습니다.
그런데 여기서 180번 문제로 증명되었다고 합니다. 뭐라고 해야 할지 모르겠습니다. 저는 그 문제에 수천 시간을 쏟았고, 정말 즐겁게 매달렸습니다. 그게 풀렸다는 소식을 들으니 아득한 곳에서 슬픔이 밀려옵니다. 헤어진 옛 여자친구가 갑자기 교통사고로 죽었다는 소식을 들은 것 같은 기분입니다. 잘 모르겠습니다. 오늘 밤 묘한 감정을 느끼는 사람이 꽤 많을 겁니다.
이 건은 Lean 증명이 없어서 논문을 차근차근 읽고 있습니다. 겉보기에는 제가 24년 전에 생각했다가 포기한 접근법처럼 보입니다.
지난번에 놀라운 증명들이 쏟아져 나왔을 때 이번 여름에 이 문제와 제가 갖고 있던 부분 해법들을 다시 들여다봤습니다. Fable과 몇 시간 작업해 보고 나서 아직은 풀 수 없는 문제라고 확신했고, 이 문제가 얼마나 어려운지를 새삼 실감했습니다.
이 대목이 이 모든 일 중에서 제게 가장 묘한 기분이 들게 합니다. 이런 경험을 한 사람이 당신만이 아니거든요. 저도 다른 문제들로 같은 경험을 했고, 여러 분야의 수많은 연구자도 마찬가지입니다.
저는 필즈상 수상자들의 불만 대부분에는 동의하지 않습니다. AI 수학은 이미 벌어지고 있는 일이고 되돌릴 수 없습니다. 다만 한 가지에는 점점 더 동의하게 됩니다. 이런 일은 보통 시민이 접할 수 있는 기술로는 사실상 하나도 할 수 없다는 점입니다. AI 모델이 수학이나 과학에서 혁명적인 진전을 이루는 것 자체는 문제없다고 봅니다. 제가 문제를 느끼기 시작하는 지점은, 그런 진전을 이루는 AI 모델이 철저히 비공개 독점 상태이고, 그 능력을 온전히 갖춘 채로 공개된 적이 없어 보인다는 것입니다. 2026년 내내 계속 그래 왔습니다.
사실 이게 불안감의 상당 부분이 나오는 원천이라고 생각합니다. 이 진전 중 어느 것도 오픈AI와 앤트로픽 안의 한두 팀 밖에서는 재현할 수 없습니다. 우리가 전에 본 적 없을 만큼 엄청난 힘의 집중이 일어나고 있는 겁니다. 지금은 (아직) 어디에도 쓸모가 없는 난해한 수학 문제에나 쓰이고 있으니 무해해 보입니다. 하지만 큰 힘은 결코 무해한 채로 남지 않습니다. 역사가 수없이 많은 형태로 거듭 가르쳐 준 사실입니다.
무슨 숨은 동기라도 되는 것처럼 왜 "생각한다"고 하시나요? 자문단 성명서(오픈AI 글에서 링크된 것)의 첫 문단에 이렇게 나와 있는데요.
타오를 비롯한 그 그룹 사람들은 처음부터 AI에 강하게, 공개적으로 찬성해 온 사람들입니다. 이들은 "되돌리자"고 주장하는 게 아닙니다. 독점 기술로 미해결 문제를 싹쓸이하듯 채굴하는 것에 반대하는 겁니다.
이 논쟁을 자세히 따라가지는 못했는데, "미해결 문제를 싹쓸이 채굴한다"는 게 뭐가 문제인가요? 흥미로운 수학 문제는 (이론상) 얼마든지 계속 나오지 않나요?
타오의 논거는 여기서 볼 수 있습니다: https://mathstodon.xyz/@tao/117237320796901560
문제의 공급량은 정말 아주 많을 수 있지만, 그중 흥미로운 부분집합은 그렇지 않다는 주장입니다. 흥미로운 문제를 찾아내는 일 자체가 어려워서, 이미 알려진 좋은 문제를 싹쓸이하면 고갈될 수 있다는 거죠. 저는 수학자가 아니라서 이게 얼마나 정확한지는 판단하지 못하겠습니다.
잘은 모르겠지만 이 표현은 텃세처럼 들리네요.
아니에요. 의도가 중요하잖아요.
아주 수준 높은 십자말풀이 동호회가 있다고 해 보세요. 누구나 들어와서 퍼즐 푸는 재미로 도전할 수 있는 곳이요. 이 퍼즐 중에는 너무 어려워서 아직 아무도 못 푼 것도 많지만, 풀 수 있는 문제라는 건 다들 알고 있어요.
어느 날 누군가 초고성능 십자말풀이 풀이 프로그램을 들고 와서 이 퍼즐을 손쉽게 풀어 버립니다. 얼마나 강력한지 보여 주려고 몇 개에 돌려 본 거죠. 그러자 동호회 사람들이 이렇게 말해요. "우와, 대단하네요. 그런데 우리 고난도 퍼즐에는 더 돌리지 말아 주세요. 만들기도 정말 어렵고, 우리는 손으로 푸는 게 정말 좋거든요."
이 상황이 딱 그것과 같아요. 저는 그걸 텃세라고 부르진 않겠어요. 그냥 존중이죠. 게임에 대한 존중, 이 어려운 문제들을 계속 손으로 풀고 싶어 하는 사람들의 바람에 대한 존중이요.
그런데도 초고성능 풀이 프로그램을 가진 회사가 계속 그걸 돌려서 결과를 발표한다면, 사실상 이 커뮤니티에서 십자말풀이를 훔쳐 가는 거예요. 머지않아 퍼즐이 전부 풀려 버려서, 사람들이 재미로 매달릴 문제가 하나도 남지 않을 거고요.
이게 저한테는 텃세로 들리지 않아요. 그냥 "남은 퍼즐은 우리가 손으로 풀 수 있게 예의 좀 지켜 주세요"라고 부탁하는 거잖아요. 못된 놈처럼 굴지 말아 달라는 소박한 호소요.
우리는 수학자들에게 재미로 십자말풀이나 하라고 연구직을 주는 게 아닙니다. 그 대가로 얻는 게 있어야 합니다. 우리 문명을 발전시킬 이론과 결과 말입니다.
주된 비판의 요점을 놓치고 계신 것 같습니다. 증명이라는 결과물을 원하지 않는다는 이야기가 아닙니다.
새로운 이론과 통찰은 대개 증명을 풀어 나가는 과정에서 만들어집니다. 이제 증명이 (LLM이 만들어 주니까) 갑자기 하늘에서 뚝 떨어지게 되면 그 작업이 이루어지지 않고, 그러면 새로운 이론과 질문과 추측이 자라나던 토양이 사라집니다. 수학계가(그리고 그를 통해 사회 전체가) 잃는 것은 바로 그런 의미에서입니다.
소프트웨어 엔지니어링이 다음 세대를 어떻게 키울지 해법을 찾아야 하는 것과 비슷합니다. 지금 세대는 모두 처음부터 직접 설계하고 손으로 코드를 짜는 과정을 거쳤습니다. 그래서 10배 엔지니어들이 자기 LLM 도구가 하는 일이 괜찮은지 판단할 수 있고, 그 도구가 올바른 일을 하도록 다듬을 줄도 압니다. LLM으로만 코드를 짜고 아키텍처를 만들어 본 주니어 엔지니어는 그런 경험이 없을 뿐 아니라 앞으로도 쌓지 못합니다. "우리는 재미로 배우라고 돈을 주는 게 아니라 결과물을 만들라고 주는 것"이라고 말해 버리면 안 됩니다. 단기적으로는 맞는 말이지만, 장기적으로는 회사로서도, 공동체로서도 손해를 보게 됩니다.
AI 도구를 쓰지 말자는 게 아닙니다. 이건 우리가 아직 해법과 접근법을 찾지 못한 어려운 문제라는 말입니다. 소프트웨어 업계에도, 사회 전체에도 마찬가지고요.
정말 혼란스러운 시각이네요.
수학의 미해결 문제를 풀 수 있는 사람이 있으면 풀어야 하는 거 아닌가요? 그렇게 간단한 얘기잖아요.
일반 사람들도 모델을 쓸 수 있게 해 줘야 하는 건 맞지만, 그럴 도덕적 의무까지는 없다고 봐요.
그런데 문제 푸는 걸 그만하라고 요구하는 건 그냥 이상해요.
이 비유는 어이가 없네요. (a) 수학은 주로 오락을 위한 게 아니고, (b) 수학 증명이 바닥날 일은 없고, (c) 결과는 다른 결과 위에 쌓이는 거라서 증명된 결과가 많아질수록 수학 전체가 더 강력하고 쓸모 있어지니까요.
음, 그런데 수학의 경우는 일부가 "그냥 퍼즐"이더라도 처음엔 뻔히 안 보여도 결국 실용적인 응용이 생기는 경우가 많잖아요. 정수론은 몇백 년 동안 실용적 응용이 없는 순수수학의 대명사로 여겨졌는데, 지금 우리 현대 사회가 그 위에 세워져 있어요(공개 키 암호).
어떻게 포장해도 텃세 부리는 못된 놈들처럼 들릴 수밖에 없어요.
수학은 학계의 소유물이 아닙니다. 우리는 그들에게 재미로 문제를 풀라고 돈을 주지 않습니다. 그들은 자기가 제공하는 가치가 어디에 있는지 다시 따져 봐야 할 겁니다. 이제 문제를 푸는 일은 아닐 겁니다. 적어도 AI가 그것까지 잘하게 되기 전까지는, 문제를 다른 사람이 이해할 수 있게 풀어 주는 일이 되기를 바랍니다.
미안하지만, 수학자들이 퍼즐 동호회가 재밌어서 이 일을 하는 거라면 그냥 빌어먹을 퍼즐 동호회에나 가입하고 과학 발전을 가로막지 말아야죠.
과학은 수동적으로 시간이나 때우는 일이 아니에요. 멋진 문제를 다 풀어 버리면 남들한테 불공평하다고 스스로 손발을 묶어 두는 게 과학이어선 안 되죠. 적어도 그래선 안 되는 거고요.
과학이라는 게 트위드 정장에 가죽 팔꿈치 덧대고 시계 초침 소리나 들으면서 십자말풀이 하는 거라면, 오히려 AI한테 일을 맡기고 슬리퍼 신고 스도쿠 책이나 푸시라는 얘기의 근거가 되는 셈이에요.
전형적인 정렬 문제(alignment problem)네요.
오픈AI 안에서 스스로를 나쁜 놈이라고 생각하는 사람은 아무도 없는데도, 사회가 오픈AI에게 못된 짓 하지 말라고 촉구하는데도, 목표가 뭐든 그걸 이루는 데 못된 놈이 될 필요는 전혀 없는데도, 오픈AI 사람들이 다들 "우리는 나쁜 놈이 아니다!"라고 큰소리치는데도요.
그래도 이 사람들은 나쁜 놈들이에요.
기술을 독점으로 묶어 두고 내부 팀만 이런 문제에 쓸 수 있게 하는 것, 그게 바로 텃세의 정의 그 자체입니다.
텃세인 건 "독점"이라는 부분이라고 확신해요.
오히려 "우리 취미, 우리 직업 분야를 함부로 박살 내지 말아 달라"는 얘기에 가까워요. 우리가 조금도 참여하지 못하게 해 놓고요.
제 머릿속 그림은 이래요. 오픈AI가 가장 앞선 모델을 루프로 돌려서 찾을 수 있는 수학 미해결 문제를 전부 훑는 거예요. 모델이 정말 똑똑한지 확인하려고요. 회사도 모델도 그 문제들에는 사실 관심이 없어요. 그냥 값싼 운동기구일 뿐인데, 문제는 풀려 버리고 수학자들은 참여조차 못 하죠.
"켄타우로스" 사고방식, 그러니까 인간과 기계의 협업을 받아들인 사람들조차 득을 못 봅니다. 쓸 만한 모델이 손에 들어올 때쯤이면 이미 다 끝나 있을 테니까요.
무엇보다 이건 감정의 문제예요. 그 일을 아끼는 사람들은 그 일을 할 수 없게 되는데, 이미 그 일에 눈곱만큼도 관심 없는 쪽이 다 해치웠으니까요.
그리고 누가 "불쌍한 수학자들" 어쩌고 하기 전에 생각해 볼 거리가 있어요. 이건 우리 모두가 맞이할 운명의 초기 사례일 뿐인 것 같거든요.
전에도 여기서 말했지만, AI와 로봇공학 발전의 경제성을 보면 자연스러운 분업이 뭔지는 뻔해요. 컴퓨터는 생각을 하고, 인간은 허드렛일과 육체노동을 하는 거죠. 정치와 철학은 AI가 할 테니, 여러분은 빨래 개고 변기 닦을 시간이 더 생길 거예요.
그러면 수학이 뭔가요? 체스나 스도쿠 같은 재미있는 취미인가요?
모델이 이런저런 질병을 치료해 낸다면 의학 연구자들한테서도 똑같은 반발이 나올까요?
자기 일에 정서적으로 애착이 있고 마음이 아프다는 건 충분히 이해하지만, 수학은 그들의 즐거움을 위해 존재하는 게 아닙니다. 인류의 문제를 해결할 도구를 제공하기 위해 존재하는 거죠.
하하. 임상시험이라는 절차만 지켜진다면 불평할 사람은 별로 없을 거예요.
진전을 이루는 데 필요한 피드백 루프가 의학과 수학은 완전히 다르거든요.
임상시험 절차 자체가 해자(moat)예요. 이미 창업자들이 AI를 이용해 자기 암을 치료하고 있는데, 전부 임상시험을 건너뛰고 곧장 "동의합니다, 제가 비용 대겠습니다, 해 봅시다"로 가는 거예요. 일반 대중은 10년 뒤에나 이걸 접할 수 있겠지만, AI 회사 직원들은 훨씬 더 빨리 쓸 수 있을 거예요.
https://sytse.com/cancer/
성공률은 어떤가요?
예시의 기술적 세부 사항을 파고든다고 해서 "수학의 목적이 뭔가? 답을 찾는 것인가, 취미인가?"라는 질문이 없어지진 않습니다.
"둘 다"라고 답하고 싶어지겠지만, 그러면 AI가 이제 우리에게 둘 중 하나를 고르도록 강요하고 있다는 점을 놓치게 됩니다.
저는 단연 둘 다라고 말하겠어요. 그리고 AI 능력이 올라갈수록 문화적인 측면을 지켜 나가는 일이 점점 더 중요해지고 있고요.
형편이 어려운 아이들이 이제 다들 ChatGPT 8 인스턴스에 백 시간만 쏟아부으면 큰 난제를 풀 수 있게 된 것도 아니잖아요.
회사들이 그렇다는 말씀이죠?
지금은 이런 힘의 격차가 무해해 보인다고 생각하지만, NSA, CIA 같은 곳은 최신 최고 성능의 제한 없는 모델과 막대한 컴퓨팅 자원을 이미 쓰고 있을 거라는 데 돈을 걸겠습니다. 적어도 오픈AI는 확실히 그렇고, 앤트로픽은 자발적이지 않더라도 NSA가 접근하고 있을 거라는 데 돈을 걸겠어요. (결국 구글이 HTTPS로 옮기기로 하자 NSA는 도청을 유지하려고 구글 내부망을 해킹하기로 했으니까요.)
그 사람들이 뭘 꾸미고 있는지 누가 알겠어요.
이와 관련해서 궁금했던 게 하나 있습니다. NSA가 새로운 수학 5000단위를 알아내는 동안 일반 대중은 4000단위를 알아내면 어떻게 될까 하는 점입니다.
과거에도 여러 시기에 이런 일이 어느 정도 있었습니다. 그쪽이 수학자를 워낙 많이 고용하거나 지원했고, 특히 1970년대 후반 이전에는 학계 수학자들이 전혀 손대지 않던 분야에서 많은 수학자가 일하고 있었기 때문에, 대중보다 더 많은 수학을, 아니면 적어도 자기들이 특히 중요하게 여기는 수학을 더 많이 알아 갔습니다. (며칠 전에 NSA가 오랫동안 "기밀 수학 도서관(Classified Mathematics Library)"을 운영해 왔다는 이야기를 여기에 적으려던 참이었습니다.)
취약점 스캔의 경우에는 새로운 역량이 늘어나는 궤적이 좋다고 생각합니다("방어자가 이기는 데 도움이 된다"는 의미에서요). 정부가 더 많이 확보할 방법을 찾더라도 마찬가지입니다. 버그와 버그의 유형은 유한하니까, 어느 시점부터는 더 유능한 모델이나 더 긴 실행이 덜 유능한 모델이나 더 짧은 실행에 대해 갖는 우위가 자금이 부족한 방어자들을 앞서는 데 더는 보탬이 되지 않을 겁니다. 방어자들도 성공적인 방어에 관련된 정보 대부분은 여전히 익히게 될 테니까요.
그러니 NSA가 취약점 스캔 5000단위를 얻고 대중은 4000단위만 얻더라도, 순수한 소프트웨어 취약점은 전부 쓸어버리고 나서 물리적 공급망 보안이나 사이드 채널 같은 걱정으로 돌아가게 될 수도 있습니다.
수학의 경우는 잘 모르겠습니다! 우선 기반 수학을 이해하고 있어도 현실적으로 배치할 수 있는 방어책이 아예 없는 경우가 있을 수 있습니다(특히 트래픽 분석이 걱정됩니다. 트래픽 분석이 어떻게 이루어지는지, 특정 기법이 얼마나 강력한지 자세히 이해한다고 해서 그에 대한 방어가 늘, 혹은 보통 더 편해지거나 비용이 줄어드는 것은 아니니까요). SF에 가까운 시나리오로는, P=NP인데 지수와 상수 계수가 상당히 작은 경우처럼 어떤 종류의 효율적이고 안전한 암호 기본 요소(cryptographic primitive)가 아예 존재하지 않을 수도 있습니다.
NSA, CIA 같은 이른바 쓰리 레터(three-letter) 기관들이 이 모델에 접근하지 못한다면, 그건 국가의 완전한 실패이고 솔직히 대놓고 무책임한 일이라고 생각합니다. 저는 미국 국적도 아니고 미국에 살지도 않는데도 그렇습니다. 그냥 상식입니다. 국가안보 사안이니 당연히 공개 정보는 아니겠지만, 국가안보 역사상 가장 손쉽게 얻을 수 있는 비대칭 우위입니다.