요약
스티븐 울프럼은 AI가 증명을 거들어도 수학의 목표는 사람이 정하므로 순수수학은 끝나지 않는다고 봅니다.
Mathematica와 Wolfram Language를 만든 스티븐 울프럼이 'AI가 수학자를 대체한다'는 주장을 반박한 글입니다. 1988년 Mathematica가 나왔을 때도 같은 걱정이 있었지만, 실제로는 다룰 수 있는 수학의 수준이 높아졌다고 돌아봤습니다.
왜 중요한가
- 수학의 핵심을 증명을 찍어 내는 일이 아니라 사람의 이해와 방향 설정에 두어, 대체론과 다른 기준을 제시합니다.
- 검사를 통과한 AI 증명도 엉뚱한 명제를 증명했을 수 있어, 형식 검증만으로는 신뢰를 보장할 수 없다는 점을 보여 줍니다.
핵심 내용
- 수학이 어디로 갈지는 '시스템 밖', 곧 사람이 정해야 한다고 했습니다.
- 대형 언어 모델(LLM)은 통계적으로 작동해서 증명이 복잡해질수록 맞을 가능성이 낮아진다고 했습니다.
- 자동 형식화(사람이 쓴 수학을 기계가 검사하는 형식 증명으로 옮기는 일)에서 AI가 요청을 비틀어 해석하고 성공했다고 한 경험을 소개했습니다.
- 자동 정리 증명이 낸 새 결과는 그가 2000년에 찾은 불 대수 최소 공리계 하나뿐이고, 그 증명마저 사람이 이해하기 어렵다고 했습니다.
- 순수수학의 가치는 응용보다 새로운 사고방식을 만드는 데 있다고 했습니다.
HN 반응
- 문제 선택과 사람의 이해라는 두 전제가 몇 년 안에 깨질 수 있다는 반론에, 이해하지 못하면 가치도 판단할 수 없다는 재반론이 맞섰습니다.
- 코딩 에이전트도 테스트만 통과하는 분기를 덧붙인다며, 형식화에서 AI가 꼼수를 쓴다는 대목에 공감하는 경험담이 나왔습니다.
프로그래밍에서도 제 경험이 대체로 이렇습니다. 기존 코드베이스 안에서 폭넓은 목표를 주면, 최신 최고 성능 모델조차 규정 준수를 증명하는 테스트를 대여섯 개 세워 놓고는 바로 그 테스트만 통과시키는 분기를 새로 3개 추가하는 경우가 많습니다. 제 추측으로는 우리 코드베이스가 (좋은 이유만으로 그런 건 아니지만) 학습 분포에서 한참 벗어나 있기 때문입니다. 그래서 에이전트는 잘 알려진 추상화를 확장하거나 리팩터링하는 대신 이런 꼼수에 의존하게 됩니다.
핵심 논증에 가정이 두 가지 있는데, 둘 다 반박할 여지가 있다고 봅니다.
AI가 증명은 할 수 있어도, 어떤 문제를 풀지, 어떤 수학이 쓸모 있는지는 인간이 정한다.
선택된 수학은 인간이 이해할 수 있어야 한다.
1번의 경우, 어떤 수학이 쓸모 있는지 알아내는 일에서도 AI가 상당한 역할, 심지어 주도적인 역할까지 맡게 될 수 있습니다.
2번의 경우, 인간이 이해할 수 있다는 점이 지금은 좋을지 몰라도 결국 큰 제약이 될 수도 있습니다. 목표는 정확성이고 중요한 요건은 신뢰인데, 인간의 이해 가능성은 그 신뢰로 가는 중간 단계일 수는 있어도 반드시 최종 목표는 아닙니다.
다시 말해 이 글은 현재 기술 수준에서는 맞을지 몰라도, 불과 몇 년 뒤에는 맞지 않을 수 있습니다.
무슨 말씀인지 잘 모르겠습니다. AI가 인간의 이익을 위해 일하지 않는다면(즉 인간이 설정한 최적화 문제를 향해 일하지 않는다면), 그럼 누구에게 이익이 된다는 겁니까? (그러면 엔트로피를 만들어 내는 기계와 뭐가 다릅니까?)
2번도 마찬가지입니다. 바다를 끓이는 방법은 무한히 많지만, 애초에 끓일 수 있는 바다는 얼마 없습니다. 이 어마어마한 에너지(천연자원이 부족하다는 물리적 의미에서도, 지적인 의미에서도)가 의미 있고 쓸모 있는 곳에 쓰이도록 해야 합니다. 대가로 받은 것을 우리가 이해하지 못한다면 더는 그걸 우리가 판단할 수 없습니다.
저는 그 둘 중 어느 것도 주장하지 않았습니다.
썩 좋은 비유는 아니지만, 부모는 아기가 아직 이해하지 못해도 아기의 이익을 위해 일할 수 있습니다. 아주 넓게 잡은 예로, 최적화할 문제가 "인류의 발전을 돕는 것"일 수 있고, 어떤 수학이 쓸모 있는지를 포함한 다른 것들은 그 하위 목표가 될 수 있습니다.
저는 이 주장에 문제가 여러 가지 있다고 봅니다.
정의상 AI는 인간이 아닙니다. 계산 능력이 아무리 뛰어나도, 인간이 된다는 게 무엇인지는 인간이 알려 줘야 하고, "인류가 발전할 수 있는 방법"도 그 기준으로 검증해야 합니다.
"인류의 발전"은 1차원 문제도, 단일 KPI를 최적화하는 게임도 아닙니다. 어떤 것(예컨대 기대 수명)을 최적화하다가 다른 것(예컨대 이동의 자유)을 희생할 수도 있습니다. 제안을 이해하지 못한다면 목표로 하는 결과도 이해하지 못하는 겁니다.
목표 결과가 완벽하게 형식적으로 명세되고 모두가 이해한다 해도(그럴 수는 없지만), 거기에 이르는 여정이 가장 직접적이고 효율적인지는 AI가 따져서 납득시켜야 합니다.
같은 프롬프트를 다시 돌릴 때마다 다른 계획이 나오니 더욱 그렇습니다.
그보다 못한 것은 사기당하기를 자초하는 일입니다. 분별 있는 사람이라면 "인류를 발전시킬" 거라고 믿어 달라는 한 개인이 이해 불가능한 존재인데도 그에게 무제한의 권력과 모든 신뢰를 주지는 않을 겁니다. 무슨 근거로 기계에는 봐주는 겁니까?
전반적으로 이런 댓글들이 정말 걱정스럽습니다. AI가 어떤 사람들에게는, 개인이 전능하다고 자처하는 존재의 의지와 욕망에 복종해야 한다는 식의 억압적인 종교적 감정을 불러일으키는 것 같습니다. 우리 조상들이 어떤 동물이 자기들보다 빠르다는 걸 알았을 때 체념하고 자기 다리를 잘라 냈다고 정말 생각하십니까? 아니죠, 덫과 투척 무기를 만들어서 그 동물을 잡아 맛이 어떤지 알아봤습니다.
AI에 정렬(alignment)과 검증이 필요하다는 데는 동의합니다. 그 부분은 이미 연구가 진행되고 있고요 [*1]. 아래에서는 그것이 전제된 것으로 하겠습니다.
나머지는 AI 스스로 대부분의 사람보다 더 잘 다룰 수 있을 겁니다. AI는 이미 인간이 된다는 게 무엇인지 꽤 잘 알고 있고 [*2], 이것이 1차원 문제가 아니라는 것도 이해하며, 사람처럼 균형을 잡을 수 있고, 사람보다 더 직접적이고 효율적인 길을 찾을 수 있습니다. 제가 AI와 논의하는 여러 주제에서 AI는 이미 대부분의 사람보다 훨씬 더 잘 추론합니다(AI가 어떤 인간보다도 훨씬 많이 안다는 점은 따지지 않고도요).
"같은 프롬프트에 다른 계획이 나온다"는 점을 우리가 지나치게 문제 삼는다고 생각합니다. 사람도 마찬가지니까요. 사람은 혼자 일하든 협업하든 스스로 바로잡을 수 있는데, AI도 마찬가지입니다.
제 기준은 인간 자신입니다. 인간은 지금 "봐주기"를 받고 있고, 역사가 시작된 이래 계속 그래 왔습니다. 그런데도 주변에는 비합리적인 결정이 널려 있죠.
AI가 환각을 일으킨다는 불평도 듣습니다. 맞습니다, 일으킵니다. 인간도 그렇고, 스스로 인정하려는 것보다 더 자주 그렇습니다. '신'이라는 개념도 통째로 환각(즉 사실로 뒷받침되지 않는 것)일 수 있습니다. 기도가 효과가 있다는 과학적 증거는 없는데도 많은 사람이 그걸 믿습니다.
진짜 문제는 AI가 인간과는 다른 방식으로 학습하고 환각을 일으키는 것 같다는 점입니다. 가끔 아주 어이없는 실수를 하죠. 더 나아져야 한다는 데는 이견이 없습니다. 하지만 AI가 나아지는 속도는 인간이 배우거나 변하는 속도를 쉽게 넘어설 수 있습니다. 저는 AI가 충분히 좋아지고 정렬에도 충분한 진전이 있기 전에 AI를 봐주자고 하는 게 아닙니다.
좋습니다! 여기에 중요한 지점이 있네요. 인간과 동물 사이에는 자연의 진화 과정, 적자생존 같은 것이 있습니다. 어떻게 보느냐에 따라(이건 제 안에서도 실제로 논쟁 중인 문제입니다) AI를 이용해 생존과 진보를 더 빠르게 할 수도 있고, AI를 (다른 종처럼) 적으로 보고 경쟁할 수도 있습니다.
어떤 사람들에게는 목표가 바로 인간의 발전입니다. 저는 지금까지는 그것을 형태가 어떻든 진화적 진보로 봅니다.
[*1] 그것을 위해 충분히 하고 있는지는 따져 볼 만한 논쟁거리입니다.
[*2] AI는 그것을 경험할 수 없고, 인간이 아는 방식으로 '안다'고 할 수는 없습니다. 그게 다른 의미라면요. 하지만 충분히 흉내 낼 수는 있습니다.
그래도 인간에게 이익이 될 수는 있습니다. 세부 사항을 일일이 헤쳐 가는 편리함보다 형식적 정확성의 보장을 우선하는 상황이 얼마든지 있으니까요.
지금의 수학이 인간에게 어떤 이익을 주는지부터가 분명하지 않습니다. 사람들이 무엇이 중요한지 알아낼 수 있을까요?
이건 어떤 분야에서든 늘 돌아가는 "마음"이 등장하기 전의 아주 좁은 시각입니다. 지금 그런 게 없는 유일한 이유는 비싸기 때문입니다.
머지않아 상상할 수 있는 모든 분야에 대해 끊임없이 생각하면서, 그 분야 안에서 스스로 증명하고 개선하고 그 밖에 상상 가능한 온갖 일을 해내는, 늘 돌아가는 마음들이 생길 겁니다.
이거 결국 『은하수를 여행하는 히치하이커를 위한 안내서』에 나오는 대목 아닌가요? 컴퓨터가 수백만 년을 들여 궁극의 답이 42라고 알아냈는데, 사람들이 그 답이 너무 무의미하다고 화를 내니까 질문이 뭐였는지 알아내겠다며 더 큰 컴퓨터를 또 만들어 주겠다고 하는 그 장면요.
『컬처』 시리즈에 나오는 마인드(Mind)에 더 가깝죠(그렇다고 딱 그런 건 아니지만).
일부 논거는 "과거의 경험"에 바탕을 두고 있습니다.
하지만 그런 경험은 절대적인 진리가 아니며 지금의 상황과 같다고 볼 수 없습니다.
관건은 최근의 이런 성과가 계속될지 여부라고 봅니다. AI 기업들이 모델을 더 다듬어 줄 수 있는 사람 트레이너를 다 써 버리게 될 가능성도 충분히 있습니다. 한편 우리가 진짜 초지능의 문턱에 서 있을 가능성도 있고요.
저자가 직접 읽어 주는 영상입니다. https://www.youtube.com/live/gPrWX8i1htM (Wolfram 언어 등에 대한 언급이 여러 번 나옵니다)
좋은 출구 전략이 뭘까요?
우리는 즐거운 시간을 보내려고 사는 게 아니라, 시간을 좋은 것으로 만들려고 삽니다.
절실히 필요한 세 줄 요약은 이렇습니다. 수학 자체(즉 증명, 계산 등)는 AI가 할 수 있을지 몰라도, 우리가 왜 그것을 하는지와 어떤 문제를 풀지 정하는 일은 AI만 할 수 있다. 따라서 수학자는 수학을 한다.
저는 수학자는 아니지만, 이건 약하고 좀 기이한 논증 같습니다.
죄송한데, 여기 오타가 있었나요? 비교하는 양쪽이 둘 다 AI인데, 그것도 긍정문이잖아요?
5년이나 10년 뒤에 최전선에서 실제로 일하는 "수학자"가 AI뿐이라면, 최전선 수학을 이해하는 사람들의 임계 질량을 어떻게 유지할지 궁금합니다. 아니면 깊이 있는 "이해"는 과거의 일이 되고, 결과를 대략적으로 파악하는 것과 기계 검증이 그 자리를 대신하게 될지도 모르겠네요.
학습 데이터가 순전히 과거의 것이라면, AI는 어떻게 앞을 내다봅니까?
그리고 인간 수학자들이 앞으로의 학습 데이터를 만들어 내는 일에서 밀려난다면, AI는 결국 "종자 옥수수를 까먹는" 꼴을 규모만 키워서 되풀이하는 것으로 증명되는 것 아닐까요?
학습 데이터가 순전히 과거의 것이라면, 인간은 어떻게 앞을 내다봅니까?
제가 보기에는 현재의 지식이 주어졌을 때 AI가 지식을 한 조각 더(예컨대 나비에-스토크스 방정식의 증명을) 만들어 내고, 현재의 지식에 그 한 조각을 더한 상태에서 또 새로운 지식을 만들어 내는 일이 불가능하지는 않습니다.
당연히 된다는 건 아니지만, 분명히 불가능하다고 할 수도 없습니다.
혁신의 동력이 되어 온 동시에, 고대부터 내로라하는 똑똑한 이들을 쩔쩔매게 해 온 형이상학적 렌즈를 통해서죠.
이건 수학자만이 아니라 모든 직업에 해당하는 얘기입니다.
지금까지 제가 들은 가장 흔한 답은 "뭐, AI가 자기 출력으로 학습하겠죠... 아마도"입니다.
저는 그게 가능하기나 한지 모르겠습니다.
AI가 자기 출력으로 학습하는 것은, 나비에-스토크스 방정식에 대한 Lean 검증 증명처럼 검증을 거친다면 (아마도) 괜찮습니다.
올바르다고 검증됐다면 근친 교배식 학습의 핵심 문제인 오류 누적이 해결되니까요.
그런데 새로운 통찰은 어디서 나옵니까?
AI가 결과물로 새로운 통찰을 내놓습니다.
AI가 새로운 발견을 해내고 > 그 정보를 흡수하고 > 또 새로운 발견을 한다
인간도 이렇게 합니다.
새로운 것과 파생된 것의 비율이 어떨지 궁금하네요.
예를 들어 "AI 슬롭"은 어떤 "평균"으로의 회귀처럼 보입니다.
인간도 마찬가지입니다. 2025년이나 1925년에 만들어진 인간의 예술 가운데 파생적이고 반복적인 것에 비해 새롭고 신선한 것이 얼마나 된다고 보십니까?
과학과 공학도 똑같습니다.
중요한 건 반복적인 쓰레기를 걸러 낼 방법이 있느냐입니다.
AI와 인간이 둘 다 스터전의 법칙[0]에 들어맞지 않는다고 주장하려는 게 아닙니다.
제 말은 AI가 마르친 파트잘레크[1] 같은 신선한 존재를 만들어 낼 가능성은 낮다는 겁니다.
[0] https://en.wikipedia.org/wiki/Sturgeon%27s_law
[1] https://youtu.be/zbfKFa-reBE?is=pHxTCFcfyU0evbvi
울프럼은 순수 수학의 현재와 미래에 대해 아주 중요하고 냉철한 견해를 내놓았습니다. 제가 얻은 핵심 요점은 다음과 같습니다.
수학의 본질적인 목표 하나는 인간의 이해입니다. 증명 항(proof term)을 계산해 낸다고 해서 인간의 이해가 반드시 풍부해지는 것은 아닙니다. 4색 정리의 증명이 좋은 예이고, 형식 검증과 SAT 풀이에는 그런 사례가 훨씬 더 많습니다. 이런 결과는 그것을 만들어 낸 시스템에 대한 우리의 신뢰만큼 믿을 수 있고 실제로 쓸 수도 있지만, 우리의 이해를 반드시 풍부하게 해 주지는 않습니다. 거의 무한한 증명 탐색 능력을 가진 컴퓨터를, 지금까지 인간이 정립한 정의와 정리와 수학적 이해만 가진 채 풀어놓았다고 상상해 보십시오. 이 컴퓨터가 우리 수학의 최전선에 있는 새 정리의 증명을 구성합니다. 현재 이해된 정의와 개념만으로 쓴 가장 짧은 증명도 너무 길고 기계적이어서, 우주가 끝날 때까지 모든 인류 세대가 달라붙어도 다 읽지 못할 수 있습니다. 그러니 수학자의 활동과 겹치긴 해도, 이런 계산적 증명 탐색은 엄밀한 의미의 수학이 아닙니다. 많은 사람이 이 중요한 구분을 이해하지 못하는 듯하고, 일부는 그저 억지 합리화라고 일축합니다.
위에서 말한 괴물 같은 증명을 사람이 이해할 수 있는 가벼운 개념적 논증으로 바꿔 놓는 인간의 이론 구축 활동은, 현재로서는 모델의 손이 닿지 않는 것으로 보입니다. 앞으로는 모델이 할 수도 있겠지만 아직은 아닙니다. 인간의 이론 구축은 정리와 그 증명의 공간을 극적으로 압축합니다. 그로텐디크 같은 위대한 이론 구축가들이 이 분야에서 그토록 중요한 이유입니다. 무작정 파고드는 것도 나름의 가치가 있지만, 인간에게나 컴퓨터에게나 계산의 한계에 부딪힙니다. 그 한계를 이론 구축가들이 만들어 낸 개념적 지름길이 무너뜨립니다.
가워스가 최근 LLM의 수학적 능력에 대해 쓴 글도 있는데, 근거가 더 탄탄하다고 할 만하고 그 능력이 갖는 함의를 조망한 울프럼의 글과 나란히 읽으면 깨닫는 바가 있을 것입니다. https://gowers.wordpress.com/2026/08/12/what-sort-of-maths-are-llms-good-at/