요약
AI로 400년 치 기록을 뒤져 잊힌 운석 기록과 사라진 코뿔소, 목록에 없던 화산 분화를 찾았습니다.
역사학자가 아닌 소프트웨어 엔지니어 제시 웨이츠의 글입니다. 역사학자 벤저민 브린이 AI로 네덜란드 동인도회사 문서에서 도도새 목격담을 새로 찾았다는 글을 보고 같은 방식을 직접 시도했습니다.
왜 중요한가
- 혼자 읽으면 70년쯤 걸릴 동인도회사 문서를 하룻밤 12시간 만에 훑었습니다.
- 작성자는 작업 방식을 Antiquity라는 도구로 공개해 코딩 에이전트만 있으면 누구나 비슷한 조사를 할 수 있게 했습니다.
- 다만 찾은 것들은 아직 전문가 검토를 거치지 않은 후보입니다. AI가 분화를 엉뚱한 화산에 붙인 실수도 있었습니다.
핵심 내용
- 1812년 인도 마하라슈트라에 돌이 떨어졌다는 영국 장교의 편지를 찾았고, 이 지역 최초 기록보다 26년 앞선다고 했습니다.
- 1738~1740년 동인도회사가 실론(지금의 스리랑카)으로 보낸 자바코뿔소 세 마리가 모두 죽은 기록을 찾았습니다.
- 스미스소니언 화산 목록에 없는 자바섬과 할마헤라섬의 분화 세 건(1712, 1722, 1780년)을 찾았습니다.
- 문서 약 435만 쪽을 임베딩(철자 대신 뜻으로 찾게 하는 변환)으로 걸렀고, Claude Haiku가 번역과 정리를 맡았습니다.
- 새것을 찾기 전에 1783년 라키 화산 분화처럼 이미 알려진 사건을 먼저 찾아내게 해 방법을 검증했습니다.
HN 반응
- AI가 대신 읽었으니 작성자가 배운 것은 거의 없을 것이라는 비판에, 어차피 읽지 않았을 지루한 자료라는 반론이 맞섰습니다.
- 회전하는 코뿔소와 떨어지는 운석 같은 화면 효과가 글을 가린다는 불만과 재미있었다는 반응이 엇갈렸습니다.
네덜란드 동인도회사 문서만 내가 직접 읽는다고 치면, 한 페이지에 2분씩, 하루 8시간, 주 5일로 약 70년이 걸린다. 신문은 따지지도 않은 계산이다. 내 자작 AI 연구실은 그 아카이브 전체를 12시간짜리 밤샘 작업 한 번에 끝냈다.
글쓴이 본인은 정작 네덜란드 동인도회사에 대해 얼마나 알게 됐을지 궁금합니다. 아는 게 있다 해도 거의 없을 것 같아요. 이런 작업을 보면 정크푸드가 떠오릅니다. 칼로리만 높고 속은 빈 것 말이죠.
적어도 아무것도 안 읽었을 때보다는 훨씬 많이 알게 됐겠죠. 그 문서 대부분은 가치도 거의 없는 지루한 막노동일 테니까요.
아카이브잖아요. 가치를 알아내기 전까지는 전부 "지루한 막노동"이에요.
가치를 알아낸다는 건 때로 뭔가가 눈에 띌 때까지, 그러니까 어떤 패턴이나 여기저기 흩어진 단서가 보일 때까지 계속 읽는다는 뜻이기도 하고요.
이 사람이 그렇게 안 했다면 네덜란드 동인도회사에 대해 정말정말 많이 배웠을 거라고 확신합니다.
정크푸드도 정크보다 푸드 쪽이 더 크고, 그것만 먹고도 몇 년은 살 수 있다는 걸 기억하세요.
아마 많이 배웠을 겁니다. 저는 지난 2년 동안 LLM 덕분에 이전에는 상상도 못 했을 만큼 다양한 분야를 배웠습니다.
댓글 기록을 보면 오랫동안 똑똑했던 사람들인데, 왜 LLM을 반대할 때는 항상 이렇게 허약한 논리와 억지 합리화만 들고 나오는 걸까요? 저는 이런 걸 보면 점점 극단적으로 변합니다. 데이터센터가 어디에나 있었으면 좋겠고, 토큰이 전기나 수돗물만큼 싸졌으면 좋겠습니다.
"토큰이 전기나 수돗물만큼 싸진다"면 어떤 일이 벌어질 것 같습니까? 똑똑하면서 현실을 외면하지 않는 사람들은 그 파장을 봅니다. 돈 있는 사람들이 기계 지능을 아주 싸게 살 수 있는데 굳이 사람에게 돈을 주고 지능을 쓸 이유가 있습니까?
똑똑한 사람들은 마침내 지능을 쓰지 않는 일자리를 얻게 되거나, 최저임금 수준의 기본소득(운이 좋다면 말이죠)으로 겨우 먹고살며 놀게 되겠죠.
지금 사람이 하는 모든 인지 작업을 거의 공짜로 할 수 있게 된다면, 전 세계의 물질적 풍요는 정말 유례가 없고 거의 무한에 가까울 겁니다.
사람이 필요 없어진 세상에 대해 걱정되는 점이 많기는 합니다. 하지만 그런 세상을 "겨우 먹고사는" 세상이라고 부를 수는 없습니다.
토큰 가격이 그대로여도 곧 전기만큼 싸질지도 몰라요.
아, 그 유명한 바꿔치기 수법이네요!
어떤 주제에 "대해" 아는 것과 그 주제를 실제로 배우는 것은 완전히 다릅니다.
무엇에 초점을 맞추느냐의 문제일 뿐이니 자기 자신을 속이지 마세요. 이런 도구는 당신이 평생 읽을 수 있는 것보다 많은 논문을 읽고 정리해서 출처와 함께 알려 줍니다. 덕분에 모든 배움이 더 나아집니다.
https://github.com/jessewaites/antiquity
케이프타운에도 VOC 문서고가 있고, 큐(Kew)에도 있습니다("Letters of Loot"(약탈 서한)로 검색해 보세요). 큐의 것은 말 그대로 사략선이 약탈한 문서입니다. 모두 고지 네덜란드어로 쓰여 있고 일부는 독일어입니다. 번역은 얼마나 믿을 만합니까?
제 경험상 어떤 존재 방식을 밀어내는 파괴적인 기술이 등장하면, 이전의 모든 사례에서 사람들은 결국 적응했습니다. 반드시 그렇게 되어야 하는 일이고요. LLM이 예전에 가치 있던 일의 가치를 깎고 있다고 생각한다면, 이제는 당신 스스로 결과물을 끌어올려서 LLM이 대체하고 있는 수준, 혹은 가치를 잃었다고 느끼는 그 수준보다 다시 높이 올라설 때입니다. 그건 할 수 있습니다. 전적으로 당신 안에 있는 일이지만, 스스로 찾아내야 합니다. 아니면 계속 험담이나 하면서 아무것도 보태지 않을 수도 있죠. 하지만 그러면 당신의 결과물은 LLM이 빼앗아 간다고 당신이 말하는 것과 정반대 방향으로 가는 겁니다. 우리는 갈등이 많은 시대를 살고 있지만, 사실 꼭 그럴 필요는 없습니다.
참고로 저는 이 프로젝트가 훌륭한 발표였다고 생각합니다. 인터랙티브 요소도 좋았고, 페이지를 가로질러 날아오는 운석(아니면 '운석 아닌 것'이라고 해야 할까요?)도 마음에 들었습니다. 지금까지 본 LLM 활용 사례 중에서 손꼽을 만큼 좋은 쓰임새입니다. 기사에서는 못 봤는데, 이 프로젝트의 향후 계획을 아는 분 계십니까? 아니면 여기서 마무리인가요? "Where This Stands" 섹션에도 앞으로 검색할 주제에 대한 이야기는 없었습니다. 지금은 답을 찾는 것만큼이나 질문을 찾는 일이 중요한 시대라는 생각이 정말 듭니다.
제 생각에는 빙글빙글 도는 코뿔소, 운석 충돌, 움직이는 순서도는 전부 불필요한 장식이라서 거의 풍자처럼 보입니다. 이런 추세가 계속되면 언젠가 이 "AAA급 효과"도 90년대의 "공사 중" 배너 GIF처럼 보일 겁니다.
효과가 웃길 정도로 형편없어요. 뉴욕 타임스가 만든 스크롤 효과에서 영감을 받은 건 알겠는데, NYT는 본문을 가릴 만큼 멍청하지는 않았습니다. 형태는 기능을 따르는 법인데, 웹 페이지의 기능은 읽히는 것이지, 화산 구름이 시야를 가리는 느낌을 주려는(아마 그런 거겠죠) 바보 같은 효과로 읽어야 할 글을 가리는 게 아닙니다. 적어도 "공사 중" 배너는 본문 위를 가로막지는 않았어요.
저는 효과가 꽤 마음에 들었어요... 어느 순간에든 본문의 작은 일부만 움직이며 가리는 정도라서 읽는 데 방해가 되지는 않았거든요. 그리고 아이들을 포함한 더 폭넓은 독자를 겨냥해 쓴 글 같아요. 학술지 투고용으로 낸 글이 아니니, 저는 이 정도 멋 부림은 괜찮다고 봐요.
90년대가 뭐가 어때서요? 우린 엄청 재밌게 놀았다고요.
재밌긴 했죠. 오글거리게 되기 전까지는요. 그러다 복고 열풍 덕에 다시 재밌어졌고요.
이왕 얘기가 나온 김에 흐름을 짚어 봤을 뿐이에요.
그럴 수도 있겠죠. 하지만 지금 저한테는 재미있어요.
정말 흥미롭게 읽었고 아주 재미있었습니다. 말 그대로 잃어버린 지식을 탐험하는 기분이었어요. 훌륭한 작업이고 훌륭한 글입니다.
디자인과 작은 효과들(운석과 화산)도 좋았습니다. 다만 코뿔소가 회전할 때 글이 그 주위로 흐르는 건 고쳐 주세요.
이런 아카이브에서 또 무엇을 찾을 수 있을지 궁금합니다. 몇 가지 아이디어입니다.
침몰한 배의 위치나 항로, 그리고 사라진 화물?
지금은 잊혔지만 한때 전설이었던 해적 선장의 해적 이야기?
여름에 눈이 내리는 것 같은 이상 기상 현상?
(수정: 서식)
최근 글이고 관련도 있습니다(HN 사용자인 https://news.ycombinator.com/user?id=benbreen 님의 글입니다!).
Opus 5.5로 도도새를 직접 목격한 새로운 기록을 발견하다 - https://news.ycombinator.com/item?id=49926917 - 2026년 10월 (댓글 79개)
정말 멋지네요.
저는 현대 정치 여론 미디어를 대상으로 비슷한 프로젝트를 하고 있습니다. 모든 팟캐스트, 블로그, 칼럼, 방송을 작은 조각으로 잘라서 구조, 발언자, 인용문, 명사를 뽑아내고 서로 교차 참조하는 작업입니다. 이 얘기를 꺼내는 건, 이렇게 무거운 전처리를 역사 문서에도 도입할 가치가 있을지 궁금해서입니다. 처음에는 비용이 훨씬 더 들겠지만, 그 뒤로는 지금 쓰시는 시스템보다 질문에 훨씬 싸게 답할 수 있게 됩니다. 관심 있는 사람들을 모아서 구조화된 파싱에 함께 투자해 볼 만할 수도 있겠습니다.
또 현대의 받아쓰기와 역사 문서 스캔은 문제의 모양이 비슷합니다. 철자가 틀린 단어를 만났을 때 문맥으로 올바른 단어를 추론해야 하니까요.
그런 작업이 갖는 윤리적 함의만큼은 꼭 염두에 두세요.
정확히 무엇을 만드시는지는 모르겠지만, 그 모양새는 "무기"에도 들어맞습니다. 그리고 무기는 만든 사람의 선의 같은 건 신경 쓰지 않습니다.
무슨 말씀인지 압니다. 저는 전체적으로 보면 좋은 일이라고 생각하고, 그래서 이 일을 하고 있습니다. 엘리트층의 여론을 알아볼 수 있게 해 주고, 조직적인 허위 정보라는 암흑물질을 찾아내는 데 도움이 되거든요. 아래로 감시하는 방법을 정보기관이나 광고 시장이 제 도움까지 받아야 하는 것도 아니고요.
잠깐만요, 이 사람이 기록에서 기록되지 않은 화산 폭발을 찾아냈다고요? 400년 된 "멸종한 도도새를 직접 목격한 새로운 기록"을 찾았다고요? 제가 보기에는 꽤 의심스러운 주장인데요.
마지막 도도새가 멸종한 게 불과 400년쯤 전이니 그렇게 놀랄 일은 아닙니다.
정말 마음에 듭니다. 제가 보기에 인류의 협력과 발전을 가로막는 큰 걸림돌 중 하나가 언어별로 나뉜 학술지였거든요.
많은 사람이 모르지만 위키백과도 언어가 다른 문서 사이에 정규화가 전혀 안 되어 있습니다. 언어 버튼을 누르면 번역된 문서를 보여 주는 것처럼 보이지만, 실제로는 편집자 공동체도 완전히 다른 별개의 백과사전이고, 다른 언어판 문서나 참고문헌과 상호 참조도 전혀 없습니다. 영어판에서는 토막글인 문서가 다른 언어에서는 충실하게 완성된 방대한 문서일 수 있는데, 어느 한쪽에 더 많은 정보가 있다고 알려 주는 기능은 사이트에 기본으로 있지도 않고 제가 본 적도 없습니다.
LLM은 스스로 언어를 본능적으로 알지 못하더라도 모든 언어에서 단어 연관성을 찾아 비교할 수 있습니다.
그러니 이 엔지니어가 찾아낸 것처럼 손쉽게 딸 수 있는 열매가 정말 많을 겁니다.
위키백과 쪽에서는 이 문제를 해결하려고 언어에 독립적이고 기계가 읽을 수 있는 백과사전 텍스트의 구조화된 표현을 연구하고 있습니다(아마 일종의 범용 합성 구조를 거쳐 프레임 의미론과 아주 비슷한 방식에 기댈 겁니다). Abstract Wikipedia를 찾아보세요. 다만 이 프로젝트는 아직 아주 초기의 매우 실험적인 단계입니다. LLM은 비결정적이고 사람이 검증할 수도 없어서 이 작업에 적합하지 않다고 보고, 그래서 다른 접근을 계획하고 있습니다.