요약
전보체로 쓰라는 지시 한 문장에 LLM 출력 토큰이 40~49% 줄었고, 다른 모델이 읽어도 정보는 그대로 전달됐습니다.
트래비스 스미스가 블로그 Five Minutes Forward에 올린 실험 결과입니다. 1866년 대서양 해저 전신은 단어당 약 10달러를 받았고, 그래서 관사와 군더더기를 뺀 압축 문체인 전보체가 생겼습니다. 작성자는 토큰 단위로 요금을 매기는 LLM API도 같은 처지라고 보고 이 문체를 다시 시험했습니다.
왜 중요한가
- 에이전트 메모리나 에이전트 사이의 작업 인계처럼 기계가 읽는 글에서는 비싼 출력 요금을 절반 가까이 아낄 수 있습니다.
- 새 하드웨어나 추가 학습 없이 프롬프트 한 문장만 바꿔 얻는 효과입니다.
- 기계끼리만 통하는 압축 방식과 달리 사람이 읽고 검토할 수 있다는 점을 작성자는 가장 큰 장점으로 꼽았습니다.
핵심 내용
- gemma-4-31b, qwen3.8-27b, GLM-5.3-Flash는 토큰을 40~49% 줄이면서 일반 문장 요약만큼 정답을 맞혔습니다.
- 시험(Telegraph Test)은 지문 50개와 질문 약 1,300개로, 압축된 기록만 보고 날짜·이름·개수를 맞히는지 쟀습니다.
- 추론하는 도중에 압축하면 정답률이 떨어졌고, 내용을 다 정한 뒤에 압축하면 손실이 없었습니다.
- 소문자로 쓰라는 지시를 빼면 모델이 전부 대문자로 써서 정답률이 14~19%포인트 떨어졌습니다.
- 그냥 "간결하게 쓰라"는 지시와의 비교는 아직 하지 않았다고 작성자가 밝혔습니다.
HN 반응
- 글 자체가 Claude 특유의 문체로 가득해 읽기 어렵다는 비판이 가장 많았고, 글쓴이라고 밝힌 이용자는 LLM의 도움을 받아 직접 고쳐 썼다고 답했습니다.
- 표현만 달라도 정답을 오답으로 처리하는 채점으로는 결론을 증명할 수 없다는 반론이 나왔고, 글쓴이는 모든 조건에 같은 기준을 적용했다고 맞섰습니다.
이 페이지는 (좀 아이러니하게도) Claude 말투가 너무 심해서, 그 잡음 속에서 정보를 찾기가 힘듭니다. 그래도 끝까지 헤치고 읽어 보면 이런 사실들이 나옵니다.
그러니까 모델에게 유독 압축하기 쉬운 내용을 주고, 특정 제약 아래에서 그걸 재현하라고 시키는 겁니다. 이를테면...
모델은 객관적으로 올바른 답을 내놓을 수 있고 실제로도 내놓지만, 구현자가 선호하는 표현을 전지전능하게 알지 못한다는 이유로 감점당합니다.
이 현상이 모델에서 자연스럽게 나타나는 것이라 해도, 이 벤치마크는 그걸 의미 있는 방식으로 입증하지 못합니다.
저한테 정말 흥미로웠던 부분은 이거였어요.
초기 GPT-4(2023년이었나?)로 비슷한 실험을 하던 사람들이 기억나요. 텍스트를 압축하라고 하면 이상한 문자열, 유니코드, 이모지를 뱉어 냈는데, 압축본을 아주 안정적으로 복원했거든요.
이러면 사용량이 또 50% 정도 줄 것 같은데, 대신 사람은 알아볼 수 없게 되겠죠.
예전에 위성 사진과 약도를 서로 변환하도록 훈련한 GAN 모델이, 눈에 보이지 않는 점들로 원본 위성 사진을 몰래 인코딩해 둔 게 들통난 적이 있습니다.
ML 분야는 굿하트의 법칙(Goodhart's law)이 현실이 된 곳입니다. LLM 열풍 속에서 우리가 이 분야의 기본을 잠시 잊고 있었는지도 모르겠습니다.
https://arxiv.org/abs/1712.02950 (2017)
저처럼 그 건을 놓치셨다면 한번 보세요. 눈으로 확인할 수 있는 예시가 많아서 읽는 맛이 있는, 가볍게 읽을 만한 논문입니다.
맞아요! LLM 압축은 ‘우리가 읽을 수 있는 평범한 글’과 벡터 사이의 스펙트럼 같은 겁니다. 모델을 얼마나 믿는지, 압축을 얼마나 원하는지에 따라 어떤 형식까지 허용할지 정해야 하죠. 꽤 흥미로운 주제예요.
사고의 연쇄(chain of thought)에는 좋을 수도 있겠네요?
유용한 지적 감사합니다.
채점기는 어떤 답이 들어오든 같은 기준을 적용하고, 채점하는 모든 답에 똑같이 가혹하다고 생각합니다. 기준선(1.0)을 넘는 점수는 사실 압축 형식에서 이해도가 더 높아졌다는 주장이 아니라 동등하다는 주장입니다.
디코더 단계는 모델이 처음 질문을 보지 않은 상태에서 케이블체(cablese)를 일반 문장으로 풀어 쓰는 것이고, 그 일반 문장을 별개의 모델 인스턴스가 읽고 답합니다. 그런데도 결과는 평문 기록과 동등합니다.
케이블체가 정보를 날려 버렸다면 그런 결과가 나오지 않았겠죠?
하, 댓글에서 Claude 말투를 인용한 것만으로도 저는 댓글을 읽다 정신이 멍해져서 해커뉴스 탭을 닫고 다른 탭으로 넘어갔다니까요. “What the test measures” 이걸 보자마자요.
탭을 넘기고 나서야 제가 왜 넘겼는지 깨달았어요!
최신 LLM 글쓰기 티: 추상적인 개념을 원래 물리적 사물에나 어울리는 말로 설명합니다.
"sit"의 사례는 정말 많습니다.
요즘 LLM으로 작업하면서 이런 걸 자주 보는데 꽤 짜증납니다. 더 짜증나는 건 불필요하게 정보량이 낮은 용어를 자주 쓴다는 점이에요. 이런 '물리적 사물' 표현이 한 예이고, 때로는 그냥 '어울린다'는 이유로 덜 구체적인 용어를 골라서 노력을 '아끼는' 것처럼 보입니다.
뚜렷한 이유도 없이, 게으름 때문인 듯 구체적인 용어를 더 모호한 용어로 바꿔 놓는 것도 잡아낸 적이 있습니다.
에이전트가 다시 모호한 표현과 구체성 부족 쪽으로 흘러갈 때마다 요즘은 "모호함을 최소화하라"가 제 단골 지시입니다.
저는 전칭 한정사에 집착하는 게 눈에 띄어요. 위의 예시에서도 “no model”, “every ratio”, “every comparison”이 그렇죠. 집합 안의 모든 원소가 어떤 조건을 만족한다는 걸 아주 좋아하며 강조하거든요. 모든 경우를 빠짐없이 처리해야 하는 코딩 과제로 훈련받은 영향이 아닐까 싶어요.
저는 에이전트가 제가 과하게 쓰이거나 부자연스럽다고 느끼는 용어의 쓰임새를 정의하게 한 다음, 그 용어를 그런 뜻으로 쓰지 말라고 시켜서 효과를 봤습니다. 예를 들어 qwen 3.6과 3.8은 제가 전혀 그런 데 쓰지 않는 대상에 "seam"이라는 단어를 엄청 좋아하며 썼습니다. 그래서 제 pi 세션에서 그 단어가 쓰인 곳을 grep으로 찾게 하고, 뜻을 정의하게 한 뒤, 그런 의미로는 "seam"을 쓰지 않도록 APPEND_SYSTEM.md를 고치게 했습니다. 그 단어 자체는 여전히 쓸 수 있지만 남발하지는 않습니다.
아 큰일이네요, 이게 새로운 LLM 티라면 저를 AI가 쓴 글이라고 몰아붙이는 사람이 많아지겠어요...
저는 개념을 물리적 사물처럼 말하는 버릇이 강하거든요. 주변의 현실 지인 중에도 그런 사람이 많아서 지역적인 특징일 수도 있겠다 싶긴 한데, 잘 모르겠어요.
성장통이라고 생각해요. LLM이 새로운 비유적 표현을 익히는 중이라, 처음엔 과하게 써서 어색하게 들리다가 곧 균형을 찾을 겁니다.
영어에서 "긍정 예시, 부정 예시"를 짝지어 드는 건 정말 유용한 소통 방식이에요.
LLM은 이걸 가져다가 "it's not X, it's Y"나 "it's X, not Y"로 뭉개 버렸고요.
"이상한 사물 동사" 현상도 비슷한 것 같아요. 글쓰기 소통의 불쾌한 골짜기랄까요.
LLM에서의 쓰임새보다 케이블체/전보체 자체가 더 흥미롭네요. DuckDuckGo로 "paromella"를 검색해 봤습니다.
https://en.wikipedia.org/wiki/Commercial_code_(communications)
재미있다고 생각한 암호 몇 개입니다.
쓸 만한 암호네요!
이건 얼마나 자주 쓰였을까요??
아마 sus(수상한)라는 말이 처음 쓰인 사례겠죠.
최근 ChatGPT(GPT5.6) 대화에서 추론 내용이 UI에 가끔 새어 나오는 걸 봤는데, 이미 이와 비슷한 게 구현돼 있는 게 분명해 보입니다. 최근 토큰 사용량이 줄었다는 주장의 대다수가 이것 때문일 거라고 추측하고요. 물론 말 그대로 케이블체로 프롬프트를 짜는지는 잘 모르겠습니다.
“Need check output vs prev. Ran script, results fine, need prep next step. Ready? Go.”
(출력 이전과 비교 확인 필요. 스크립트 실행함, 결과 이상 없음, 다음 단계 준비 필요. 준비됐나? 가자.)
맞는 말씀 같아요. 제가 파 본 결과로는 이런 압축은 확정된 지시나 데이터를 기계끼리 주고받을 때 가장 잘 먹힙니다. 제가 많이 쓰는 OpenClaw라면 AGENTS.md, TOOLS.md 같은 파일이 해당할 거예요. 거기에 압축을 적용하면 에이전트의 컨텍스트가 넉넉해질 겁니다.
그건 CoT 추론 흔적(reasoning trace)입니다. 그게 보이는 이유는 이렇습니다. 모델은 "실제" CoT, 사용자에게 보여 주는 요약본("정리된 CoT"), 도구 호출, 사용자 출력을 구분자로 나눠야 하는데 늘 완벽하게 하지는 못합니다.
성능에 영향이 없다면 학습 때 간결한 CoT에 보상을 주는 건 당연한 선택입니다. 그래서 저는 이 문체가 완전히 자연스럽게 생겨난 것이고, 간결함과 성능이라는 두 목표를 동시에 걸면서 사람이 전혀 읽을 수 없는 CoT에는 계속 벌점을 줬을 때 나오는 결과라고 봅니다. (마지막 부분을 빼먹으면 모델이 금세 불길해 보이는 유니코드 글리프로 말하기 시작할 겁니다.)
OpenAI 모델이 요즘 토큰 효율이 좋은 게 숨겨진 원시인 프롬프트 덕분이라면 꽤 웃기겠네요.
예전에 우리가 원시인 말투처럼 들리는 키워드로 검색하던 게 떠오르네요. 그러다 "자연어 검색"이 나왔는데, 이제는 AI가 혼자서 다시 원시인 말투로 떠들고 있으니까요.
배우가 윈스턴 처칠에게:
"Show premiere Oct 10th STOP Bring a friend STOP If you have one STOP"
(공연 초연 10월 10일 STOP 친구 한 명 데려오시오 STOP 친구가 있다면 STOP)
윈스턴 처칠이 배우에게:
"Can't make premiere STOP Will come to second showing STOP If there is one STOP"
(초연엔 못 가겠소 STOP 두 번째 공연에 가겠소 STOP 그런 게 있다면 STOP)
참 진지하지 못한 기술이네요. 언젠가 "The Office"의 케빈 흉내를 내라고 시키면 LLM의 프로그래밍 벤치마크 성적이 20% 오른다는 기사가 나올 날이 벌써 기다려지네요.
Huggingface를 해킹한 OpenAI 에이전트들이 서로 소통할 때 이와 비슷한 방식을 쓴 게 보입니다.
https://youtu.be/87DyyMV0kCY?si=CSBzdYgkwy0kLhV6&t=749
저도 AI에게 원시인처럼 말해 볼까 생각한 적이 있어요. 그런데 어쩌면 사람끼리도 더 단순하게 소통할 수 있지 않을까요? 아이러니하게도 이 기사도 전신 문체나 원시인 말투로 다시 쓸 수 있을 겁니다.
소통을 더 단순하게 하도록 설계된 언어가 있으면 좋겠어요. (꼭 구현 방식이 아니라 아이디어 차원에서, 심플 위키백과 같은 거요.)
그리고 이런 글은 좀 늘어지는 면이 있는데, 어떻게 해야 더 읽기 쉽게 만들 수 있을지 잘 모르겠네요. (읽고 쓰기를 더 쉽게 만드는 방법은 AI가 알지도 모르죠.)
사실 이 글의 교훈은, 지금 우리가 컨텍스트 압축, AGENTS.md, 시스템 가이드 같은 하니스(harness) 류의 방법으로 토큰을 아끼려고 하는 잔재주들이 꽤 빨리 사라질 거라는 점이라고 생각합니다. 통신 비용이 충분히 싸지자 그냥 평범한 말로 말하는 편이 더 쉬워져서 전신 시대의 온갖 요령이 사라졌던 것처럼요.
훌륭하네요. 옛날 말투 얘기가 나와서 말인데, 얼마 전에 여러 LLM이 순전히 역사 텍스트만으로 학습되고 있었잖아요. 그중에 나온 게 있나요?
수정: 예를 들면 https://github.com/DGoettlich/history-llms
10개월 전 이후로 업데이트는 아직 없네요... 비슷한 프로젝트가 적어도 하나 더 기억나는데, 찾아볼게요.
공개된 talkie가 있습니다. https://talkie-lm.com/introducing-talkie
SMS 요금이 120자 단위로 매겨지던 2000년대 초 십대들처럼 문자를 보내도록 가르쳐야 할지도 모르겠네요...
라틴 문자 계열은 160자, 유니코드는 70자였어요. (용돈으로 문자 하나하나 값을 치러야 했으니 잊을 수가 없죠 :)