요약
값싼 DeepSeek 4.1 Flash가 프런티어 모델 못지않게 쓸 만한데도 업계는 비싼 모델만 좇고 있습니다.
블로거 조노가 한 달 동안 여러 프로젝트에 DeepSeek 4.1 Flash를 써 보고 쓴 글입니다. 작업 중에 Claude Opus 5.5와 차이를 거의 못 느꼈는데 값은 훨씬 싸다며, 앤트로픽과 오픈AI가 왜 긴장하지 않는지 묻습니다.
왜 중요한가
- 모델이 충분히 좋고 싸면 단순한 일까지 마음 놓고 맡기게 되어 일하는 방식이 달라진다는 주장입니다.
- 비쌀수록 가치가 높다는 업계의 통념에 의문을 던집니다.
- 한두 달 뒤처진 중국 모델이 같은 일을 해내면 미국 연구소의 시장을 빼앗을 수 있다고 경고합니다.
핵심 내용
- 데스크톱 파일 정리 한 번에 DeepSeek는 약 0.003달러, 프런티어 모델은 약 1달러가 든다고 했습니다.
- 월 10달러짜리 OpenCode Go 구독으로 사실상 무제한으로 쓰고, 하루 종일 걸린 세션도 1달러를 넘긴 적이 드물다고 했습니다.
- 싼 비용의 비결로 KV 캐시(모델이 앞 문맥을 담아 두는 GPU 메모리)를 V1보다 약 437분의 1로 줄인 점을 꼽았습니다.
- 계획과 조사는 Flash에 맡기고, 중요한 작업만 Opus 5.5로 최종 검토한 뒤 수정은 다시 DeepSeek에 시킨다고 했습니다.
- 돈을 아끼려고 직접 호스팅하면 본전을 못 뽑지만, 개인정보 보호용 로컬 실행은 언젠가 가능해질 것으로 봤습니다.
HN 반응
- 일부 이용자는 프런티어 연구소의 구독료가 크게 보조되고 있고, DeepSeek는 같은 일에 토큰을 10배 더 써서 실제 이득이 없다고 지적했습니다.
- 반면 캐시 적중률을 잘 관리하면 업무 시간 내내 써도 한 달에 75달러를 넘기기 어렵다는 경험담도 여럿 나왔습니다.
다들 호들갑을 떨지 않는 이유는 대부분이 보조금을 잔뜩 받는 구독제를 쓰고 있기 때문입니다.
openrouter에서 가장 싼 제공업체를 써 봤는데 며칠 만에 50달러를 태웠습니다. 품질은 괜찮았고, Luna보다 조금 나은 정도로 느껴졌습니다. 그런데 그 50달러가 제 codex 구독료의 4분의 1입니다. 구독이라면 주간 한도가 초기화되기 전까지 Astra로 그만큼, 아니 그 이상의 토큰도 쓸 수 있었을 겁니다.
이게 영원히 가지는 않겠지만, 프런티어 랩들이 이렇게 보조금을 퍼붓는 동안은 오픈 모델이 중요해질 일이 없습니다.
맞아요. openrouter API로 pi agent harness에 Opus 5.5를 물리면 하루에 50~100달러는 거뜬히 나가고, fable 5.1이면 200달러도 쉽게 태웁니다. 그런데 저는 2주째 claude code 구독으로 계속 5.5만 쓰는데 한도에 걸린 적이 한 번도 없어요. 에이전트 세션을 6개 넘게 동시에 돌릴 때도 많고요.
그래도 장기적으로는 이런 회사들에 의존하지 않는 게 중요하다고 생각합니다. 시스템 프롬프트도, 생각 토큰도 우리가 통제할 수 없고, 보조금이 끊기거나 회사가 상장하면 돈을 벌어야 하니 가격을 올릴 수밖에 없을 테니까요.
다만 그때쯤이면 모델이 더 똑똑해지고 더 싸질 수도 있어서, 별문제가 아닐 수도 있습니다.
참고로 mitmproxy를 쓰면 시스템 프롬프트를 수정할 수 있습니다. 에이전트에게 방법을 차근차근 안내해 달라고 하면 됩니다. 앤트로픽의 시스템 프롬프트는 엉망진창인 데다 가장 평균적인 사용자에게 맞춰져 있습니다.
> 참고로 mitmproxy를 쓰면 시스템 프롬프트를 수정할 수 있습니다
시스템 프롬프트는 서버 쪽에서 컨텍스트에 주입됩니다.
claude code에는 말 그대로 --system-prompt 플래그가 있어요. mitmproxy로 실험해 보니 그 플래그를 쓰면 기존 시스템 프롬프트를 대체하는 게 아니라 뒤에 덧붙이더라고요. 그래서 네트워크로 나가는 시스템 프롬프트를 걷어내고 제 것을 넣어 주는 작은 도우미를 직접 만들어야 했습니다.
여기 claude code의 공개 시스템 프롬프트 모음이 있습니다: https://github.com/Piebald-AI/claude-code-system-prompts
--system-prompt-file을 쓰세요. 시스템 프롬프트 전체를 대체합니다( https://code.claude.com/docs/en/cli-reference ). Claude Code를 호출할 때마다 이 플래그가 붙도록 셸 별칭이나 함수 같은 걸 만들어야 하긴 하지만, MitM 같은 꼼수는 필요 없습니다. 그다음 "/context all"로 그 밖에 무엇이 전송되는지 보세요(Claude Code가 정확한 도구와 텍스트를 보여 주지 않으니 여기서는 MitM을 권합니다). 아무도 필요로 하지 않는 도구가 많고 그것들이 컨텍스트를 부풀리는데, settings.json에서 거부할 수 있습니다(목록은 여기 있습니다: https://code.claude.com/docs/en/tools-reference ). 또 "disableClaudeAiConnectors"를 false로 설정하면 군더더기를 더 걷어낼 수 있습니다.
--system-prompt와 --system-prompt-file 둘 다 써 봤는데, 6개월쯤 전에 트래픽을 지켜봤을 때는 둘 다 덧붙기만 했어요. 네, 저도 그런 도구들은 전부 정리해 둡니다.
--system-prompt-file은 프롬프트를 대체합니다. 저도 직접 쓰고 있고 문서에도 그렇게 나와 있습니다.
네트워크로 보내는 문자열이 어떻게 처리될지 내가 통제할 수 있다고 생각하다니요.
...토큰 맥시마이저들의 적나라한 현실이네요.
Claude, 나 대신 생각해 줘. 실수는 하지 말고.
저는 문제가 안 될 것 같아요. 지금의 Opus 5.5만 해도 저한테는 차고 넘치고, 보조금이 끊길 즈음이면 오픈 웨이트 모델이 그 수준에 도달해 있을 거예요.
640K [RAM]이면 누구에게나 충분할 겁니다!
그 말이 나온 당시에는 사람들이 640k 램으로 아무 불만 없이 잘 썼어요.
> 그 말이 나온 당시에는 사람들이 640k 램으로 아무 불만 없이 잘 썼어요.
이건 *"640K [RAM]이면 누구에게나 충분할 겁니다!"*라고 한 분에게 던진 비꼼이라고 짐작합니다.
640K 램 시절을 직접 겪은 사람으로서 말씀드리면, 사람들은 절대 그 용량에 만족하지 않았거든요.
아, 640K를 한 바이트까지 쥐어짜는 MS-DOS 게임 하나 돌리려고 CONFIG.SYS와 AUTOEXEC.BAT를 만지작거리며 보낸 그 시간들, 좋았죠.
EMS...
시대와 상관없이 사람들은 더 주면 늘 기꺼이 받아 왔어요.
저는 대부분의 "사람들"이 같은 낡은 소프트웨어를 계속 돌리는 것 말고는 정말로 더 필요했던 적이 아주 오랫동안 없다고 봅니다. 운영체제, 브라우저, 그리고 대다수 소프트웨어의 요구 사양이 부풀어 오른 건 "사람들" 전반의 요구라기보다, 업계의 현 상태가 관성에 의한 비대화라는 쪽에 가깝습니다.
이 말은 아마 그 말을 했다고 알려진 사람 누구도 하지 않았을 겁니다: https://quoteinvestigator.com/2011/09/08/640k-enough/ . "당시"가 언제인지조차 알 수 없고요.
그리고 빌도 에프스타인 섬에서 아무것도 안 했을 테고요...
지금 당신에게는 충분하겠죠. 하지만 우리 미래 신화의 한 축은, 더 똑똑한 LLM을 곁에 두고 더 복잡한 문제를 다루게 되니 우리가 계속 일자리를 유지한다는 이야기 같아요.
저는 가까운 미래에는 충분히 그렇게 될 거라고 볼 만한 근거가 있다고 생각합니다. 신화라는 부분은 그 너머의 이야기일 테고요.
그런데 '가까운 미래'라고 쓰는 순간, 예전보다 이게 훨씬훨씬훨씬 가까워졌다는 걸 깨달았습니다. 어쩌면 결국 제가 당신 말에 동의한다는 뜻일지도 모르겠네요.
어제 확인해 봤는데, 하루 동안 월 20달러짜리 구독으로 Claude Code에서 168달러어치를 썼더군요. 그런데도 주간 사용량은 한참 남아 있었습니다. 구독이 1대 10 비율로 할인되고 있는 것 같습니다.
https://newsletter.semianalysis.com/p/anthropic-subscriptions-offer-5x 를 보세요.
좋네요, 이 주제의 최신 자료를 볼 수 있어서 반갑습니다.
추신: 정말 흐뭇할 만큼 철저한 분석이었습니다. Opus 5.5가 워낙 쓰는 맛이 좋아서 하는 말이지만, 앤트로픽이 가성비 1위를 차지한 걸 보니 기쁘네요.
그 분석에서 빠진 건 딱 하나인데 그게 아주 큽니다. 실제로 한 일을 기준으로 한 비교예요. 실제 작업 묶음을 고정해 놓고, 그걸 끝내는 데 할당량(또는 API 사용량)이 얼마나 드는지를 봐야 합니다.
가격 차이의 큰 부분은 앤트로픽 모델이 OpenAI 모델보다 비싼 데다 같은 작업에 토큰도 더 많이 쓰기 때문이거든요(적어도 artificialanalysis.ai에 따르면 그렇습니다).
작업당 토큰 수가 결론을 얼마나 바꿀지 궁금하네요.
Deepseek도 적어도 처음에는 보조금을 잔뜩 얹은 요금제와 함께 나왔습니다.
그래서 Deepseek에 그렇게 큰돈을 썼다는 데 어리둥절해하는 댓글이 많은 겁니다. 할인 요금제에 올라탄 사람들은 터무니없이 싼 값에 엄청난 양의 토큰을 쓸 수 있었으니까요.
오픈 모델의 비용을 따지는 방식에도 이상한 이중 잣대가 있습니다. OpenAI나 앤트로픽에 대해서는 모델을 서비스하는 비용을 따질 때 훈련 비용과 직원 보수까지 전부 고려해야 한다고 하면서, 모델이 오픈 웨이트로 공개되면 그런 비용은 무시합니다. 그런 면에서 Deepseek 모델도 보조금을 듬뿍 받은 셈입니다. 개발에 한 푼도 안 쓴 다른 회사가 대신 서비스할 수 있다는 점에서요.
저도 Luna나 Haiku에서 얻을 수 있는 수준과 얼추 비슷하다고 생각합니다. 다만 세상에 대한 지식이 필요한 작업에서는 Luna와 Haiku의 손을 들어 줍니다. 훈련 데이터가 더 깔끔했던 느낌이에요.
게다가 Luna와 Haiku는 구독 요금제에서는 거의 공짜나 다름없고, API 요금으로도 아주 쌉니다.
그러니까 Deepseek Flash의 놀라운 점은 그 정도 성능을 오픈 웨이트 모델에서 거의 얻을 수 있다는 것입니다. 하지만 우리가 구독 요금제로 프런티어 랩의 소형 모델을 실제로 쓰는 방식과 견주기 시작하면 그리 놀랍지 않습니다.
그러면 당연히 OpenAI, 앤트로픽, 구글의 모델도 인류가 쌓아 온 지식의 대부분을 공짜로 긁어다 쓰면서 한 푼도 내지 않고 그걸 사유화하려 했다는 점에서 보조금을 듬뿍 받았다고 반박할 수 있겠죠.
그렇게 따지는 건, 제가 4.1 Flash를 쓰는 데 DeepSeek이 존속할 필요가 없기 때문입니다. 앤트로픽이 망하면 Claude는 아마 그대로 사라지겠죠.
미래의 모델을 볼 때는 그런 계산법이 말이 안 되지만, 현재 상태를 평가하는 거라면 훈련 비용을 치르지 않는 회사의 훈련 비용은 무시하는 게 맞습니다.
오픈 모델용 구독도 있고, 보통 훨씬 쌉니다. 오픈 모델 쪽 사람들은 갈아타는 일이 잦아서 엄청 인기가 있진 않지만, 토큰을 소방호스처럼 쏟아붓고 싶다면 그런 구독이 있긴 합니다.