요약
마이크로소프트가 정해진 선택지 가운데 답을 빠르게 고르는 전용 모델 Microsoft-Decision-1을 내놓았습니다.
마이크로소프트 CTO실의 아친트 스리바스타바 부사장이 쓴 소개 글입니다. 그는 글을 생성하는 LLM과 달리, 결정 모델은 소프트웨어가 곧바로 처리할 수 있는 정형화된 결과를 내도록 만든 모델이라고 설명했습니다.
왜 중요한가
- 에이전트 제어, 모델 라우팅(요청을 알맞은 모델로 보내는 일), 데이터 분류 같은 잦은 판단을 큰 LLM 대신 작고 빠른 모델에 맡길 수 있습니다.
- 선택지마다 보정된 확률(90%라고 하면 실제로 열에 아홉은 맞는 값)을 API로 돌려주는 것을 핵심 기능으로 내세웠습니다.
- Jev 같은 결정 모델이 먼저 자리 잡은 시장에 마이크로소프트도 뛰어든 셈입니다.
핵심 내용
- Qwen3.5-9B를 추가 학습해 한 번의 추론으로 선택지마다 확률을 매기게 만들었습니다.
- 학습에 쓰지 않은 36개 벤치마크, 약 15만 문항 비교에서 정확도가 가장 높았다고 밝혔습니다.
- 속도는 2위 Quyet-1.0-Large보다 4.5배, GPT-6 Sol보다 35배 빨랐다고 합니다.
- Microsoft Foundry와 OpenRouter에서 쓸 수 있고, 입력 100만 토큰당 0.042달러이며 출력은 무료입니다.
- Xbox 연구팀은 피드백 1만여 건 분류에서 GPT-6 Sol과 비슷한 품질을 200분의 1 비용으로 얻었다고 합니다.
HN 반응
- 작은 Qwen 모델을 다듬은 결정 모델이 최근 쏟아졌다는 지적과 함께, 정작 선두 주자 Jev와의 정확도·가격 비교가 빠졌다는 불만이 나왔습니다.
- 직접 시험한 이용자는 Jev보다 비용이 낮고 결과도 비슷했지만, 응답 시간은 조금 더 길었다고 전했습니다.
이건 작은 Qwen 모델 중 하나를 기반으로 했네요. 클라우드플레어의 Clef, Strands decider를 비롯해 최근 몇 주 사이에 나온 수많은 모델이 다 마찬가지고요.
이걸로 다들 그렇게 화제를 모을 수 있다니 좀 웃기지만, Qwen은 정말 '할 수 있다, 할 수 있다' 하는 꼬마 기관차 같아요. 그래도 (오픈 소스는 아니더라도) 오픈 웨이트가 이렇게 생태계 전체를 끌고 가는 모습은 보기 좋습니다.
게다가 작년에 인수된 이전 스타트업 Pi Labs의 IP를 많이 활용해서 모델을 SOTA 성능까지 빠르게 끌어올릴 수 있었습니다. 그 스타트업은 Jev가 나오기 훨씬 전부터 스코어링 모델을 만들고 있었거든요.
제가 몇 가지 실험을 해 보고 얻은 가장 큰 교훈은, 의사결정에서는 BF16(양자화하지 않은) Qwen이 두 배 크기의 Q8보다 낫다는 점입니다. Kev가 처음의 8B 버전에서 4B BF16으로 바꾼 것도 그래서일 거라고 생각합니다. 양자화가 의사결정 정확도를 망가뜨리는 것 같다는 게 흥미롭지 않습니까?
흥미롭네요. 그렇다고 놀랍지는 않습니다. 우리는 양자화에 비용이 없는 것처럼 행동하고, 로컬 LLM 커뮤니티에서도 "Q8은 사실상 무손실"이라는 말을 자주 하지만 실제로는 그렇지 않습니다. 저는 개인적으로 그 트레이드오프를 감수할 만하다고 보고, 코딩 능력에 미치는 손상도 적어 보입니다. 다만 의사결정 모델 방식은 더 엄격하죠.
정말 멋진 발견입니다!
흥미롭네요. 코딩은 특정 토큰의 확률을 쓰지 않는데 의사결정 모델은 쓰기 때문이 아닐까 싶어요.
네, 그게 이유입니다. 양자화 같은 변환은 확률 질량보다 결과의 순위를 훨씬 잘 보존합니다.
코딩에서는 속도나 지연 시간이 그렇게 중요하지 않아서 모델이 더 오래 생각하게 놔둘 수 있다는 점도 한몫한다고 생각해요.
오늘 오후부터 strands-decider의 Gemma4 기반 변형(2B, 4B, 12B, 26B)도 나와 있습니다. https://huggingface.co/StrandsAgents
이 모델 라인 작업을 이끄는 Fabio가 동의할지는 모르겠지만, 저라면 처음부터 다시 시작할 경우 Qwen3.5보다 Gemma4를 기반으로 고를 것 같습니다. 그래도 Qwen 경쟁작이 많이 나오는 건 놀랍지 않고, 이런 작업이 공개되는 게 좋다는 말씀에는 전적으로 동의합니다.
저는 제 용도로 gemma 26b moe 모델을 시스템 1 변형으로 쓰고 있는데, 200ms 정도에서 다른 대안들보다 훨씬 똑똑하고 아주 좋습니다. 이런 용도에서는 지연 시간이 낮을 필요가 없다면 클수록 좋아요. 유일한 단점은 보정(calibration)인데, 보정이 필요하면 JEV를 쓰는 편이 낫습니다.
네, 제가 Fabio인데 동의합니다!
의사결정 분류기를 만드는 데 디코더 모델을 쓰는 게 이해가 안 됩니다. Jev 모델은 요청한 각 클래스나 선택지마다 확률 점수를 내줍니다. 그 확률은 어떤 선택이 맞을 실제 통계적 확률입니다.
이걸 디코더 모델로 하면, 결국 다음 토큰이 어떤 클래스에 해당할 확률을 보고 가장 확률이 높은 클래스를 고르는 셈입니다. 둘 다 확률이긴 하지만 의미는 완전히 다릅니다. 제 말이 맞습니까?
그리고 MS가 Qwen을 기반 모델로 썼다고 밝힌 건 못 봤습니다. 여기 댓글에서 본 걸 보고 그런 줄 알았나 봅니다. 어쨌든 제 윗 댓글은 디코더 모델 기반의 다른 의사결정 모델들에 관한 이야기입니다.
마이크로소프트가 AI에서는 다르게 가고 있는 것 같아요. 로컬 추론에 크게 힘을 싣고 있고, 윈도에 로컬로, 또는 선택적으로 클라우드나 엣지에서 돌아가는 네이티브 AI API가 생기는 미래를 보는 것 같습니다.
그런 로컬 API는 이미 있습니다. Microsoft Foundry Local이라는 건데요. https://learn.microsoft.com/en-us/azure/foundry-local/get-started
GPU, NPU, CPU를 지원합니다.
좋네요, 몰랐어요. 저는 게임용 DirectX 같은 더 낮은 수준의 API를 생각하고 있었거든요.
실제로 그렇습니다. Windows ML( https://github.com/microsoft/windowsML )이 CPU, NPU, GPU에서 벤더에 구애받지 않고 추론할 수 있게 해 주는 추론 프레임워크입니다. MXC를 이용한 격리 솔루션을 포함해 훨씬 많은 것도 발표했습니다. 아래 링크에 마케팅성 내용이 많긴 하지만 최근 발표를 다 다루고 있습니다. https://blogs.windows.com/windowsexperience/2026/10/07/building-windows-for-hybrid-intelligence/
제 "Copilot+ PC"가 드디어 로컬에서 정말 쓸모 있는 추론을 해 주면 좋겠네요. Advanced Paste용 Phi Silica는 좀 늦긴 했어도 좋은 시작이었어요. 정신만 차린다면 Microsoft-Decision-1도 로컬에서 가능성이 있을 겁니다. 다만 지금까지 해 온 걸 보면 마음이 놓이지는 않네요.
Copilot+ PC 브랜드는 이미 단종됐으니, 이쪽에서 더 많은 움직임은 없을 것 같습니다.
실제로는 그렇지 않다고 봅니다. 그런 소문이 돌긴 했지만 최근 행사에서 Copilot+ PC를 성능이 낮은 로컬 추론을 지원하는, 비교적 일반 사용자를 겨냥한 라인으로 언급했습니다. 그리고 Nvidia RTX Spark 기반의 새 기기들(그리고 통합 메모리가 큰 AMD, 인텔, 퀄컴의 더 강력한 솔루션도 아마)은 개발자와 헤비한 로컬 추론 사용자를 겨냥한 "Builder" 등급으로 불렀고요. 이런 기기에서 돌아가도록 설계한 자사 코딩 모델의 양자화 버전도 공개했습니다. 그러니 작은 모델을 만들거나 쓸 만한 로컬 추론에 집중하면서 더 강력한 프론티어 모델 접근과 균형을 맞추는 식으로, 아래에서부터 쌓아 올리고 있는 것처럼 보이긴 합니다. 마케팅 용어가 많지만 공개한 내용 대부분을 다루고 있습니다.
https://blogs.windows.com/windowsexperience/2026/10/07/building-windows-for-hybrid-intelligence/ https://github.com/microsoft/windowsML
애플도 그쪽으로 가고 있습니다. 구현 작업을 하는 모델이 opus 4.6보다 나을 필요는 없어요. 그걸 돌릴 로컬 하드웨어는 이미 있고, 몇 년 뒤에는 2026년 달러 기준으로 2천 달러 미만이 될 가능성이 큽니다.
제가 쓰는 간단한 테스트 세트에서는 Jev보다 저렴했지만(0.72배) 지연 시간은 더 길었습니다(p50 기준 283ms 대 369ms). 제가 측정하는 모든 시나리오에서 결과가 아주 비슷했고, 지금까지 제가 테스트한 것 중 상용 제품으로 출시할 만한 이유가 있는 첫 번째 모델입니다.
Qwen 튜닝 모델은 좋긴 하지만, 제가 테스트한 사례는 모두 가격이나 성능 중 하나가 걸려서 저렴하게 직접 호스팅해 추가로 파인튜닝할 수 있는 경우가 아니면 쓸 수 없었습니다.
기사에서는 코드에서 의사결정 모델을 쓰는 이야기를 하는데, 이걸로 우유부단한 사람들이 일상에서 하는 결정을 도울 수도 있을까요? 결정 장애인 사람을 몇 명 아는데 도움이 정말 필요해 보여서요.
LLM이 이미 그걸 해 줍니다. 게다가 LLM은 왜 다른 입장이 아니라 그 입장을 내놓는지 그럴듯한 설명을 풀어 줄 수 있다는 장점이 있고요.
어떤 결정의 근거를 모른 채 "의사결정" 모델의 출력을 쓰는 건 너무 믿어 주는 것 같습니다.
정확도는 왜 jev와 비교하는 벤치마크를 안 했을까요?
흥미롭게도 제가 본 바로는 JevBench에 나온 것보다 성능은 더 좋고 비용은 비슷합니다.
혹시 이거 홍보용 계정인가요?
블로그에서 공개 모델만 벤치마크한다고 밝히고 있어요.
그리고 2.3절도 보세요. https://typesafe.ai/legal/mca
음, 저는 다른 제품과 벤치마크하거나 비교하는 걸 금지한다고 쓰여 있을 줄 알았는데 그런 내용은 못 찾겠네요?
"develop (or to facilitate the development of) a similar or competing product or service"(유사하거나 경쟁하는 제품이나 서비스를 개발하는 것(또는 개발을 돕는 것))라는 문구는 있지만, 벤치마크를 공개하는 것만으로 거기에 해당한다고 보는 건 상당히 무리일 겁니다. 마이크로소프트 법무팀은 생각이 다를 수도 있겠지만요.
가격 경쟁력 없는 Jev 경쟁작이 또 하나 나온 것 같네요.
마이크로소프트는 자사 가격을 GPT Sol하고만 비교하고(!) GPT Terra나, OpenAI의 Jev 모방작이 기반으로 삼은 GPT Luna하고는 비교하지 않습니다. 물론 Luna의 10분의 4 가격인 Jev하고도 비교하지 않고요.
새 제품 하나 때문에 이렇게 짧은 시간에 경쟁작이 이렇게 많이 쏟아진 건 처음 보는 것 같아요. 분명한 건 다들 "아차!" 하고 이마를 치면서, 지나고 보니 뻔했던 이 거대한 시장의 한 조각을 차지하려고 허둥대고 있다는 거예요.
아직 아무도 가격에서 Jev에 근접하지 못했다는 게 문제죠!
사실 가격 경쟁력 있습니다! 현재 입력 토큰 100만 개당 $0.042로, 제가 아는 한 Jev와 같습니다. 블로그를 확인해 보세요. https://techcommunity.microsoft.com/blog/azure-ai-foundry-blog/introducing-microsoft-decision-1-in-microsoft-foundry-for-decision-and-classific/4562742?previewMessage=true