스텝펀의 100만 토큰 컨텍스트 MoE 모델 Step 5 Preview가 OpenRouter에 올라왔습니다

Step 5 Preview, a 1M-context MoE from StepFun, shows up on OpenRouter

openrouter.ai ▲ 133 댓글 32 AnneWodell

요약

스텝펀이 에이전트 작업용 플래그십 모델 Step 5 Preview를 OpenRouter에 내놓았습니다.

여러 회사의 AI 모델을 한 API로 쓰게 해 주는 OpenRouter에 10월 8일 새 모델 페이지가 열렸습니다. 스텝펀은 이 모델을 큰 코드베이스와 문서를 오가며 도구를 쓰고 결과를 여러 번 다듬는 긴 작업용으로 설계했다고 소개했습니다.

왜 중요한가

  • 스텝펀이 그동안 OpenRouter에 올린 Flash 계열(전체 1,960억 개)보다 세 배 넘게 큰 모델입니다.
  • 100만 토큰 컨텍스트를 입력 100만 토큰당 1달러에 쓸 수 있어 긴 문서와 코드를 다루는 작업에 새 선택지가 생겼습니다.
  • 공개 첫날에만 입력 토큰 4,370억 개가 처리될 만큼 OpenClaw, Cline 같은 에이전트 도구가 바로 붙었습니다.

핵심 내용

  • 전체 매개변수는 6,000억 개지만 토큰마다 270억 개만 계산하는 희소 MoE(전문가 혼합) 구조입니다.
  • 컨텍스트 창(한 번에 넣을 수 있는 입력 길이)은 100만 토큰이고, 최대 출력은 6만 4,000토큰입니다.
  • 가격은 100만 토큰당 입력 1달러, 출력 2.7달러이고, 캐시 읽기는 0.05달러입니다.
  • 소프트웨어 개발과 전문 지식 업무에 강하며, 특히 금융 분야에서 성능이 좋다고 밝혔습니다.
  • 지금은 스텝펀 한 곳만 서비스하며, 구조화 출력(정해진 형식으로 답하기) 오류율은 평균 13.46%로 집계됐습니다.

HN 반응

  • 모델 비교 사이트 Artificial Analysis를 근거로 어느 면에서도 경쟁력이 없다는 평가와, GLM 5.3·Kimi K3와 비슷한 점수에 더 빠르다는 반론이 맞섰습니다.
  • 이전 Step 모델은 128GB 메모리 장비에서도 잘 돌았지만, 이번 모델은 너무 커서 직접 돌리기 어렵다는 아쉬움도 나왔습니다.

댓글

30개 표시 · 전체 32개
  1. hosel HN

    펠리컨이 없으니 뭐라고 판단해야 할지 모르겠네요.


    https://postimg.cc/c6L2MjSt

    12분 0초, $0.28

    해커뉴스 스타일의 댓글 스레드를 그려 줘. 최상단 댓글은 "pelican_enjoyer"라는 사용자가 쓴 "펠리컨이 없으니 뭐라고 판단해야 할지 모르겠네요."이다. 이에 대해 "minimaxir"가 심술궂은 말투로 답글을 단다. "사람들이 자꾸 그러니 말해 두는데, 새 LLM이 나왔다는 해커뉴스 스레드가 뜰 때마다 Simon의 펠리컨을 들먹일 필요는 없습니다. 레딧 밈보다도 노력이 덜 드는 농담이에요." 스레드 옆에는 자전거를 타고 있는 펠리컨을 그리고, 펠리컨은 의기양양한 표정을 짓게 해 줘.

  2. minimaxir HN

    사람들이 자꾸 그러니 말해 두는데, 새 LLM이 나왔다는 해커뉴스 스레드가 뜰 때마다 Simon의 펠리컨을 들먹일 필요는 없습니다. 레딧 밈보다도 노력이 덜 드는 농담이에요.

  3. hypfer HN

    저는 그냥 사회적 마찰로 받아들일 거예요. 당신의 댓글도 똑같이 사회적 마찰로 보이고요.

    본질적으로 합의 메커니즘이 제 할 일을 하고 있는 겁니다.

    __

    물론 공정하게 말하면, 제 설명은 노드들 사이에 연결이 없고 각자 독립적으로 선택한다고 가정하는데, 실제로는 서로 편을 들어 주는 집단이 있죠.

    그래서 꼭 최선의 메커니즘이라고는 할 수 없어요. 사회적 결속이나 그런 기능 이상 때문에, 꼭 합리적이라고 할 수 없는 편향을 통해 객관적으로 올바른 답에서 멀어질 수도 있으니까요.

    아니, 정확히는 특정한 맥락만 놓고 보면 합리적이지 않을 수 있어도, 한 발 물러나 하위 시스템 전체의 건강을 생각하면 합리적일 수도 있겠죠.

  4. minimaxir HN

    해커뉴스에서는 사이트의 질을 떨어뜨리기 때문에 노력이 거의 안 든 콘텐츠를 대체로 권장하지 않습니다. 사회경제학에 대한 심오한 논평 같은 게 아닙니다.

  5. hypfer HN

    새 모델이 나올 때마다 똑같은 퍼스널 브랜딩 글을 올리는 것 같은 걸 말씀하시는 거죠?

    말했듯이 여기에 옳고 그름은 없어요. 아니, 엄밀히 따지면 있고 그건 제 의견이긴 하지만(당연히), 한 발 물러나서 보면 방금 제가 설명한 바로 그대로인데 당신이 (안타깝게도) 밀어붙이면서 묵살해 버렸네요.

    """"사상가""""라는 분들은 자기 작업이 별로 가치를 더하지 않는다고 생각하는 사람도 있다는 사실을 받아들이며 살아야 할 거예요. 자존심에는 좀 불쾌한 일이겠지만, 알맹이 없는 걸로 돈을 벌려면 그 정도는 감수해야죠.

  6. minimaxir HN

    OP가 이미지를 추가한 수정본에 대해 말하자면, 기분 나쁘기보다는 그냥 좀 어이가 없네요.

  7. tomrod HN

    저는 펠리컨을 펭귄만큼은 아니어도 꽤 좋아해요. 언젠가 minimaxir의 맥스 긍정(max positive)을 볼 날이 오겠죠 ;)

  8. Razengan HN

    더 나은 대안이 있었는데, 멍청한 HN 검열 때문에 묻혔습니다.

    The Assbench: https://news.ycombinator.com/item?id=49807688

  9. behole HN

    Simon Wilson 님 호출합니다!

  10. JSR_FDED HN

    이름을 제대로 쓰면 아마 더 빨리 답해 줄걸요.

  11. syntaxing HN

    제가 보기엔 Step 모델이 128GB 공유 메모리에서 돌릴 수 있는 로컬 모델 중 처음으로 제대로 쓸 만했습니다. Qwen Flash Next와 비교하면 어떨지 정말 기대됩니다.

    수정: 아쉽네요, 600B-A27B인 줄 몰랐습니다. 228GB로는 돌릴 방법이 없습니다.

  12. robertlane0 HN

    Artificial Analysis 기준으로는(솔직히 저는 직접 모델을 비교하기 귀찮아서 이걸 일종의 정신적 목발처럼 쓰고 있으니 감안하고 들으세요) Gemini 3.8 Flash보다 똑똑하고 값도 약간 쌉니다. 저한테 "싸면서 충분히 똑똑한" 모델의 기준선이 Gemini 3.8 Flash였거든요. 이번 주 동안 OpenCode에서 한번 써 볼 생각인데, Muse Spark 1.3에서 갈아탈 만큼 끌릴지는 잘 모르겠습니다.

  13. jstummbillig HN

    이게 왜 흥미로운 건가요?

  14. theturtletalks HN

    Stepfun은 3.5로 SOTA에 가까운 모델을 만들었습니다. 금세 추월당하긴 했지만, 새 모델이 나올 때 주목받을 만큼은 보여 줬습니다.

    게다가 오픈 모델이기도 합니다. Opus와 Sol만 쓰는 사람이라도 이런 오픈 모델이 그들과 최전선을 밀어 올리는 데 도움이 됩니다.

  15. UncleOxidant HN

    나왔을 때는 같은 시기에 새 Qwen 모델이 워낙 많이 쏟아져서 별로 주목을 못 받은 모델 같습니다. 제 Strix Halo 장비에서 좀 써 봤는데, 메모리에 간신히 들어가는 수준이었어요.

  16. theturtletalks HN

    3.5 Flash는 괜찮았는데, 저는 OpenRouter로 썼습니다. 요즘은 Strix Halo에서 어떤 모델을 돌리시나요?

  17. Iolaum HN

    Qwen-3.8-flash-next @Q4입니다.

  18. ssivark HN

    3.5/3.7 시절[1]에 이 회사는 작고 빠른 모델을 내놨는데, 지식은 일부러 포기하고 도구 호출 관리나 서브 에이전트 조율 같은 "범용 지능"에 집중했습니다. 개인 비서를 돌리는 기반으로 아주 좋을 수 있어요(어떤 접근이 맞는지는 시간이 말해 주겠죠). 그래서 그때 이후로 얼마나 발전했는지 직접 써 보고 싶습니다.

    [1] https://news.ycombinator.com/item?id=47069179

  19. serf HN

    뭐, 지금은 무료니까요. 그 뒤로는 글쎄요.

  20. lykr0n HN

    혹시 이게 space bunny alpha 모델이었나 싶네요.

  21. minimaxir HN

    간단히 테스트해 보니 아닌 것 같습니다. 게다가 Space Bunny Alpha는 Minimax 계열 모델이라는 단서가 있었고요.

  22. james2doyle HN

    적어도 2주 전부터 ZenMux에 올라와 있었으니 숨기고 있는 건 아닐 겁니다.

  23. MisterMunchkin HN

    새 모델을 써 보는 건 좋아하지만, 진짜 새로운 걸 좀 봤으면 좋겠어요. 새로운 아키텍처 같은 거요. LLM은 너무 슬롭 같아요. 우리는 더 잘할 수 있어요.

  24. famouswaffles HN

    말로는 뭘 못 합니까. 먼저 트랜스포머를 실제로 이겨야죠. 지금까지 나온 대안 아키텍처는 기껏해야 사이드그레이드(성능이 비슷하거나 일부만 나은 수준)입니다.

  25. himata4113 HN

    트랜스포머보다 나은 게 있긴 합니다. 다만 투자를 그쪽으로 옮길 만큼 충분히 낫지는 않을 뿐이죠.

  26. cyanydeez HN

    시그모이드에 오신 걸 환영합니다...

  27. esafak HN

    어느 측면에서도 경쟁력이 없어 보이네요: https://artificialanalysis.ai/models/step-5#intelligence-comparisons

    다음엔 더 잘 되길 바랍니다.

  28. ssivark HN

    Artificial Analysis는 측정 대상에 대해 꽤 특정한 편향이나 관점이 있어서, 그쪽 벤치마크를 모델 품질의 결론으로 받아들이지는 않을 겁니다.

    종합 지수가 유용한 건 N개의 용도에 쓸 수평적 역량 하나를 만들려는 모델 회사나, 모델과 용도를 신중하게 짝지어 보는 수고를 들이고 싶지 않은 초보 사용자뿐입니다. 파워 유저로서 이해하고 의도적으로 선택하려는 사람에게 필요한 건 종합 지수가 아니라 핀포인트 평가입니다. 세금 신고와 잔디 깎기를 같은 사람에게 맡기지는 않잖아요. LLM이라고 뭐가 다를까요? "AGI"를 둘러싼 속설을 가지고 문제에 접근해야 종합 벤치마크를 만들게 되는 겁니다.

    다른 댓글에서도 말했듯이, Stepfun은 3.5/3.7 시절[1]에 작고 빠른 모델을 내놨는데, 지식은 일부러 포기하고 도구 호출 관리나 서브 에이전트 조율 같은 "범용 지능"에 집중했습니다. 개인 비서를 돌리는 기반으로 아주 좋을 수 있어요(어떤 접근이 맞는지는 시간이 말해 주겠죠). 그래서 그때 이후로 얼마나 발전했는지 직접 써 보고 싶습니다.

    [1] https://news.ycombinator.com/item?id=47069179

  29. edg5000 HN

    모델과 용도를 신중하게 짝지어 보는

    어떤 모델이 특정 분야에서 더 낫지 않을까 늘 궁금했습니다. 저는 소프트웨어, 전기·기계 공학, 그 밖의 여러 일에 모델을 쓰거든요. 주제별로 눈에 띄는 차이를 느끼신 게 있나요?

  30. RussianCow HN

    빠릅니다. OpenRouter 기준 평균 속도가 초당 115토큰이에요. 실제로 써 보진 않아서 체감이 어떤지는 모르지만, 저라면 추론이 빨라지는 대가로 돈을 좀 더 낼 의향이 분명히 있습니다.

    수정: 다만 평균 지연 시간이 1.5초라 아주 낮은 편은 아니어서, 에이전트 작업에서는 실제로 그렇게 빠르지 않을 수도 있습니다. 그리고 생각을 얼마나 하는지도 모르겠네요. 중국 모델은 보통 그게 약점이었으니까요.

Hacker News에서 보기 ↗