Qwen 3.8 Flash Next(125B)를 일반 소비자용 하드웨어(RTX 4090)에서 초당 100토큰으로 돌리기

Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s

github.com/Niko1221 ▲ 599 댓글 280 snehesht

요약

오픈소스 엔진 Strata가 125B 모델 Qwen 3.8 Flash Next를 일반 게이밍 PC에서 돌립니다.

GitHub 사용자 Niko1221가 공개한 추론 엔진입니다. 알리바바 Qwen 팀의 1,250억 매개변수 모델을 윈도와 리눅스에 클릭 한 번으로 설치해 내 컴퓨터에서 쓰게 해 줍니다.

왜 중요한가

  • 125B 모델을 VRAM 12GB 그래픽카드와 RAM 32GB를 갖춘 PC에서 돌릴 수 있게 하려는 시도입니다.
  • 오픈AI와 앤트로픽 호환 API를 로컬에 열어 주므로 기존 도구를 그대로 연결할 수 있습니다.

핵심 내용

  • 모델은 전문가 2만 4,576개로 이뤄진 MoE(입력마다 일부 전문가만 쓰는 구조)이고, 토큰 하나에 10개만 씁니다.
  • 자주 쓰는 전문가는 GPU에, 전체 전문가는 RAM에 두고, 나머지 계산은 CPU가 맡습니다.
  • 작은 보조 모델이 다음 단어를 미리 추측하고 큰 모델이 한꺼번에 검증해 1.6~1.8배 빨라진다고 합니다.
  • RTX 5070(12GB)에서 초당 53~94토큰을 쟀고, RTX 3090(24GB)이면 초당 100~140토큰을 예상합니다.
  • 코딩 전용 Coder 판은 원본 모델 SWE-bench Verified 점수의 91%를 낸다고 했지만, 코드 밖 작업에는 약합니다.

HN 반응

  • 4비트 미만 양자화(가중치를 더 적은 비트로 압축하는 것)의 품질 저하를 걱정하는 의견에, 3비트 판이 4~5비트 27B 모델보다 코딩 점수가 높았다는 실측 후기가 맞섰습니다.
  • 같은 모델 파일로 이미지 속 물체 좌표를 맞히게 했더니 Strata의 오차가 llama.cpp의 세 배를 넘었다는 시험 결과가 올라와 엔진 구현의 품질이 도마에 올랐습니다.

댓글

30개 표시 · 전체 280개
  1. a11r HN

    4비트 미만으로 양자화하는 건 품질이 크게 떨어질 수 있어서 다소 회의적입니다. 저는 시간당 약 1달러에 빌린 RTX Pro 6000에서 4비트 양자화 모델을 돌리고 있고, 캐싱을 쓰면 시간당 출력 120만 토큰, 입력 4,000만 토큰 정도가 나옵니다. 4비트 양자화의 품질은 어렵지만 범위가 분명한 코딩 작업에는 충분합니다. 제가 쓰는 추론 스택은 다음과 같습니다: https://www.reddit.com/r/BlackwellPerformance/s/FrKwk3GoDK

  2. sudo_cowsay HN

    시간당 1달러면, 시비를 걸려는 건 아닌데요, 왜 그냥 ChatGPT Plus나 다른 20달러짜리 구독을 쓰지 않으시는 건가요? 프라이버시 때문인가요?

  3. Winfred-zz HN

    방금 벤치마크를 한 세트 돌려 봤습니다. ninfer-3090-qwen3.8-27b(Q4와 Q5 혼합)와 strata-qwen3.8-flash-next-iq3_xxs(Q3)를 비교했습니다.

    │------------------- │ Ninfer-3090 │ Strata

    │ 코드 생성 │ 52/78 (66.7%) │ 70/78 (89.7%)

    │ 코드 완성 │ 40/50 (80.0%) │ 44/50 (88.0%)

    │ 합계------------- │ 92/128 (71.9%) │ 114/128 (89.1%)

    │ API 실패------ │ 10 │ 5

    • Ninfer 생성: 총 약 122분

    • Strata 생성: 총 약 142분

    그러니까 strata가 조금 느리긴 한데, ninfer-3090은 Qwen 3.8에 맞춰 크게 최적화되어 있다는 점을 감안하셔야 합니다. 표준 Qwen 3.8은 20 t/s로 돌아가고, 이 수정 버전은 50 t/s까지 나옵니다. 다만 생각하는 시간이 엄청나게 길어서 끝도 없이 계속됩니다.

    이 테스트는 전력 제한을 걸지 않으면 뻗어 버리는 3090, Zen 2 CPU, 64GB DDR4, 8x 이상으로는 올라가지 않으려는 PCIe 환경에서 한 것입니다(전반적으로 꽤 허접한 사양이죠).

    그런데도 이것저것 손보고 최적화하니 strata를 40~60 t/s로 돌릴 수 있었습니다.

    그 strata는 제 Oh My Pi 대화 기록에 맞춰 최적화된 것입니다. 그래서 실제로 쓸 때는 최적화하지 않은 이번 벤치마크보다 빠르고, 속도도 ninfer에 더 가까울 겁니다.

  4. sleight42 HN

    제 경험으로는, 특히 기술적이지 않은 추론에서는 4비트 27B가 3_xxs QFN보다 환각을 훨씬 더 많이 일으켰습니다.

    둘 다 온라인 가격 비교 쇼핑에 써 봤는데, QFN은 헛소리가 적었을 뿐 아니라 쓸 만한 관찰도 내놓았고, 여러 웹사이트의 접근 문제도 알아서 풀어 가며 우회했습니다.

  5. robot_jesus HN

    RTX Pro 6000을 시간당 1달러에 어디서 빌리시는지 좀 더 자세히 알려 주실 수 있나요?

  6. a11r HN

    네비우스에서 스팟 VM을 빌리고 있습니다. 배스트나 스페론 같은 다른 업체도 여러 군데 써 봤습니다. 배스트는 5090을 빌릴 때는 잘 맞았지만, RTX Pro 6000은 네비우스의 큰 메모리와 가격이 마음에 듭니다. PLE로 ngram을 RAM에 오프로드해야 해서 추가 RAM이 정말 중요합니다.

  7. _zoltan_ HN

    vast.ai요?

  8. sfifs HN

    저는 DeepSeek V4 Flash를 단일 DGX에서는 DS4로, DGX 클러스터에서는 표준 모델 가중치로 돌려 봤습니다. 하이브리드 2 양자화로 내려가면서 품질이 약간 떨어지긴 했지만 정말 별로 크지 않았습니다.

  9. segmondy HN

    모델이 클수록 더 많이 내려갈 수 있습니다. K3를 Q1로 돌리면 Qwen3.8-Flash-Next와 비슷하거나 아마 더 나을 겁니다.

  10. nialv7 HN

    ISTA-DASLab의 IQ3_S 양자화는 정말 좋아요 https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF

  11. ricardobeat HN

    뭘로 돌리고 계세요? 저는 기준 모델과 맞먹는다던 IQ3_XXS 양자화를 써 보고 있는데 결과가 들쭉날쭉하고, 체감상 품질이 꽤 떨어지더라고요.

  12. NinjaTrance HN

    그냥 궁금해서 여쭙는데, 환경을 세팅해서 돌리기까지 얼마나 걸리나요?

    하루에 여러 번 켰다 껐다 하는 게 현실적으로 가능한가요?

  13. a11r HN

    네, 처음에는 전체를 띄우는 데 대략 한 시간쯤 걸릴 겁니다. 일시 정지했다가 다시 시작하면 디스크에서 GPU 메모리로 모델을 올리는 데 15분 정도 걸리니, 콜드 스타트 시간을 감안하셔야 합니다.

  14. KeplerBoy HN

    100GB도 안 되는 걸 GPU 메모리로 읽어 들이는 데 15분이나 걸린다고요? SSD 속도가 한계일 텐데, 1분 넘게 걸리면 형편없는 SSD 아닌가요?

  15. boredatoms HN

    런타임에 따라서도 다릅니다. vllm은 llama.cpp에 비해 모델 로딩이 믿을 수 없을 만큼 느려요.

  16. teaearlgraycold HN

    클라우드 플랫폼 중에는 네트워크 스토리지가 끔찍하게 느린 곳이 많아요. 영구적인 CUDA 캐시가 없으면 GPU 커널을 처음부터 다시 컴파일해야 할 수도 있고요.

  17. sail0rm00n HN

    시간당 1달러라니 좋네요. 그 가격은 어디서 구하세요?

  18. transcriptase HN

    [flagged]

  19. dang HN

    내용 없는 댓글이나 분란을 일으키는 댓글은 그만 올려 주시겠어요? 안타깝게도 이런 일이 반복되고 있습니다. 이 사이트가 존재하는 목적과 맞지 않고, 이 사이트가 지키려는 것을 망가뜨립니다.

    https://news.ycombinator.com/newsguidelines.html 을 다시 읽어 보시고 이 사이트가 의도한 취지를 더 마음에 새겨 주신다면 감사하겠습니다.

  20. transcriptase HN

    죄송합니다. 얼마 전에 (여기 있는 분이었던 것 같은데) 그들이 그런 판매자들이 광고하는 Discord에 있다는 글을 읽었습니다. 그분은 그 서비스가 가격 대비 놀라운 가치라고 했지만, 솔직히 장난감 프로젝트용이었고 서면 계약도 없었으며 가동률이 98% 정도였다고 했습니다. 출처를 찾아서 링크를 달았어야 했는데, 앞으로 댓글을 전반적으로 더 신경 써서 쓰겠습니다!

  21. xingped HN

    아닌데요? 다른 분 댓글대로라면 vast.ai를 쓰시는 것 같고, 거기는 실제로 6000을 시간당 1달러에 올려 두고 있어요.

  22. aatd86 HN

    시간당 1달러요? 저도 그 조건이 필요한데요.

  23. trvz HN

    원 댓글 작성자는 아니지만, 업클라우드가 스팟 인스턴스를 그 가격에 제공합니다: https://upcloud.com/pricing/

  24. nickpsecurity HN

    싸네요. 어떤 호스팅 서비스를 쓰고 계신가요?

  25. Jackson__ HN

    방금 Strata를 간단한 50장짜리 비전 벤치마크로 테스트해 봤습니다. 요청한 물체의 정확한 좌표를 출력하는 과제입니다. Strata로는 오차 거리 중앙값이 154.8픽셀, 평균이 168.8픽셀이 나왔습니다. 똑같은 GGUF와 비전 어댑터 가중치를 llama.cpp에서 돌리면 중앙값 46.5, 평균 81.4입니다.

    감을 잡으시라고 llama.cpp로 돌린 다른 모델들의 수치를 더 적어 둡니다.

    중앙값/평균

    Qwen 3.5 9B BF16: 46.5 / 193.3

    Qwen 3.6 35B Q4 K XL: 38.4 / 76.4

    Qwen 3.5 122B Q3 K M: 32.9 / 68.6

    비전 성능 차이가 9B 모델에서 35B 모델로 넘어갈 때만큼 큽니다. 모든 테스트는 temp=0으로 했습니다.

    더 이상의 테스트는 하지 않았습니다. 이 결과가 제 예상과 딱 맞아떨어졌거든요.

  26. Xenograph HN

    이 테스트는 어디에 공개되어 있나요? 제 모델들로도 돌려 보고 싶습니다.

  27. throwaway219450 HN

    같은 테스트 세트에서 SAM3는 얼마나 나오나요?

  28. NamlchakKhandro HN

    요약: strata는 시간 낭비네요.

  29. unlikelytomato HN

    적어도 비전에서는 그렇다는 거죠? 언어 쪽에도 비슷한 비교가 있나요? 이런 새 추론 엔진을 띄울 때 비전은 후순위로 밀리는 경우가 많은 것 같아서요.

  30. Borealid HN

    추론이 끝난 뒤에는 비전도 언어와 똑같이 동작합니다. 어차피 토큰의 흐름이니까요.

    언어는 정답이 명확하게 정해지지 않는 성질이 있어서, 비전 과제 쪽이 "정답"과 그에서 벗어난 정도를 측정하기 쉬울 뿐입니다.

Hacker News에서 보기 ↗