Beam: 리플렉션의 501B 오픈 웨이트 모델

Beam: Reflection's 501B open-weight model

reflection.ai ▲ 286 댓글 76 Philpax

요약

리플렉션이 코딩·에이전트용 501B 오픈 웨이트 모델 Beam을 발표했고, 가중치는 이달 안에 공개합니다.

Beam은 AI 연구소 리플렉션이 처음 내놓는 오픈 웨이트 모델입니다. 회사는 Beam이 서구권 오픈 웨이트 모델의 수준을 끌어올린다고 소개했습니다.

왜 중요한가

  • 원시 성능에서는 Kimi K3 같은 모델에 뒤진다고 인정하고, 추론 효율을 내세워 경쟁하겠다는 전략입니다.
  • Apache 2.0 라이선스(상업적 이용을 허용하는 오픈소스 라이선스)로 풀어, 누구나 쉽게 가져다 쓰게 하겠다고 밝혔습니다.

핵심 내용

  • 전체 매개변수는 5,010억 개이고, 한 번에 230억 개만 쓰는 희소 MoE(입력마다 일부 전문가 망만 켜는 구조) 모델입니다.
  • GLM 5.2와 비슷한 추론 점수를 내면서 추론 연산은 3~4배 적게 든다고 밝혔습니다.
  • 23.8조 토큰으로 사전학습한 뒤, GB300 GPU 1만 500개로 4주 동안 강화학습(RL)을 돌렸습니다.
  • SWE-bench Verified 80.9점, Terminal Bench 2.1 80.1점, AIME 2026 97.8점을 기록했다고 했습니다.
  • 지금은 최종 레드팀(공격자 입장에서 하는 안전 점검)과 평가를 진행 중이며, 사전 이용 신청을 받고 있습니다.

HN 반응

  • 가중치도 기술 세부 사항도 없이 신청만 받는 발표라는 비판이 많았고, "가중치부터 보여 달라"는 말이 되풀이됐습니다.
  • DeepSeek V4.1 Flash보다 실행 비용이 크고 지표는 낮다는 지적에, 중국산이 아니라는 점이 핵심 차별점이라는 해석이 나왔습니다.

댓글

30개 표시 · 전체 76개
  1. Ariarule HN

    오픈 웨이트 모델이 늘어나는 건 언제나 반갑지만, 두 번째 데모 이미지의 캡션을 보고 두 번 쳐다봤어요. "땅/물 일반화 실험: X에서 유행한 퍼즐을 재현했습니다. Beam에게 경도 -179°~179°, 위도 -89°~89° 범위로 180×90 고정 격자, 즉 16,200개 지점을 만들게 했습니다. 이 퍼즐은 나온 지 며칠밖에 안 되어 학습 데이터에 들어 있을 수 없으므로 모델의 일반화 능력을 시험하는 셈입니다. Beam은 95.5%를 맞혀 Opus 5(92.5%)와 Fable 5(97.8%) 사이에 들었고, 이는 새로운 과제에 얼마나 잘 일반화하는지를 보여줍니다."

    아니, "퍼즐이 나온 지 며칠밖에 안 됐다"는 건 틀린 말이에요. SNS에서 최근에야 유행했을 뿐이지, 모델에게 이런 식으로 세계 지도를 그리게 하는 건 최소한 2025년 8월부터 있었거든요. 그때 LessWrong에 올라왔어요: https://www.lesswrong.com/posts/xwdRzJxyqFqgXTWbH/how-does-a-blind-model-see-the-earth

  2. extr HN

    네, 이 주제로 원래 글이 나왔을 때가 기억나요. 절대 최근 일이 아닙니다. 그래도 이걸 가지고 RL을 돌린 건 아니라는 점에서는 저쪽 주장이 어느 정도 유효하다고 봐요.

  3. jiggawatts HN

    요즘 최신 프런티어 모델들로 이 테스트를 다시 돌려 보면 좋겠네요...

  4. charlieyu1 HN

    퍼즐이 나온 지 얼마나 됐는지는 중요하지 않다고 봐요. 요즘은 모델이 다 검색 기능을 갖고 있잖아요.

  5. criemen HN

    요즘은 모델이 다 검색 기능을 갖고 있잖아요

    일반화 테스트를 할 때는 웹 검색이나 인터넷 접근(어쩌면 모든 도구)은 꺼 두겠죠?

  6. zakisaad HN

    여기서 테스트하는 대상인 모델 가중치는 추론이 돌아가는 동안 원래 "웹에 접근"하지 않습니다. 모델이 웹 검색 도구를 쓸 수 있다면 얘기가 달라지지만요.

  7. dexwiz HN

    검색은 모델의 일부인가요, 하니스(harness)의 일부인가요?

  8. Cycl0ps HN

    수사적인 질문일 수도 있지만 혹시 몰라 답하자면, 검색은 항상 하니스의 일부입니다. 모델은 주어진 입력에 대해 다음 토큰을 예측하는 일만 합니다. 그 토큰이 도구 호출을 일으키는 [[web search]] 같은 것일 수는 있어도, 실제 호출은 하니스가 처리합니다.

  9. htrp HN

    Beam은 전체 파라미터 5,010억 개, 활성 파라미터 230억 개의 희소 전문가 혼합(Mixture-of-Experts) 모델로, 코딩, 추론, 에이전트 워크로드를 위해 만들어졌습니다.

    Beam의 역량은 사전 학습과 강화 학습(RL) 양쪽에 대한 대규모 투자에서 나옵니다. 웹과 독점 라이선스 데이터셋에서 가려 뽑은 고품질의 다양한 토큰 23.8조 개로 모델을 사전 학습했고, 이는 비슷한 크기의 공개 베이스 모델과 대등하거나 더 낫습니다. 이와 함께 예외적인 규모의 고연산 RL을 지속하는 데 필요한 알고리즘, 학습 환경, 인프라도 개발했습니다. 고연산 RL 학습은 NVIDIA GB300 GPU 1만 500개에서 4주 동안 진행되어 1억 개가 넘는 롤아웃을 만들어 냈습니다.

    지금은 얼리 액세스뿐이고, 가중치도 기술 세부 사항도 없이 정보를 받으려면 여기서 가입하라는 게 전부예요.

  10. wronglebowski HN

    오픈 모델이 더 많아지는 건 대환영이지만, 말만 하는 건 쉽잖아요. 뒷받침할 게 아무것도 없는 발표는 꽤 의미 없다고 생각해요. 가중치랑 HF 저장소를 공개하든가, 아니면 입 다물고 있든가 하세요.

  11. antoniojtorres HN

    GPU 1만 개를 한 달 동안 돌려 만든 결과물을 공짜로 풀려는 회사한테 이제는 그 정도 대접밖에 못 해주나요? 홍보 글 하나 없이 그냥 풀든가, 아니면 입 다물고 있으라고요? 저도 저분 못지않게 오픈소스를 지지하지만, 이건 말이 너무 독하네요.

  12. zelphirkalt HN

    게다가 "독점 데이터셋"이라니 ㅋㅋㅋ 보여 주기 싫다는 뜻이겠죠. 갖고 있으면 안 되는 데이터이거나, 아니면 학습 데이터에 특별한 게 전혀 없는데 뭔가 비법 재료가 있는 것처럼 들리게 하려는 거겠죠. 실제로는 없는데요.

  13. janalsncm HN

    데이터를 공유하지 않는 건 꽤 표준적인 관행입니다. 1) 변호사가 끼어들기 쉽고 2) 좋은 데이터가 좋은 결과의 핵심이기 때문입니다.

    제 생각에는 좋은 데이터에 평범한 모델링 기법을 쓰는 쪽이, 뛰어난 모델링 기법에 나쁜 데이터를 쓰는 쪽보다 결과가 더 좋습니다. 데이터가 나쁘면 평가(eval)도 나빠서 모델이 좋은지조차 알 수 없으니까요.

    앤트로픽이 중국의 증류 "공격"에 난리를 치는 것도 이 때문입니다. 깔끔한 추론 기록(reasoning trace)은 금덩어리거든요.

  14. mlmonkey HN

    데이터에는 저작권 문제가 있어서, 모든 저작권자의 허락을 받지 않고는 보통 공유할 수 없습니다. 어차피 그 데이터는 그들이 공유할 수 있는 게 아니고요. 거기서 파생된 (학습된) 가중치는 다른 문제입니다.

  15. vanuatu HN

    프런티어 랩 회사라면 아주 흔한 일이에요. 합성 데이터든 라벨링 데이터든 좋은 데이터가 있어야 하거든요. (중국 오픈소스 모델은 다들 자체 데이터 라벨러 부대를 두고 있고요.)

  16. Loquebantur HN

    Beam은 최종 레드팀 테스트와 평가를 진행 중입니다. 얼리 액세스를 원하시면 여기서 가입하세요.

    가중치, 기술 보고서, 모델 카드, 개발자용 산출물은 이번 달 안에 공개하겠습니다.

  17. wren6991 HN

    같은 급의 동시대 모델(DeepSeek V4.1 Flash)과 주요 수치를 비교해 보면 재미있겠다 싶었습니다.

                                    DS V4.1F            Beam
        LM total params             552B                501B
        LM active params (prefill)  8B                  23B
        LM active params (decode)   16B                 23B
        N-gram/PLE params           196B                0
        Pretrain tokens             45T                 28T
        Disk KV bytes/token (FP4)   890                 No information
        Vision                      Yes (pretrain)      No
        Weights available           Yes (launch day)    "This month"
        Weights licence             MIT                 Apache 2.0
    

    얼핏 보면 벤치마크는 인상적이지만, 리누스의 말을 빌리면 이렇게 되겠죠. "말은 쉽다, 가중치를 보여 달라." :-)

  18. laybak HN

    맞아요, 이 시대에는 "가중치를 보여 달라"를 당연하게 만들어 봐요.

  19. NorwegianDude HN

    더 큰데도 더 작은 기존 중국 무료 모델보다 성능이 떨어진다고요? 오픈 웨이트 모델은 좋은 일이지만, 지금은 서구 모델이 중국 모델에 한참 뒤처진 것 같습니다. 중국 기업들은 연구 결과도 많이 공개하는데 말이죠. 오픈 모델과 제공 업체가 더 늘었으면 좋겠습니다. 경쟁 없이 중국 모델이나 미국 모델 중 하나에 묶여 버리는 건 위험하니까요.

    그나마 구글은 Gemma 모델을 아주 잘 만듭니다. 언어를 실제로 잘 다루는 몇 안 되는 언어 모델이에요. 오픈AI의 최상위 비공개 모델은 노르웨이어를 제대로 쓰지도 못합니다.

  20. mirekrusin HN

    제대로 만들려면 시간도 걸리고 몇 번 시행착오도 겪어야 하고(게다가 기준점도 계속 움직이죠), 시도 하나하나가 비싸긴 합니다. 개인적으로는 규모를 좀 너무 키웠다는 느낌인데, 한편으로는 RL이 정체되지 않았다고 하니 좋은 수일지도 모르겠네요. 예산이 1억 달러쯤 되지 않았을까요?

  21. onlyrealcuzzo HN

    DeepSeek v4.1 Flash보다 크고, 돌리는 비용도 더 많이 들고, 측정된 지표는 전부 더 나빠 보이는데요.

    제가 놓친 게 있나요?

  22. swiftcoder HN

    제가 놓친 게 있나요?

    내세우는 문구("Beam은 서구 오픈 웨이트의 최전선을 넓힙니다")를 보면, 중국 랩이 아니라는 게 주된 셀링 포인트 중 하나인 게 분명합니다.

    개인한테 그게 중요할 것 같지는 않지만, 외국 모델 사용을 금지하는 정부 계약을 맡은 누군가는 어딘가에 있겠죠.

  23. htrp HN

    리플렉션은 "미국판 딥시크 프로젝트"를 만들겠다는 아이디어로 투자를 받았습니다.

  24. mirekrusin HN

    누가 자금을 대는 거죠?

  25. atlasunshrugged HN
  26. ipsum2 HN

    HN을 10년 넘게 했으면서 왜 아주 간단한 질문조차 구글에 안 쳐 보는지 아직도 이해가 안 돼요.

  27. jauntywundrkind HN

    반대로, 사람들은 아마 찾아보기는 할 거예요. 진짜 대단한 필터는 그 사람들 중 몇이나 돌아와서 유용하고 흥미로운 정보를 올리느냐죠.

  28. dominotw HN

    질문의 진짜 의도는 "이 자금 지원의 동기를 분석해 보자"에 가까운 거죠.

  29. kelnos HN

    그렇다면 훨씬 나은 글은 "방금 찾아봤는데 X, Y, Z가 자금을 대고 있네요. 제 생각에 Y는 $REASON 때문에 투자한 것 같아요..." 같은 거겠죠.

    쉽게 검색할 수 있는 걸 묻는 건 그냥 게으른 겁니다.

  30. NamlchakKhandro HN

    제 TempleOS는 BIOS 다음에 ring0에서 곧장 해커뉴스 UI로 넘어가는데, 그게 스크롤하고 댓글에 들어가고 댓글 쓰는 것만 되거든요.

Hacker News에서 보기 ↗