요약
리플렉션이 코딩·에이전트용 501B 오픈 웨이트 모델 Beam을 발표했고, 가중치는 이달 안에 공개합니다.
Beam은 AI 연구소 리플렉션이 처음 내놓는 오픈 웨이트 모델입니다. 회사는 Beam이 서구권 오픈 웨이트 모델의 수준을 끌어올린다고 소개했습니다.
왜 중요한가
- 원시 성능에서는 Kimi K3 같은 모델에 뒤진다고 인정하고, 추론 효율을 내세워 경쟁하겠다는 전략입니다.
- Apache 2.0 라이선스(상업적 이용을 허용하는 오픈소스 라이선스)로 풀어, 누구나 쉽게 가져다 쓰게 하겠다고 밝혔습니다.
핵심 내용
- 전체 매개변수는 5,010억 개이고, 한 번에 230억 개만 쓰는 희소 MoE(입력마다 일부 전문가 망만 켜는 구조) 모델입니다.
- GLM 5.2와 비슷한 추론 점수를 내면서 추론 연산은 3~4배 적게 든다고 밝혔습니다.
- 23.8조 토큰으로 사전학습한 뒤, GB300 GPU 1만 500개로 4주 동안 강화학습(RL)을 돌렸습니다.
- SWE-bench Verified 80.9점, Terminal Bench 2.1 80.1점, AIME 2026 97.8점을 기록했다고 했습니다.
- 지금은 최종 레드팀(공격자 입장에서 하는 안전 점검)과 평가를 진행 중이며, 사전 이용 신청을 받고 있습니다.
HN 반응
- 가중치도 기술 세부 사항도 없이 신청만 받는 발표라는 비판이 많았고, "가중치부터 보여 달라"는 말이 되풀이됐습니다.
- DeepSeek V4.1 Flash보다 실행 비용이 크고 지표는 낮다는 지적에, 중국산이 아니라는 점이 핵심 차별점이라는 해석이 나왔습니다.
오픈 웨이트 모델이 늘어나는 건 언제나 반갑지만, 두 번째 데모 이미지의 캡션을 보고 두 번 쳐다봤어요. "땅/물 일반화 실험: X에서 유행한 퍼즐을 재현했습니다. Beam에게 경도 -179°~179°, 위도 -89°~89° 범위로 180×90 고정 격자, 즉 16,200개 지점을 만들게 했습니다. 이 퍼즐은 나온 지 며칠밖에 안 되어 학습 데이터에 들어 있을 수 없으므로 모델의 일반화 능력을 시험하는 셈입니다. Beam은 95.5%를 맞혀 Opus 5(92.5%)와 Fable 5(97.8%) 사이에 들었고, 이는 새로운 과제에 얼마나 잘 일반화하는지를 보여줍니다."
아니, "퍼즐이 나온 지 며칠밖에 안 됐다"는 건 틀린 말이에요. SNS에서 최근에야 유행했을 뿐이지, 모델에게 이런 식으로 세계 지도를 그리게 하는 건 최소한 2025년 8월부터 있었거든요. 그때 LessWrong에 올라왔어요: https://www.lesswrong.com/posts/xwdRzJxyqFqgXTWbH/how-does-a-blind-model-see-the-earth
네, 이 주제로 원래 글이 나왔을 때가 기억나요. 절대 최근 일이 아닙니다. 그래도 이걸 가지고 RL을 돌린 건 아니라는 점에서는 저쪽 주장이 어느 정도 유효하다고 봐요.
요즘 최신 프런티어 모델들로 이 테스트를 다시 돌려 보면 좋겠네요...
퍼즐이 나온 지 얼마나 됐는지는 중요하지 않다고 봐요. 요즘은 모델이 다 검색 기능을 갖고 있잖아요.
일반화 테스트를 할 때는 웹 검색이나 인터넷 접근(어쩌면 모든 도구)은 꺼 두겠죠?
여기서 테스트하는 대상인 모델 가중치는 추론이 돌아가는 동안 원래 "웹에 접근"하지 않습니다. 모델이 웹 검색 도구를 쓸 수 있다면 얘기가 달라지지만요.
검색은 모델의 일부인가요, 하니스(harness)의 일부인가요?
수사적인 질문일 수도 있지만 혹시 몰라 답하자면, 검색은 항상 하니스의 일부입니다. 모델은 주어진 입력에 대해 다음 토큰을 예측하는 일만 합니다. 그 토큰이 도구 호출을 일으키는 [[web search]] 같은 것일 수는 있어도, 실제 호출은 하니스가 처리합니다.
지금은 얼리 액세스뿐이고, 가중치도 기술 세부 사항도 없이 정보를 받으려면 여기서 가입하라는 게 전부예요.
오픈 모델이 더 많아지는 건 대환영이지만, 말만 하는 건 쉽잖아요. 뒷받침할 게 아무것도 없는 발표는 꽤 의미 없다고 생각해요. 가중치랑 HF 저장소를 공개하든가, 아니면 입 다물고 있든가 하세요.
GPU 1만 개를 한 달 동안 돌려 만든 결과물을 공짜로 풀려는 회사한테 이제는 그 정도 대접밖에 못 해주나요? 홍보 글 하나 없이 그냥 풀든가, 아니면 입 다물고 있으라고요? 저도 저분 못지않게 오픈소스를 지지하지만, 이건 말이 너무 독하네요.
게다가 "독점 데이터셋"이라니 ㅋㅋㅋ 보여 주기 싫다는 뜻이겠죠. 갖고 있으면 안 되는 데이터이거나, 아니면 학습 데이터에 특별한 게 전혀 없는데 뭔가 비법 재료가 있는 것처럼 들리게 하려는 거겠죠. 실제로는 없는데요.
데이터를 공유하지 않는 건 꽤 표준적인 관행입니다. 1) 변호사가 끼어들기 쉽고 2) 좋은 데이터가 좋은 결과의 핵심이기 때문입니다.
제 생각에는 좋은 데이터에 평범한 모델링 기법을 쓰는 쪽이, 뛰어난 모델링 기법에 나쁜 데이터를 쓰는 쪽보다 결과가 더 좋습니다. 데이터가 나쁘면 평가(eval)도 나빠서 모델이 좋은지조차 알 수 없으니까요.
앤트로픽이 중국의 증류 "공격"에 난리를 치는 것도 이 때문입니다. 깔끔한 추론 기록(reasoning trace)은 금덩어리거든요.
데이터에는 저작권 문제가 있어서, 모든 저작권자의 허락을 받지 않고는 보통 공유할 수 없습니다. 어차피 그 데이터는 그들이 공유할 수 있는 게 아니고요. 거기서 파생된 (학습된) 가중치는 다른 문제입니다.
프런티어 랩 회사라면 아주 흔한 일이에요. 합성 데이터든 라벨링 데이터든 좋은 데이터가 있어야 하거든요. (중국 오픈소스 모델은 다들 자체 데이터 라벨러 부대를 두고 있고요.)
같은 급의 동시대 모델(DeepSeek V4.1 Flash)과 주요 수치를 비교해 보면 재미있겠다 싶었습니다.
얼핏 보면 벤치마크는 인상적이지만, 리누스의 말을 빌리면 이렇게 되겠죠. "말은 쉽다, 가중치를 보여 달라." :-)
맞아요, 이 시대에는 "가중치를 보여 달라"를 당연하게 만들어 봐요.
더 큰데도 더 작은 기존 중국 무료 모델보다 성능이 떨어진다고요? 오픈 웨이트 모델은 좋은 일이지만, 지금은 서구 모델이 중국 모델에 한참 뒤처진 것 같습니다. 중국 기업들은 연구 결과도 많이 공개하는데 말이죠. 오픈 모델과 제공 업체가 더 늘었으면 좋겠습니다. 경쟁 없이 중국 모델이나 미국 모델 중 하나에 묶여 버리는 건 위험하니까요.
그나마 구글은 Gemma 모델을 아주 잘 만듭니다. 언어를 실제로 잘 다루는 몇 안 되는 언어 모델이에요. 오픈AI의 최상위 비공개 모델은 노르웨이어를 제대로 쓰지도 못합니다.
제대로 만들려면 시간도 걸리고 몇 번 시행착오도 겪어야 하고(게다가 기준점도 계속 움직이죠), 시도 하나하나가 비싸긴 합니다. 개인적으로는 규모를 좀 너무 키웠다는 느낌인데, 한편으로는 RL이 정체되지 않았다고 하니 좋은 수일지도 모르겠네요. 예산이 1억 달러쯤 되지 않았을까요?
DeepSeek v4.1 Flash보다 크고, 돌리는 비용도 더 많이 들고, 측정된 지표는 전부 더 나빠 보이는데요.
제가 놓친 게 있나요?
내세우는 문구("Beam은 서구 오픈 웨이트의 최전선을 넓힙니다")를 보면, 중국 랩이 아니라는 게 주된 셀링 포인트 중 하나인 게 분명합니다.
개인한테 그게 중요할 것 같지는 않지만, 외국 모델 사용을 금지하는 정부 계약을 맡은 누군가는 어딘가에 있겠죠.
리플렉션은 "미국판 딥시크 프로젝트"를 만들겠다는 아이디어로 투자를 받았습니다.
누가 자금을 대는 거죠?
엔비디아, 에릭 슈미트, 세쿼이아 등 여럿인 것 같네요 https://techcrunch.com/2025/10/09/reflection-raises-2b-to-be-americas-open-frontier-ai-lab-challenging-deepseek/
HN을 10년 넘게 했으면서 왜 아주 간단한 질문조차 구글에 안 쳐 보는지 아직도 이해가 안 돼요.
반대로, 사람들은 아마 찾아보기는 할 거예요. 진짜 대단한 필터는 그 사람들 중 몇이나 돌아와서 유용하고 흥미로운 정보를 올리느냐죠.
질문의 진짜 의도는 "이 자금 지원의 동기를 분석해 보자"에 가까운 거죠.
그렇다면 훨씬 나은 글은 "방금 찾아봤는데 X, Y, Z가 자금을 대고 있네요. 제 생각에 Y는 $REASON 때문에 투자한 것 같아요..." 같은 거겠죠.
쉽게 검색할 수 있는 걸 묻는 건 그냥 게으른 겁니다.
제 TempleOS는 BIOS 다음에 ring0에서 곧장 해커뉴스 UI로 넘어가는데, 그게 스크롤하고 댓글에 들어가고 댓글 쓰는 것만 되거든요.