Kolibri: 소버린 오픈 웨이트 모델

Kolibri: A Sovereign Open-Weight Model

aleph-alpha.com ▲ 627 댓글 319 bastitx

요약

독일 알레프 알파가 영어·독일어 특화 모델 Kolibri를 Apache 2.0 오픈 웨이트로 공개했습니다.

독일 AI 기업 알레프 알파가 독일 통일의 날(10월 3일)에 맞춰 내놓은 모델입니다. 독일과 핀란드 인프라에서 유럽 법을 따라 학습했으며, 외국의 통제를 받지 않는 공급망이라는 점을 앞세웠습니다.

왜 중요한가

  • 공공 행정, 제조, 항공우주처럼 규제가 엄격한 분야가 외부 추론 서비스 없이 자체 서버에서 돌릴 수 있는 모델입니다.
  • 가중치와 함께 데이터 정제 과정까지 기술 보고서로 공개해, 학습 과정을 다른 팀이 살펴보고 따라 할 수 있습니다.

핵심 내용

  • 전체 매개변수는 780억 개지만 토큰마다 30억 개만 쓰는 전문가 혼합(MoE, 입력마다 일부 하위 망만 켜는 구조) 모델입니다.
  • 문맥은 256k 토큰으로 학습했고, 최대 100만 토큰까지 늘릴 수 있습니다.
  • H100 GPU 두 장으로 256k 토큰 요청 18개를 동시에 처리할 수 있다고 밝혔습니다.
  • 수학 시험 AIME 2025에서 96.9%를 기록해 활성 매개변수가 4배인 Nemotron 3 Super(91.7%)를 앞섰다고 했습니다.
  • 근거가 부족하면 답을 보류하도록 훈련해, 지식 평가 문항의 44%에서 오답 대신 보류를 택했습니다(전작은 15%).

작성자 설명

기술 보고서: https://aleph-alpha.com/downloads/tech-report.pdf

추가 논문: https://tej.as/blog/aleph-alpha-kolibri

HN 반응

  • 기술 보고서가 데이터셋 구축 과정까지 튜토리얼처럼 설명한다며 공개 수준을 높이 산 댓글이 많았습니다.
  • 누구나 쓰는 개방형 모델이 위험하다는 주장과 소수 기업의 독점이 더 위험하다는 반론이 핵무기 비유를 두고 길게 맞섰습니다.

댓글

30개 표시 · 전체 319개
  1. miellaby HN

    이 논문은 마치 "나만의 최신 에이전트형 LLM 만들기" 튜토리얼처럼 모든 것을 낱낱이 설명합니다. 데이터셋을 어떻게 만들었는지까지 알려 줍니다. https://aleph-alpha.com/downloads/tech-report.pdf ; 이 정도 수준의 공개는 처음 봅니다.

  2. ivo-42 HN

    저는 Kolibri에서 사전 학습 데이터와 미드 트레이닝(mid-training)을 맡았습니다. 저희는 최대한 열려 있으려고 노력하고 있습니다. 좋게 봐 주셔서 기쁩니다.

  3. soundworlds HN

    대단한 작업입니다. 이런 작업이 정말 필요합니다!

  4. brcmthrowaway HN

    이 규모에서 데이터는 어떻게 정제하나요?

  5. ivo-42 HN

    여러 형태의 중복 제거(정확 일치, 퍼지, 부분 문자열), 휴리스틱 필터, 그리고 데이터에 주석을 다는 품질 분류기를 증류해서 씁니다. 합성 방식의 재작성(rephrase)도 노이즈가 많은 기존 데이터에서 더 많은 것을 얻어 내는 일종의 정제로 볼 수 있습니다.

    더 깊이 알고 싶으시면 기술 보고서에 자세한 내용이 많이 있습니다.

  6. stephantul HN

    안녕하세요! 사전 학습에 쓸 분류기로 luxical과 model2vec 분류기를 비교해 보셨는지 궁금합니다.

    저는 model2vec 저자 중 한 명이고, 이 용도의 분류기를 학습시키는 중입니다. model2vec이 더 나을 거라고 생각하지만 대규모로 시험해 볼 기회는 아직 없었습니다. 혹시 해 보셨다면 결과를 알려 주시면 큰 도움이 되겠습니다!

  7. xvfLJfx9 HN

    이 모델을 훨씬 더 크게, 가령 500B~1T 파라미터로 만들어서 지금의 최상위 상용 모델처럼 범용 지식 작업에 쓰겠다는 계획이 있나요?

  8. ivo-42 HN

    기대해 주세요. 이건 시작일 뿐입니다. 코히어와 합병하면 규모를 키우는 데도 도움이 될 겁니다.

  9. idiotsecant HN

    오픈 프로젝트가 대체 어떻게 그걸 한다는 거죠?

  10. doctorpangloss HN

    독일 작가들에게는 얼마를 줘야 할까요? 앤트로픽이 줬던 것처럼 책 한 권에 3,000달러요?

    왜 굳이 이런 법적 책임을 떠안으려는 거죠?

  11. zelphirkalt HN

    제 생각에는 어떤 데이터를 넣어서 학습했는지 공개하지 않고, 제3자가 그걸 재현할 수 있게 하려는 노력도 없다면 "오픈"이라 부를 자격이 없습니다. 이 팀이 그렇게 해서 기쁩니다.

  12. davidjfelix HN

    공정하게 말하면, 이 논쟁은 여기서 이미 수없이 했고, 업계는 "오픈 웨이트(open-weight)"라는 말로 정리했습니다. 학습에 쓴 데이터는 공개하지 않고, 사후 학습을 마친 가중치만 공개하는 관행을 가리키는 말입니다.

    업계에서는 그렇게 부르고, 요즘은 업계 사람들 사이에서 꽤 분명한 정의로 통한다고 봅니다.

  13. slow_typist HN

    어떻게요? 학습 데이터가 공개돼 있나요?

  14. mm321 HN

    매우 흥미롭네요. 앞으로 나올 버전에 프랑스어를 추가할 계획이 있는지, 아니면 Kolibri는 계속 2개 국어(영어/독일어)로 가는지 궁금합니다. 적용 분야에 산업/항공우주가 들어 있으니 프랑스어 수요도 아마 있을 텐데요.

  15. dang HN

    언급된 논문은 여기 있습니다. https://tej.as/blog/aleph-alpha-kolibri .

    (이 댓글은 원래 https://news.ycombinator.com/item?id=49943034 에 올라왔는데, 스레드를 합치면서 옮겨 왔습니다.)

  16. amelius HN

    대학들이 나서서 이런 모델의 학습 데이터셋을 직접 큐레이션해 줬으면 좋겠습니다.

  17. WhyNotHugo HN

    정말 즐겁게 읽었습니다. 새 모델 발표 글로는 특히 그렇습니다.

    전체 과정의 세부 사항을 많이 배운 기분입니다. 읽다가 궁금한 점이 생겼고, 답을 찾아보다가 더 많이 배웠습니다.

    마케팅용 헛소리는 없고, 실제 정보가 가득합니다. 공개 수준도 정말 멋집니다!

  18. p-e-w HN

    성능이 최상위 모델과 완전히 같은 수준은 아닌데도, 이것만으로 화제가 된 여러 공개작보다 훨씬 가치가 있습니다.

  19. ofjcihen HN

    이게 새로운 표준이 되면 좋겠습니다.

    이런 모델이 계속 비공개로 남을 수 있다고, 심지어 비공개여야 한다고 생각한 사람이 있다는 게 저는 늘 말도 안 된다고 느꼈습니다.

  20. Loquebantur HN

    바라는 것을 조심하세요. 도구는 그걸 어디에 쓰라고 말해 주지 않습니다.

    오픈 소스 LLM은 AI라는 "지능 증폭기"를 "민주화"합니다. 하지만 거기에는 이점도 여럿 있지만 단점도 여럿 있습니다.

    인류는 "영적" 영역이 덜 발달했다는 심각한 문제를 안고 있습니다. 윤리를 일종의 취향 문제로 보는 경우가 많지만, 사실 윤리는 사회에서 질서와 혼돈을 가르는 차이입니다.

    누구나 무엇이든 할 수 있게 되면, 누군가는 여러분이 싫어할 일을 하게 됩니다. 그것도 임의의 규모로요.

  21. adrianN HN

    물론 개방이 소수의 비밀 집단에 모든 걸 맡겨 두는 것보다 나쁜 경우는, 그 집단이 우리 나머지보다 더 윤리적이라고 믿을 때뿐입니다.

  22. zanderwohl HN

    게다가 그 소수 집단은 종말을 믿고, 그걸 적극적으로 앞당기려는 사람들이기도 하죠.

  23. skinfaxi HN

    그 논리를 핵무기 확산에도 적용하시겠습니까?

    추가: 상위 댓글의 논리가 왜 AI에는 타당하고 핵 기술에는 타당하지 않은 겁니까?

  24. orbital-decay HN

    터무니없고 비교가 안 됩니다.

  25. skinfaxi HN

    왜죠? 성의 없는 일축처럼 보이는데요. 세상을 바꾸는 기술을 소수 집단이 쥐는 게 한쪽에서는 괜찮고 다른 쪽에서는 안 되는 이유가 뭡니까?

  26. orbital-decay HN

    "왜 바퀴는 독점하면 안 되는데 핵폭탄은 되는가?" 질문의 틀 자체가 처음부터 조작적입니다. 그런 질문을 던지는 순간 둘이 어떤 면에서든 비교 가능하다고 이미 전제하고 있는 거예요. 둘은 조금도 동등하지 않고, 이 비교 전체가 완전히 터무니없습니다.

  27. skinfaxi HN

    AI는 바퀴보다 핵무기에 더 가깝습니다. 동의하지 않으시나요? 덜 조작적인 틀을 제안해 주실 수 있나요? 저는 개인적으로 오픈 소스 AI와 모델을 지지합니다. 다만 우리가 다른 세상을 바꾸는 기술에는 실제로 이런 통제에 의존하는데도 이 "비밀 집단" 프레임이 이상해 보였던 겁니다. 그리고 AI는 바퀴와 달리 일반적인 의미에서 기술 발전을 가능하게 하는 방식이 전혀 다릅니다.

  28. orbital-decay HN

    AI는 (무엇에든 쓸 수 있다는 점에서) 핵폭탄(무차별 대량 살상을 위한 목적형 무기)보다 바퀴에 가깝고, 범주도 둘만 있는 게 아니니 극단에 호소해서 속담 속 고드윈의 법칙을 증명할 필요는 없습니다. 그래도 터무니없는 비교 불가능한 것들에 대한 터무니없는 질문에, 제가 그 질문에 줄 수 있는 만큼의 선의로 답하겠습니다. 터무니없는 가정을 근거로 범용 기술을 미리 통제하는 건 터무니없는 일입니다. 이건 너그럽게 해석한 답이고, 덜 너그러운 해석도 있습니다. 이 허수아비가 공개 토론에 쓰이면 이득을 보는 악의적인 괴짜들이 지어낸 헛소리라는 겁니다.

    >AI는 바퀴와 달리 일반적인 의미에서 기술 발전을 가능하게 하는 방식이 전혀 다릅니다.

    바퀴는 이미 거의 모든 기술을 가능하게 했습니다. 바퀴가 없었다면 주변에 보이는 것 중 어느 것도 가능하지 않았을 겁니다.

  29. Forgeties79 HN

    이봐요, ChatGPT는 한순간에 대도시를 날려 버리고 수백만 명을 죽일 수 있는 장치와 같지 않아요. 자명하잖아요. 이 논의 전체가 터무니없어요.

    핵무기는 인류에게 완전히 독특한 위협이에요.

  30. Loquebantur HN

    그건 오해이고 당신 쪽의 조작적 프레임입니다.

    "그냥 챗봇"이 문제가 아니라, 인간보다 뛰어난 범용 지능이 절대적으로 문제입니다.

    AI는 누구나 본질적으로 무엇이든 실행에 옮기게 해 줍니다. 그리고 당신이 말한 "대도시를 날려 버린다"는 사실 작은 과제에 불과합니다. 문제는 그게 실제로 불가능해서가 아니라 당신의 상상력이 부족하다는 데 있습니다.

Hacker News에서 보기 ↗