요약
미스트랄이 1조 매개변수 공개 가중치 모델 'Mistral Large 4'를 미리보기로 내놓았습니다.
미스트랄은 10월 6일 Mistral Studio API로 Mistral Large 4의 공개 미리보기를 시작했습니다. 유럽 자체 데이터센터의 엔비디아 GPU 3,800개로 처음부터 학습한 모델이며, 가중치는 이달 말까지 공개하겠다고 밝혔습니다.
왜 중요한가
- 미국과 유럽에서 만든 공개 가중치 모델 가운데 가장 강하다고 내세웠습니다.
- 가중치를 받아 사설 클라우드나 자체 서버에 올릴 수 있어, 통제와 감사가 필요한 보안 조직에 맞춘 선택지가 됩니다.
핵심 내용
- 전체 매개변수 1조 개 가운데 490억 개만 켜는 전문가 혼합(MoE, 입력마다 일부 하위 망만 쓰는 구조) 모델입니다.
- 일반 응답과 추론을 한 모델에 합쳤고, 이미지 입력을 받으며 160개가 넘는 언어를 다룹니다.
- 보안 경진 문제 40개로 된 Cybench에서 93%를 풀어, 사이버보안을 가장 큰 강점으로 내세웠습니다.
- 금융 에이전트 평가에서는 GPT-6-Astra를, 하비의 법률 평가에서는 다른 공개 모델을 모두 앞섰다고 했습니다.
- 발표문 기준 API 요금은 100만 토큰당 입력 1.36달러, 출력 4.18달러입니다.
작성자 설명
제출자는 본문에 공식 모델 문서 링크만 남겼습니다. https://docs.mistral.ai/models/mistral-large-4-0
HN 반응
- 사이먼 윌리슨의 '자전거 타는 펠리컨' SVG 시험에서는 미스트랄 모델 중 가장 나은 그림이 나왔지만, 추론 설정에 따른 차이는 거의 없었습니다.
- 이 시험이 수년간 화제가 돼 학습 데이터에 들어갔을 것이라며, 다른 동물과 동작으로 시험해야 한다는 반론이 나왔습니다.
놀랍게도 추론(reasoning) 설정이 "none"과 "high" 두 가지만 지원됩니다.
이 설정은 실제로 별 차이가 없는 것 같았습니다. high로 하면 생각 흔적(thinking trace)이 아주 조금 붙긴 하는데, 출력 토큰은 오히려 none일 때보다 적게 나왔습니다.
그래도 자전거 프레임은 high 쪽이 none 쪽보다 낫습니다.
펠리컨: https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F0db8b8196e57711b352f6c5857cf5b35
(지금까지 본 미스트랄 모델 중에서는 단연 최고입니다: https://simonwillison.net/tags/pelican-riding-a-bicycle+mistral/ )
정말 흠잡을 데 없는 펠리컨이네요. 여러분, 제가 제일 먼저 말씀드립니다. AGI가 왔어요.
AGI가 "Attractions to Get Investments(투자 끌어모으기용 볼거리)"의 약자라면, 맞아요, 지금 벌어지고 있네요.
재미있네요, 저는 이니셜 말놀이가 좋아요 :) 퇴근 무렵의 멍한 머리로 5분 동안 뽑아낸 걸 볼까요:
Automated Grift Infrastructure (자동화된 사기 인프라)
Absurdly Glorified Interpolation (터무니없이 미화된 보간)
Avoid Genuine Investigation (진짜 조사는 피하자)
Always Great In-theory (이론상으론 늘 훌륭함)
오픈AI, 앤트로픽, 구글이 한마디 하고 싶다는데요.
아, 어설픈 일루미나티 말이군요
두 추론 모드가 그린 펠리컨 두 마리가 너무 비슷한 걸 보면, 이 새에 맞춰 일부러 튜닝했다는 의심이 강하게 듭니다. 널리 알려진 벤치마크에 들어 있지 않은 다른 동물, 다른 활동의 결과를 봐야 합니다.
자전거는 면도날 같고, 펠리컨 다리는 떨어져 나가고 있네요...
Avian Graphics Intelligence(조류 그래픽 지능) 달성!
어차피 펠리컨 벤치마크는 포화 상태잖아요. :-)
아니죠, 부리가 아직 너무 작아서 카피바라를 못 물겠는데요.
이건 AGI일 뿐이지 초지능(Super Intelligence)이 아니잖아요. 뭘 더 바라세요?
농담이시죠? SVG 펠리컨 그림은 몇 년째 HN 첫 페이지에 오르내렸으니 당연히 학습 데이터에 들어 있을 텐데요.
...그런데도...
SVG 포맷으로 사진처럼 사실적인, 자전거 탄 펠리컨은 언제쯤 볼 수 있을까요.
SVG로 사진 같은 장면을 인코딩할 수 있다고는 생각하지 않습니다. 픽셀마다 XML이 깊게 중첩된 꼴이 될 겁니다.
전혀 아닙니다. 모델 테스트에 자주 쓰이는 걸로 알려진 이미지를 잘 만들어 낸다는 것을 보여줄 뿐입니다. 사고력을 재는 척도가 아닙니다.
AGI는 모르겠지만, 유머는 사라졌네요.
윗 댓글은 비꼰 거라고 확신해요.
전혀요. 이건 인터넷에서 아주 흔한 푸아의 법칙(Poe's law) 사례예요. 이게 비꼼의 명백한 예라고 할 수 없는 건, 저 펠리컨이 AGI의 명백한 예가 아닌 것과 마찬가지죠!
동감이에요, 저한테는 전혀 분명하지 않았거든요... 링크를 클릭해 보기 전까지는요.
이제는 분명해졌어요.
우리는 예언된 바로 그 AGI의 시대에 살고 있는 게 틀림없어요.
저는 비꼬는 게 뻔하다고 생각했어요. 진지한 사람이 저 펠리컨을 보고 AGI의 증거라고 여긴다는 건 상상이 안 되니까요. 하지만 맞는 말씀이에요, 여긴 인터넷이니까 뭐든 가능하죠.
인터넷에선 당신이 사실 펠리컨이라는 걸 아무도 모르죠 ;-)
이거 비꼰 댓글이었나요?
방금 비꼼에 대한 튜링 테스트에서 탈락하셨네요. 기분이 어떠냐고 물어볼 수도 없어요. 그러려면 주관성이 있어야 하니까요.
밥 딜런은 물어볼 수 있죠.
기분이 꼭 구르는 돌 같대요
저는 /s 표시에 전적으로 찬성해요.
1차원적으로 해석했다고 비추천 폭탄을 던지는 건, 비꼼을 감지하는 레이더가 없는 사람들한테 좀 가혹해요.
Opus 5.5, GPT-6.1 Sol과 비교한 벤치마크를 보니 3D 생성 쪽은 꽤 괜찮아 보입니다: https://x.com/atomic_chat_hq/status/2107516529608700383
다른 모델들이 그 영상에서 평소보다 못했던 건, 경쟁사 모델의 광고를 만들어 주기가 "싫어서"가 아닐까 싶네요. 일반적인 영상으로 테스트하는 편이 더 의미 있을 것 같아요.
트위터의 그 한심한 주인 소유가 아닌 플랫폼에 올라온 예시는 없나요?