
- 중국 MiniMax가 6월 1일 오픈웨이트 모델 ‘M3’를 공개했다. 프런티어급 코딩, 100만 토큰 맥락, 네이티브 멀티모달을 한 모델에 모두 담은 첫 오픈 모델이라는 점이 핵심이다.
- 새 어텐션 구조 MSA 덕분에 100만 토큰 맥락에서 토큰당 연산량이 이전 세대의 1/20로 줄고, 입력 처리는 9배·응답 생성은 15배 이상 빨라졌다.
- 코딩 벤치마크 SWE-Bench Pro 59%로 GPT-5.5와 Gemini 3.1 Pro를 앞섰고(자체 측정), CUDA 커널 최적화를 24시간 자율로 수행해 하드웨어 효율을 7.6%에서 71.3%로 끌어올렸다.
- 다만 수치 대부분이 자체 인프라 측정값이라 독립 검증은 아직 남아 있다. 가중치와 기술 보고서는 공개 후 약 10일 내 Hugging Face와 GitHub에 풀릴 예정이다.
아무도 답을 알려주지 않은 문제 하나를 던져놨더니, 그 AI는 24시간 동안 혼자 147번을 고쳐 쓰며 결국 풀어냈다. 더 놀라운 건 이 모델이 ‘공짜로 받아 직접 돌릴 수 있는’ 오픈웨이트라는 점이다. 6월 1일 중국 MiniMax가 공개한 M3 이야기다. GPT-5.5와 Claude Opus가 독점하던 영역에 오픈 모델이 처음으로 정면 진입했다.
MiniMax M3, 무엇이 공개됐나
MiniMax는 상하이에 본사를 둔 중국 AI 기업이다. 이번에 공개한 M3는 세 가지를 한꺼번에 갖췄다는 점에서 의미가 크다. 첫째 코딩·에이전트 작업에서 프런티어급 성능, 둘째 최대 100만 토큰의 초장문 맥락, 셋째 이미지와 영상을 입력으로 받고 데스크톱 컴퓨터까지 조작하는 네이티브 멀티모달이다.
이 세 가지는 그동안 GPT-5.5, Gemini 3.1 Pro, Claude Opus 같은 폐쇄형(closed-source) 최상위 모델의 전유물로 여겨졌다. MiniMax는 M3가 이 세 조건을 모두 충족한 ‘첫 번째이자 유일한 오픈웨이트 모델’이라고 밝혔다. 즉, 가중치를 내려받아 자체 서버에서 돌릴 수 있는 모델이 처음으로 상위권 독점 모델과 같은 체급에 들어섰다는 뜻이다.
지금 바로 쓸 수 있는 형태
M3는 공개 시점부터 MiniMax Code(전용 에이전트 앱), 토큰 구독 요금제, 표준 API로 곧장 제공됐다. 구독은 월 20달러에 약 17억 토큰부터 시작해 월 120달러에 약 98억 토큰까지 제공한다. API는 입력 51만 2천 토큰 이하면 표준 단가, 그 이상이면 초장문 단가로 차등 과금하며, 추론(thinking) 모드를 요청마다 켜고 끌 수 있다.
Trend Insight — 오픈웨이트와 ‘프런티어 성능’은 그동안 양립하기 어려운 조합이었다. M3는 그 경계를 흔든 첫 사례로, 폐쇄형 모델만 쓰던 기업에 ‘직접 호스팅’이라는 현실적인 선택지를 다시 테이블에 올린다.
핵심은 ‘MSA’…100만 토큰을 1/20 비용에
M3의 진짜 무기는 새 어텐션 구조인 MSA(MiniMax Sparse Attention)다. 기존의 풀 어텐션(full attention)은 모든 토큰을 다른 모든 토큰과 비교하기 때문에, 입력이 길어질수록 연산량이 제곱으로 폭증한다. 맥락을 길게 늘릴수록 비용이 감당 불가능해지는 근본 원인이 바로 이것이다.
MSA는 발상을 바꾼다. 저장된 맥락(KV 캐시)을 블록 단위로 쪼갠 뒤, 가벼운 ‘인덱스 분기’가 지금 질문과 실제로 관련 있는 블록만 미리 골라낸다. 그리고 선택된 블록에 대해서만 어텐션을 계산한다. 여기에 GPU 연산 단계에서도 블록을 한 번씩만 읽도록 순서를 뒤집어, 메모리 접근을 연속적으로 만들었다. MiniMax는 이 구현이 오픈소스 대안(Flash-Sparse-Attention, flash-moba)보다 4배 이상 빠르다고 설명했다.
숫자로 본 효율
결과는 분명하다. 100만 토큰 맥락 기준으로 M3의 토큰당 연산량은 이전 세대의 1/20 수준이다. 입력(프리필) 처리는 9배 이상, 응답(디코딩) 생성은 15배 이상 빨라졌다. 게다가 여러 검증에서 MSA는 풀 어텐션과 거의 동일한 성능을 유지했다. 성능을 깎지 않으면서 ‘맥락 길이’를 비용 걱정 없이 늘릴 수 있는 차원으로 바꿔놓은 셈이다.
Trend Insight — 긴 맥락은 더 이상 ‘비싼 옵션’이 아니라 기본 사양이 되어가고 있다. 코드베이스 전체나 수백 쪽 문서를 한 번에 넣고 작업하는 워크플로가 비용 측면에서 현실화된다는 점이, 개발 현장에서 가장 체감되는 변화다.
24시간 자율 코딩이 보여준 것
MiniMax는 M3의 장시간 자율 수행 능력을 보여주는 내부 실험 세 가지를 공개했다. 가장 인상적인 사례는 엔비디아 Hopper GPU용 FP8 행렬 곱셈 커널 최적화였다. 숙련된 팀도 1~2주가 걸리는 작업인데, M3는 과제 설명과 벤치마크 스크립트, 그리고 실행도 안 되는 코드 골격만 받은 채 시작했다. 베낄 정답이 없는 상태였다.
M3는 약 24시간 동안 147회의 벤치마크 제출과 1,959회의 도구 호출을 거치며 스스로 병목을 진단하고 코드를 다시 썼다. 그 결과 Hopper 하드웨어 활용률을 7.6%에서 71.3%로 끌어올렸고, 초기 버전 대비 9.4배 빨라졌다. 대다수 모델이 수십 번 시도 후 포기한 반면, M3는 여러 정체 구간을 넘기며 145번째 제출에서야 최고 해법을 찾아냈다.
두 번째 실험에서는 ICLR 2025 우수논문 ‘Learning Dynamics of LLM Finetuning’을 약 12시간 동안 자율로 재현하며 18개의 커밋과 23개의 실험 그래프를 만들어 핵심 결과를 검증했다. 세 번째 PostTrainBench에서는 사람 개입 없이 모델 4개를 직접 학습시키는 과제에서 0.37점으로, Opus 4.7(0.42)과 GPT-5.5(0.39)에 약간 뒤졌지만 나머지 모델은 크게 앞섰다. 자율 웹 검색(BrowseComp)에서는 83.5점으로 Opus 4.7(79.3)을 오히려 앞질렀다.
Trend Insight — 핵심은 ‘한 번에 얼마나 좋은 코드를 뽑느냐’가 아니라 ‘얼마나 오래 스스로 버티며 문제를 푸느냐’로 옮겨가고 있다. 장시간 자율 반복은 차세대 에이전트의 진짜 경쟁력이며, MSA의 긴 맥락 처리 능력이 이를 받쳐주는 토대다.
한국 기업과 개발자에게 주는 의미, 그리고 주의점
오픈웨이트 모델이 상위권 성능에 근접했다는 사실은 도입 전략을 바꾼다. 데이터 보안이 중요한 기업은 모델을 자체 인프라에 올려 외부 API에 민감 정보를 흘리지 않고도 코딩·문서 처리 에이전트를 운영할 수 있다. 100만 토큰 맥락은 대형 코드베이스나 방대한 사내 문서를 통째로 다루는 작업에 특히 유용하다.
다만 냉정하게 볼 지점도 있다. 공개된 벤치마크 수치는 상당수가 MiniMax 자체 인프라에서 측정한 값으로, 독립적인 제3자 검증은 아직 진행 중이다. 또한 발표 직후 Anthropic이 다소 더 강력한 Opus 4.8을 내놓는 등 최상위 경쟁은 계속 빨라지고 있다. 가중치와 기술 보고서가 공개 후 약 10일 내 Hugging Face와 GitHub에 풀릴 예정인 만큼, 실제 도입을 검토 중이라면 공개 가중치를 직접 벤치마크해보고 판단하는 편이 안전하다.
Trend Insight — ‘오픈이냐 폐쇄냐’의 구도가 다시 뜨거워지고 있다. M3의 등장은 가격 협상력과 기술 자립이라는 두 카드를 동시에 기업 손에 쥐여준다. 단, 화려한 자체 발표 수치보다 공개될 가중치의 실측 성능이 진짜 시험대가 될 것이다.
관련 글
출처
- MiniMax, “MiniMax M3: Frontier Coding, 1M Context, Native Multimodality” (공식 블로그, 2026-06-01)
- The Decoder, “MiniMax M3: Open-weight model with a million-token context challenges proprietary leaders” (2026-06-01)
- MarkTechPost, “MiniMax Releases MiniMax M3 with MSA Architecture” (2026-06-01)
AI Biz Insider · AI 트렌드 · aibizinsider.com
댓글 남기기