Thinking Machines Inkling: 975B, 오픈, 그리고 실행하기 어려운 모델

마지막 업데이트: 2026-07-16 10:38:52

Thinking Machines Inkling은 2026년 7월 15일에 출시된 9750억 개의 파라미터를 가진 오픈 웨이트 모델로, 토큰당 410억 개의 파라미터만 활성화하는 희소 혼합 전문가(sparse mixture-of-experts) 구조로 설계되었으며 텍스트, 이미지, 오디오 입력을 받습니다. Apache-2.0 라이선스로 제공되므로 전체 가중치를 다운로드해 상업적으로 파인튜닝할 수 있습니다. 다만 4비트 양자화에도 대략 600GB의 VRAM이 필요하므로, 이는 게임용 GPU에서 실행하는 모델이 아니라 클러스터에서 평가하는 모델입니다.

사양, 그리고 헤드라인이 잘못 전달한 것

다음은 Hugging Face model card공식 Inkling 페이지에 명시된 내용입니다(2026년 7월 16일 접속).

사양Inkling
총 파라미터 수975B
활성 파라미터 수토큰당 41B
아키텍처66층 디코더 전용, sparse MoE (256 experts, 6 routed + 2 shared)
모달리티텍스트, 이미지, 오디오 입력; 텍스트 출력 (UTF-8)
학습 데이터45조 토큰
라이선스Apache-2.0
다운로드Hugging Face (thinkingmachines/inkling)

출시 보도에서 떠돌고 있는 세 가지 사실을 바로잡아야 합니다:

  • 컨텍스트 창. 몇몇 소개글에서는 1M 토큰 창이라고 인용했습니다. 공식 Inkling 페이지에는 표준은 64K로, Tinker 플랫폼을 통해 실행할 경우 256K로 나와 있으며, Hugging Face 카드에는 숫자가 전혀 명시되어 있지 않습니다. 확인 가능한 수치로는 64K/256K를, 1M은 확인되지 않은 것으로 보세요.
  • 라이선스. 이는 가장 허용적인 라이선스 중 하나인 Apache-2.0으로 확인되었으며, 상업적 사용도 허용됩니다. Thinking Machines는 미세 조정 안전성에 대한 책임을 사용자에게 맡깁니다.
  • "Inkling-Small." 약 12B의 활성 파라미터를 가진 더 작은 변형이 일부 보고서에 나타났지만, Hugging Face 모델 카드에는 सूची되어 있지 않습니다. 거기에 표시되기 전까지는 이를 전제로 계획하지 마세요.

여기서 "975B parameters"가 실제로 의미하는 것

Inkling은 각 토큰을 256개의 전문가 중 6명과 2명의 공유 전문가에게 라우팅하므로, 전체 풀은 975B이지만 한 번에 활성화되는 파라미터는 약 41B에 불과합니다. 그래서 Thinking Machines는 코딩에서 Nvidia의 Nemotron 3 Ultra와 맞먹는 성능을 내면서도, 그에 도달하는 데 필요한 토큰은 대략 3분의 1 적게 쓴다고 주장합니다: 중간 규모 모델의 추론 비용으로 대규모 모델의 폭넓음을 얻는 셈입니다.

Inkling은 "thinking effort" 다이얼도 제공합니다. 더 어려운 문제에서는 이를 높여 더 느리고 더 신중한 답변을 받아들이고, 속도를 원하면 낮추세요. 이 모델은 추측하기보다 불확실성을 표시하도록 훈련되어 있으며, 이는 소비자용 챗봇보다 fine-tuning 기반 모델에 더 중요합니다.

Inkling을 실제로 실행할 수 있나요?

여기서 "open weights" 라벨은 복잡해집니다. 왜냐하면 open이 가볍다는 뜻은 아니기 때문입니다. 모델 카드와 초기 커뮤니티 추정치를 바탕으로, 전체 975B 모델을 서빙하려면 대략 다음과 같은 것이 필요합니다(이는 대략적인 추정치일 뿐, 보장은 아닙니다):

Approximate VRAM required to run Inkling at different quantization levels
  • BF16 (전체 정밀도): 가중치만으로 약 2TB의 VRAM이 필요하므로, 서빙 오버헤드를 더하기 전에도 16개 이상의 H200급 GPU 또는 8-GPU B300 노드가 필요합니다.
  • NVFP4 / 4비트: 약 600GB로, 여전히 멀티 GPU 서버 영역입니다(대략 H200 4개 또는 80GB 카드 8개).
  • 1-2비트 GGUF (llama.cpp / Unsloth quants): 총 RAM+VRAM 약 280~350GB로, 고급 워크스테이션이나 사양을 최대한 끌어올린 Mac Studio Ultra에서 구현 가능하며, KV cache가 커지기 때문에 긴 컨텍스트로 갈수록 속도는 더 느려집니다.

솔직히 말하면: 자금이 넉넉한 팀이라면 Inkling을 평가하고 미세 조정할 수 있지만, 오늘날 이를 로컬에서 실행할 수 있는 소비자용 GPU 경로는 없습니다. 단일 24GB 카드에 로드해 보려는 솔로 개발자라면, 이것은 당신을 위한 모델이 아닙니다. Hugging Face에서 thinkingmachines/inkling를 다운로드하거나, Thinking Machines의 Tinker 플랫폼을 통해 미세 조정할 수 있으며, 이 플랫폼은 256K 컨텍스트도 사용할 수 있게 해줍니다.

Inkling이 다른 모델들과 비교해 어디에 위치하는가

Thinking Machines는 Inkling이 현재 사용 가능한 가장 강력한 모델은 아니라고 명시적으로 밝히고 있으며, model card의 벤치마크도 이를 뒷받침합니다: Inkling은 좋은 점수를 받지만 추론과 코딩에서는 폐쇄형 최첨단 모델에 뒤처집니다.

Inkling benchmark scores compared with the best rival on each test
벤치마크Inkling언급된 최고 경쟁자
AIME 202697.1%GPT 5.6 Sol, 99.9%
SWE-bench Verified77.6%Claude Fable 5, 95.0%
MMMU Pro73.3%Claude Fable 5, 84.2%
VoiceBench91.4%Gemini 3.1 Pro, 94.3%

*출처: Inkling 모델 카드 및 공식 벤치마크 페이지, 2026년 7월 16일에 열람함.*

공식 레이더 차트도 같은 이야기를 시각적으로 보여줍니다. Inkling은 reasoning과 multimodal tasks에서는 경쟁력을 보이지만, agentic coding(SWE-bench Pro, Terminal Bench)에서는 GPT 5.6 Sol과 Claude Fable 5보다 뒤에 있습니다.

Official Inkling benchmark radar comparing it with GPT 5.6 Sol and Claude Fable 5

강점은 폭넓은 기능에 있습니다: 하나의 오픈 모델에서 기본 오디오 및 이미지 이해를 제공하며, fine-tuning을 통해 코딩 격차를 줄일 수 있습니다. 별도 설정 없이 최고 수준의 agentic coding이 필요하다면, 여전히 폐쇄형 frontier 모델이 우위에 있습니다. 하지만 직접 소유할 수 있는 오픈 멀티모달 베이스가 필요하다면, Inkling이 더 흥미로운 선택입니다.

Inkling이 실제로 적합한 대상

Inkling은 완성된 어시스턴트가 아니라, 이를 바탕으로 구축하는 기반입니다. Thinking Machines는 메터링된 API 호출이 아니라 자사의 파인튜닝 플랫폼인 Tinker로 수익을 내므로, 모델 자체는 무료이며 제안은 "이걸 가져다가 특화하라"는 것입니다.

가장 분명한 증거는 Bridgewater Associates입니다. Thinking Machines에 따르면, 이 모델의 금융 맞춤형 버전은 회사의 추론 테스트에서 독점 모델 비용의 대략 14분의 1 수준으로 84.7%를 기록했습니다. 이것이 바로 의도된 활용 방식으로, 팀이 특정 도메인에 맞게 재구성할 수 있는 유능한 범용 모델입니다.

따라서 인프라와 오픈 모델을 특화하고 그 결과물을 직접 소유할 수 있을 만큼의 fine-tuning 전문성이 있으며, safety tuning에 대한 책임도 받아들일 수 있다면 적합합니다. 바로 사용할 수 있는 out-of-the-box chatbot을 원하거나 소비자용 하드웨어로 작업하고 있다면 건너뛰세요. 범용 closed models가 더 저렴하게 접근할 수 있고 첫날부터 더 강력하기 때문입니다. 알아둘 만한 한 가지 유의점은 Inkling의 post-training이 Moonshot의 Kimi K2.5를 포함한 다른 open models가 생성한 데이터를 사용했다는 점이며, Thinking Machines는 다음 세대가 완전히 self-trained가 될 것이라고 말합니다.

Inkling FAQ

Inkling은 상업적으로 무료로 사용할 수 있나요?

예. Apache-2.0 라이선스로 배포되며, 상업적 사용과 수정을 허용합니다. 배포하기 전에 안전성 미세 조정에 대한 책임은 귀하에게 있습니다.

Inkling은 어디에서 다운로드할 수 있나요?

전체 가중치는 Hugging Face의 thinkingmachines/inkling에 있습니다. 커뮤니티에서 만든 양자화된 GGUF 빌드도 그곳에 나타납니다.

Inkling은 정말 1M 토큰 컨텍스트 윈도우를 제공하나요?

공식 페이지에는 기본적으로 64K, Tinker 플랫폼을 통해 256K로 나와 있습니다. 일부 보도에 나온 1M 수치는 모델 카드에서 확인되지 않았으므로, 64K/256K 기준으로 계획하세요.

Inkling와 DeepSeek 또는 Qwen 중 어느 것이 더 나은가요?

단일 점수가 아니라 작업에 따라 다릅니다. Inkling의 강점은 Apache-2.0 모델 하나에서 텍스트, 이미지, 오디오를 지원하는 네이티브 멀티모달 입력과 Tinker 미세 조정 경로입니다. 반면, 선도적인 중국 오픈 모델들은 여전히 강력한 범용 및 코딩 선택지입니다. 최종 결정 전에 자신의 작업에서 벤치마크해 보세요.

Tinker란 무엇이며, 필요한가요?

Tinker는 Thinking Machines의 호스팅 fine-tuning 플랫폼입니다. open weights를 실행하는 데는 필요하지 않지만, Inkling을 커스터마이즈하는 공식 경로이며 context window를 256K로 확장합니다.

---

관련 읽을거리