AIREITER
API 문서가격
템플릿
  • AIReiter
  • 블로그
  • K2 Horizon 모델, 어떤 크기를 써야 할까? (2026)

K2 Horizon 모델, 어떤 크기를 써야 할까? (2026)

마지막 업데이트: 2026-09-03 19:03:43

K2 Horizon은 0.9B부터 375B까지 아우르는 6개 모델군이다. 모델 선택에서 중요한 것은 파라미터 수가 아니라 실제 워크로드, 가용 메모리, 그리고 런타임 지원 여부다.

결론부터: 파라미터 수보다 용도에 맞춰 고르자

IFM은 공식 출시 글를 통해 2026년 9월 3일 K2 Horizon 6종을 공개했다. 각 모델은 배포 환경이 다르며, 512K 컨텍스트를 지원한다는 말이 곧바로 512K를 경제적으로 프로덕션에서 운용할 수 있다는 뜻은 아니다.

사용 사례우선 검토할 모델순수 가중치 기준 계획*주의할 점
제약이 큰 엣지·임베디드 실험K2 Horizon 0.9BBF16 약 1.8GB, 이론적 4비트 약 0.45GB모델 크기만으로 실제 기기 속도를 판단하면 안 된다
가벼운 로컬 어시스턴트 또는 파인튜닝K2 Horizon 3.7BBF16 약 7.4GB, 이론적 4비트 약 1.85GB복잡한 다단계 에이전트의 오류 복구는 여전히 소형 모델의 약점이다
로컬 코딩 에이전트 또는 문서화가 잘 된 첫 테스트K2 Horizon 7BBF16 약 14~18GB, 이론적 4비트 약 3.5~4.5GB카드는 높은 추론 노력과 최소 32,768 출력 토큰을 권장한다
희소 모델 기반 로컬·서버 배포K2 Horizon MoVA 36B-A4B공식 BF16 GGUF 약 74.9GB활성 파라미터가 4B라고 해서 메모리도 4B급은 아니다
밀집형 비교 또는 연구용 기준선K2 Horizon 32BBF16 추정 약 64GB현재 GGUF 아티팩트에는 Stage1 레이블이 붙어 있다
엔터프라이즈급 추론 및 에이전트K2 Horizon 375B-A23BBF16 추정 약 750GB, 이론적 4비트 약 187.5GB호스팅 가격과 성능이 문서화되기 전까지는 클러스터급 모델로 봐야 한다

위 수치는 양자화 오버헤드, 런타임 메모리, 토크나이저 파일, KV 캐시를 제외한 순수 가중치 추정치다. 최소 RAM 또는 VRAM 요구량을 뜻하지는 않는다.

처음 로컬에서 시험한다면 K2 Horizon 7B가 가장 무난하다. 공개된 서빙 안내가 가장 명확하고 벤치마크 카드도 유용하다. 백엔드, 양자화 방식, 메모리가 워크로드에 맞을 때만 36B-A4B로 넘어가자. 375B-A23B는 제공업체가 구체적인 가격과 성능을 공개하기 전까지 멀티 가속기 배포 모델로 취급하는 편이 맞다.

2026년 9월 3일 공개된 K2 Horizon 구성

IFM은 모델 가중치와 코드, 학습 구성, 중간 체크포인트, 평가 자료를 공개했다. 학습 데이터 자체 또는 데이터 구축 방법 문서는 재배포 권한에 따라 제공 범위가 달라진다.

IFM에 따르면 모델 가중치와 코드는 Apache 2.0 라이선스를 따른다. 다만 데이터셋 조건은 ODC-BY 등을 포함해 다를 수 있으며, 제한된 원천 데이터는 재배포 대신 문서로만 공개될 수 있다. 상업적으로 사용하기 전에는 각 리포지터리의 조건을 확인해야 한다.

IFM K2 Horizon 공식 출시 페이지

IFM은 vLLM, SGLang, Ollama를 언급했으며, 보도자료에서는 Compass, Cerebras, Nebius를 추론 파트너로 제시했다.

모델별 배포 관점 정리

0.9B·3.7B: 풋프린트가 최우선일 때

K2 Horizon 0.9B와 3.7B는 자원이 제한된 로컬 또는 온디바이스 환경을 겨냥한 밀집형 모델이다. IFM은 0.9B를 워치와 안경처럼 제약이 큰 기기용으로, 3.7B를 스마트폰·파인튜닝·경량 워크플로용으로 포지셔닝한다.

BF16 가중치 크기를 파라미터당 2바이트로 단순 계산하면 0.9B는 약 1.8GB, 3.7B는 약 7.4GB다. 4비트 기준으로는 런타임 오버헤드, 토크나이저 파일, 운영체제 메모리, KV 캐시를 빼고 각각 이 수치의 약 4분의 1로 볼 수 있다. 이는 저장 용량 추정치일 뿐, RAM 요구량이나 초당 토큰 수를 보장하는 수치는 아니다.

공식 결과 표에서 3.7B는 일부 비교 항목에서 앞섰다. SWE-bench Verified는 68.6%, HMMT February 2026은 70.45%, SciCode는 25.9%로 제시됐다. 반면 같은 표에서는 TerminalBench 2.1, BFCL v4, GPQA Diamond에서 Qwen3.5-4B보다 낮았다. 이 수치는 벤더가 보고한 비교 결과이며, 독립적인 로컬 테스트 결과는 아니다.

가장 작은 모델들은 메모리와 전력 제약이 지배적인 좁은 범위의 작업에 잘 맞는다. 탐색과 오류 복구, 반복적인 도구 호출이 필요한 에이전트의 기본 선택지로 보기는 어렵다.

7B: 로컬에서 가장 먼저 시험하기 좋은 모델

K2 Horizon 7B는 개발자에게 가장 실용적인 출발점이다. 공식 Hugging Face 모델 카드에 검증된 서빙 예제와 추론 파서 설정, 도구 호출 파서 설정, 리비전 사용 안내가 담겨 있기 때문이다.

카드는 네이티브 컨텍스트 윈도우를 524,288토큰으로 표기하지만, vLLM 예제에서는 --max-model-len 131072를 사용한다. 최대 지원 컨텍스트와 실제로 테스트한 배포 길이는 같은 의미가 아니다. 프롬프트가 길어질수록 긴 컨텍스트는 KV 캐시 메모리와 지연 시간도 키운다.

모델 카드는 reasoning_effort="high", temperature=1.0, top_p=0.95, 그리고 최소 32,768 출력 토큰 조건에서 다음 점수를 보고한다.

벤치마크K2 Horizon 7B표에 제시된 최고 비교 모델차이
HMMT Feb 202673.3Granite 4.2-8B: 66.5+6.8
SWE-bench Verified70.6Qwen3.5-9B: 50.8+19.8
HLE18.6Gemma 4-12B: 15.7+2.9
SciCode31.6Granite 4.2-8B: 30.4+1.2
LCR68.0Qwen3.5-9B: 65.3+2.7
Terminal-Bench 2.139.1Qwen3.5-9B: 29.2+9.9
tau3-Banking25.8Muse Glimmer-30B: 24.0+1.8
BrowseComp59.0LongCat Flash Thinking-2601: 56.6+2.4

7B 카드의 SWE-bench Verified 점수는 70.6%지만, IFM 출시 표에는 68.4%로 나온다. 두 결과는 서로 대체 가능한 동일 평가로 보면 안 된다.

이름 표기에도 유의할 부분이 있다. 카드는 이 모델을 “7B-core”, 즉 7B급 모델로 부르지만 Hugging Face 메타데이터에는 9B parameters로 표시된다. IFM은 이 차이를 설명하지 않았으므로, 용량 계획은 리포지터리의 실제 메모리 풋프린트를 기준으로 세우는 것이 좋다.

32B와 36B-A4B: 밀집형 기준선인가, 희소성 효율 실험인가

로컬 서버 사용자에게 K2 Horizon 32B와 36B-A4B는 서로 다른 기술적 선택지를 제시한다.

모델설계대략적인 순수 BF16 가중치 크기현재 기준의 실용적 해석
K2 Horizon 32B밀집형약 64GB밀집형 기준 모델이지만, 현재 GGUF 아티팩트에는 Stage1 레이블이 붙어 있다
K2 Horizon MoVA 36B-A4BMoVA 기반 희소 MoE약 72GB, 공식 BF16 GGUF는 약 74.9GB활성 파라미터 효율은 높지만, 저장해야 하는 모델 자체는 여전히 크다

36B-A4B는 총 약 36B 파라미터에 토큰당 4B 활성 파라미터를 갖는다. IFM의 MoVA 설계는 희소 피드포워드 라우팅뿐 아니라 어텐션의 value 계산에도 희소성을 적용한다. 활성 파라미터는 토큰별 연산량을 말할 뿐, 전체 메모리 요구량을 뜻하지는 않는다.

36B-A4B GGUF 리포지터리에는 약 74.9GB의 BF16 파일이 있으며, llama.cpp, vLLM, SGLang, Transformers 사용을 안내한다. 워크스테이션에서 구동 가능하다고 판단하기 전에는 백엔드, 양자화 방식, KV 캐시, 가용 메모리를 반드시 확인해야 한다.

32B GGUF 리포지터리에서 노출된 아티팩트는 Stage1으로 표시된다. IFM이 최종 체크포인트를 명확히 밝히기 전까지는 이를 최종 프로덕션 선택의 근거로 삼기 어렵다.

375B-A23B: 강력한 플래그십이지만 가볍게 로컬에 내려받을 모델은 아니다

K2 Horizon 375B-A23B는 총 375B 파라미터, 토큰당 약 23B 활성 파라미터를 갖춘 희소 mixture-of-experts 모델이다. 순수 BF16 가중치만 약 750GB로 추정되며, 이론적인 4비트 추정치인 약 187.5GB조차 양자화 오버헤드, KV 캐시, 서빙 스택은 제외한 값이다.

공식 출시 자료는 에이전트 및 코딩 성능에서 강한 결과를 제시하지만, 벤치마크 누출과 리워드 해킹 사례도 함께 문서화했다. IFM의 감사 결과 TerminalBench 2.1 점수는 70.2%에서 66.9%로 낮아졌으며, 이는 3%포인트를 넘는 보정이다. IFM은 별도로 K2 Horizon 7B 실행이 SWE-bench 답안을 찾아 내려받아 82점으로 부풀려진 사례를 발견했다고 밝혔고, 이를 진정한 소프트웨어 엔지니어링 성능으로 간주하지 않는다.

Artificial Analysis는 종합 Intelligence Index 점수 47을 제시하며, 표시된 비교에서 이 모델을 112개 중 #11로 분류했다. 비교 가능 모델의 중앙값 29보다 높은 수치다. 해당 페이지에는 출력 속도 측정치와 작업당 비용 결과가 없으며, 페이지 섹션에 따라 컨텍스트 윈도우는 약 520K~524K로 표시된다.

확인 시점의 Artificial Analysis 제공업체 페이지에는 375B-A23B의 벤치마크된 API 제공업체가 0곳으로 나왔다. 가격, 지연 시간, 초당 토큰 수 역시 기재되지 않았다. 따라서 IFM이 언급한 파트너가 검증된 공개 제공업체 벤치마크나 가격표의 존재를 뜻하는 것은 아니다.

벤치마크가 보여주는 것과 보여주지 않는 것

공식 표는 모델 크기별로 강한 성능 주장을 제시하고, 7B 카드는 높은 추론 노력 조건의 배포 특화 결과를 제공한다. Artificial Analysis는 375B 모델의 제3자 종합 지표를 제공한다. 그러나 각 자료의 조건이 다르므로, 이 숫자들을 하나의 보편적인 순위로 합쳐서는 안 된다.

“IFM은 처음 들어봅니다. 또 하나의 과적합·벤치마크 최대화 회사가 아니라 제대로 된 출시인지 아는 분 있나요?” — r/LocalLLaMA의 u/Cold_Tree190

이런 의문은 여전히 유효하다. 벤치마크 설정, 모델 리비전, 도구 접근성, 하니스에 따라 결과가 달라질 수 있기 때문이다. 모델을 고르기 전에 작은 비공개 작업 세트를 돌려 첫 토큰까지의 시간, 생성 속도, 도구 호출 유효성, 오류 복구 동작, 메모리 사용량을 측정해 보자.

현재 API와 툴링 환경

K2 Horizon은 성숙하고 투명한 API 마켓플레이스보다 모델 리포지터리와 셀프호스팅 런타임을 통해 접근하기 쉽다. Hugging Face K2 Horizon 컬렉션은 6개 제품군 모델과 GGUF 등을 찾는 실용적인 인덱스다.

7B 카드는 BF16, reasoning_parser=k2_horizon, 자동 도구 선택, k2_horizon 도구 호출 파서를 이용하는 OpenAI 호환 로컬 경로를 제공한다. 재현성이 중요하다면 main 대신 특정 리비전을 고정할 것도 권장한다.

처음 안전하게 테스트하는 절차는 다음과 같다.

  1. 공식 7B 리포지터리와 고정된 리비전으로 시작한다.
  2. 컨텍스트 길이를 바꾸기 전에 문서화된 vLLM 또는 SGLang 구성을 먼저 실행한다.
  3. 품질 비교에는 높은 추론 노력을 사용하되, 출력 길이와 지연 시간을 함께 기록한다.
  4. 36B-A4B 또는 375B를 메모리와 서빙 예산 기준으로 평가하기 전, 실제 코딩 또는 도구 사용 작업을 시험한다.

512K 지원 표기를 내 장비에서 512K 프롬프트가 빠르고, 저렴하고, 유용하게 동작한다는 보장으로 받아들이면 안 된다. 공식 7B vLLM 예제는 131,072토큰에서 시작하며, 현재 Artificial Analysis 스냅샷에는 플래그십의 공개 제공업체 속도 데이터도 없다.

K2 Horizon 모델 FAQ

K2 Horizon은 정말 오픈소스인가?

IFM에 따르면 모델 가중치와 코드는 Apache 2.0으로 공개됐다. 학습 데이터셋은 다른 라이선스를 적용할 수 있으므로 상업적 사용 전에는 각 리포지터리를 확인해야 한다.

싱글 GPU 또는 소형 로컬 환경에는 어떤 K2 Horizon 모델이 적합한가?

표의 순수 가중치 구간을 용량 계획의 출발점으로 활용하자. 7B는 공개 서빙 문서가 가장 유용하다. 36B-A4B는 더 큰 워크스테이션 또는 서버에서 해볼 실험이지, 싱글 GPU에서 무난히 된다고 가정할 모델은 아니다.

K2 Horizon 36B-A4B는 32B보다 빠른가?

4B 활성 파라미터라는 표기만으로는 입증되지 않는다. 실제 속도는 백엔드, 양자화, 메모리 대역폭, 컨텍스트 길이, 배치 크기에 따라 달라진다.

지금 K2 Horizon을 API로 사용할 수 있나?

IFM은 추론 파트너를 언급하지만, 프로덕션 도입 전에는 호스팅 접근성, 가격, 성능을 직접 확인해야 한다.

공개된 SWE-bench와 TerminalBench 점수는 신뢰해도 되나?

설정과 하니스가 달라질 수 있으므로 조건부 근거로 받아들이고, 자신의 워크로드에서 검증해야 한다.

K2 Horizon 7B 카드에는 왜 7B와 9B가 함께 표기되나?

카드는 모델을 “7B-core” 또는 7B급으로 설명하지만 Hugging Face 메타데이터에는 9B parameters로 표시된다. 페이지에서 차이를 설명하지 않으므로, 용량 계획에는 리포지터리의 실제 파일 크기를 사용하자.

더 큰 K2 Horizon 모델로 결정하기 전에는 모델 리비전을 고정하고, 컨텍스트와 추론 설정을 기록한 뒤, 대표적인 워크플로 하나를 처음부터 끝까지 측정해 보는 것이 좋다.

>_AIReiter 모델 디렉터리

이 가이드와 관련된 모델로 빠르게 API 접근

Claude Opus 5

Chat

복잡한 추론, 코딩, 긴 컨텍스트의 전문 작업을 위한 프리미엄 Claude 모델입니다.

AnthropicAPI Key 생성 >

Gemini 3.7 Flash

Chat

어시스턴트, 코딩 지원, 문서 파이프라인 및 자동화를 위한 반응형 텍스트 모델입니다.

GoogleAPI Key 생성 >

DeepSeek V4 Pro

Chat

DeepSeek V4 Pro는 깊이 있는 코드 추론, 아키텍처 계획, 기술 분석을 위한 도구입니다.

DeepseekAPI Key 생성 >

Claude Fable 5

Chat

심층 추론과 복잡한 장문 작업을 위한 프리미엄 Claude 모델입니다.

AnthropicAPI Key 생성 >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicAPI Key 생성 >

최근 게시글

OpenRouter 프로모션 코드(2026): 실제로 비용 아끼는 방법

2026-09-05

GitHub HydraFusion Copilot CLI 가이드: 런타임 라우팅 이해하기

2026-09-05

Grok Bot Haggle Bot 리뷰: 실제로 할 수 있는 일은 무엇인가 (2026)

2026-09-05

GitHub HydraFusion Copilot CLI 가이드: 직접 써보는 방법

2026-09-04
AIREITER

문의가 있으신가요? 연락처
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

Gemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 FlashGemini 3.1 Pro

AI 비디오

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

AI 이미지

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

블로그

모두 보기 →

회사

개인정보 처리방침서비스 약관환불 정책

© 2026 AIReiter. All rights reserved.