GLM-5.3을 데스크톱 GPU 한 장에서 돌릴 수 있는지 궁금하다면, 결론은 아니오입니다. 현재 공개된 플래그십 체크포인트는 서버급 메모리를 요구합니다. GLM-5.3-Flash는 진입 장벽을 낮추지만 이 역시 대형 멀티 GPU 모델입니다. 양자화 체크포인트를 로드할 수 있다는 사실과 반응성 있는 코딩 에이전트로 서빙할 수 있다는 것은 전혀 다른 문제입니다.
한눈에 보는 GLM-5.3 하드웨어 기준
정식 GLM-5.3의 문서화된 FP8 구성은 GPU 8장이며, 완전한 100만 토큰 컨텍스트 목표는 8× B200에서 제시됩니다. 희소 MoE 라우팅은 토큰마다 일부 파라미터만 활성화하지만, 그렇다고 24 GB·64 GB·128 GB·192 GB 시스템이 풀 모델을 실용적으로 돌릴 수 있는 것은 아닙니다.
| 대상 | 공개된 근거 | 근거 유형 | 실질적인 판단 |
|---|---|---|---|
| GLM-5.3 네이티브 FP8 | 공식 vLLM 레시피에서 8× H200 또는 H20 제시 | 공식 토폴로지 | 서버급 또는 전문 워크스테이션 배포 대상. |
| GLM-5.3 BF16 | 별도 BF16 체크포인트와 vLLM 레시피의 멀티노드 서빙 안내 | 공식 배포 참고 사항 | 평가 또는 최상급 프로덕션 환경용. |
| GLM-5.3 NVFP4 | 공식 vLLM 레시피에 약 465 GB 규모의 Blackwell 체크포인트 Inferact/GLM-5.3-NVFP4 명시 | 공식 레시피에 등재된 커뮤니티 체크포인트 | Blackwell 전용 실험 또는 서비스 경로. |
| GLM-5.3 양자화 | 커뮤니티 2비트 GGUF 보고서에서 약 281 GB 파일 사용 | 커뮤니티 패키징이며 Z.ai 공식 용량 정보 아님 | 오프로딩 실험은 가능하지만 일반적인 데스크톱 설치 대상은 아님. |
| GLM-5.3-Flash | 검증된 프로필에서 175.6 GB 4-bpw 체크포인트와 2× RTX PRO 6000 Blackwell 96GB 사용 | 커뮤니티 검증 | 현실적인 로컬 GLM 선택지지만 여전히 멀티 GPU 필요. |
현재 Hugging Face 모델 카드에는 총 753,329,940,480개 파라미터, FP8 파라미터 751,226,191,872개, safetensors 전체 파일 크기 755,643,409,571바이트가 기재되어 있습니다. vLLM 레시피는 이를 총 약 743B, 활성 파라미터 39B로 반올림해 표기합니다. 반올림 수치에는 다소 차이가 있지만 하드웨어 결론은 달라지지 않습니다.
가중치 메모리만 단순 계산하면
아래 수치는 KV 캐시, 활성값, 런타임 버퍼, 할당기 오버헤드를 제외한 산술적 추정치입니다. FP8과 BF16은 현재 플래그십의 약 753B 파라미터 규모를 기준으로 하며, NVFP4와 2비트 수치는 특정 구현체 기준입니다.
| 표현 방식 | 가중치에 필요한 대략적 메모리 | 의미 |
|---|---|---|
| FP8 | ~753 GB | 네이티브 FP8의 8-GPU급 배포 계획과 부합합니다. |
| BF16 | ~1.5 TB | 서빙 오버헤드 전부터 멀티노드급 메모리가 필요합니다. |
| NVFP4 | 등재된 커뮤니티 체크포인트 기준 ~465 GB | 공식 레시피의 Blackwell 전용 경로이며 기본 Z.ai 체크포인트는 아닙니다. |
| 2비트 | 커뮤니티 빌드 기준 수백 GB | 24 GB 환경이 아니라 오프로딩 또는 대용량 메모리 실험용입니다. |
사전 공개 시점의 하드웨어 조언과 달라진 점
GLM-5.3 리포지터리는 이제 네이티브 FP8 파일과 함께 공개되어 있습니다. 체크포인트 메타데이터는 현재 모델 카드, 토폴로지와 플래그는 공식 vLLM 레시피, 실제 배포 경험은 커뮤니티 보고서를 우선 확인하는 편이 좋습니다. 현재 레시피는 1,048,576토큰 컨텍스트 윈도우를 안내합니다.
파라미터 수보다 메모리 예산으로 판단하기
GLM-5.3에서는 가중치 메모리가 첫 번째 제약이고 컨텍스트 메모리가 두 번째 제약입니다. 활성 파라미터 수가 적으면 연산량은 줄지만, 라우팅되는 전문가 가중치와 런타임 버퍼를 보관해야 한다는 사실은 바뀌지 않습니다.
24~64 GB: 풀 GLM-5.3 로컬 실행은 계획하지 않는 편이 낫다
RTX 4090, RTX 5090처럼 24 GB급 카드 한 장은 현재 Hugging Face 리포지터리에서 약 756 GB에 이르는 플래그십 네이티브 FP8 체크포인트를 담을 수 없습니다. 64 GB 워크스테이션 카드도 가중치 풋프린트에는 한참 못 미칩니다.
CPU 오프로딩으로 양자화 실험을 로드할 수는 있습니다. 하지만 대화형 코딩 서비스의 기본 배포 방식이라기보다 디버깅 경로에 가깝습니다. 에이전트는 반복되는 도구 호출도 납득 가능한 속도로 끝내야 합니다.
128~192 GB: 플래그십은 불가, Flash는 특정 구성에서만 가능
128 GB 또는 192 GB 통합 메모리 시스템도 플래그십의 네이티브 FP8 요구량에는 못 미칩니다. Flash에는 구체적인 경로가 있습니다. 공개된 검증 프로필은 고정된 EXL3/TR3 4-bpw 체크포인트를 2× RTX PRO 6000 Blackwell 96GB GPU에 분산해 실행합니다.
이 프로필은 175.6 GB의 체크포인트 데이터, 약 220 GB의 여유 저장 공간, PCIe 피어 투 피어 통신, 고정된 런타임을 사용합니다. 요청 한도는 262,144토큰으로 보고되지만, 일반 시스템 RAM 192 GB가 아니라 별도 GPU 2장을 쓰는 구성입니다. 같은 Flash 구성에서 디코드 초당 171.7토큰, 첫 토큰까지의 중앙값 0.059초도 보고됐습니다.
대용량 메모리 GPU 2~4장: 플래그십 대신 Flash 검토
대용량 메모리 카드 2장 또는 4장은 Flash를 검토할 수 있는 첫 구간입니다. 다만 정밀도, 런타임, 컨텍스트 길이, 배치, 이미지 입력 여부에 따라 메모리 예산은 모두 달라집니다. 검증된 2-GPU 프로필은 텍스트, 구조화된 도구, 시맨틱 이미지 입력을 지원합니다. 대신 비디오는 비활성화되어 있고, 엔드포인트에는 내장 인증이 없으며, 제공되는 비전 템플릿은 멀티모달 검증 전에 되돌릴 수 있는 수정이 필요합니다. 이는 해당 고정 레시피의 세부 사항일 뿐, 모든 Flash 빌드나 플래그십에 해당하는 내용은 아닙니다.
8× H200 또는 H20: 문서화된 FP8 플래그십 구성
공식 vLLM 레시피는 H200 또는 H20 GPU 8장을 표준 네이티브 FP8 토폴로지로 제시합니다. 8방향 텐서 병렬화, FP8 KV 캐시, 5토큰 멀티 토큰 예측, 자동 도구 선택, GLM 전용 추론 및 도구 호출 파서를 사용합니다.
이는 문서화된 구성이지 특정 초당 토큰 수를 보장하는 수치는 아닙니다. 실제 처리량은 인터커넥트, 컨텍스트 길이, 배치 크기, 동시 시퀀스 수, 서빙 빌드에 따라 달라집니다. vLLM 페이지는 구성법을 제공하지만 측정된 프로덕션 처리량은 제시하지 않습니다.
8× B200: 100만 토큰 컨텍스트가 필요할 때
공식 레시피는 완전한 1,048,576토큰 컨텍스트 구성에 GPU 8장의 B200을 배치합니다. 이 추가 컨텍스트는 VRAM 문제입니다. KV 캐시는 활성 시퀀스 수와 컨텍스트에 비례해 커지므로, 32K 또는 128K 토큰에서 동작하는 배포라고 해도 같은 동시성으로 100만 토큰을 지원한다는 보장은 없습니다.
우선 --max-model-len을 더 작은 값으로 시작하고, KV 캐시 사용량을 측정한 뒤에만 올리세요. 길어진 리포지터리와 문서에서는 큰 컨텍스트 윈도우가 유용하지만, 모든 요청을 경제적으로 또는 낮은 지연으로 처리해 주는 것은 아닙니다.
공식 레시피에 없는 호스트 요구사항
vLLM 레시피는 GPU 토폴로지와 실행 플래그를 제공하지만, 범용적인 시스템 RAM·전력·냉각·저장 공간 여유·네트워크 요구사항은 공개하지 않습니다. 이 값은 체크포인트, 런타임, 목표 컨텍스트, 제공 플랫폼에 따라 달라집니다.
| 호스트 항목 | 수집된 근거가 뒷받침하는 내용 |
|---|---|
| 모델 저장 공간 | 현재 플래그십 리포지터리는 safetensors 파일 7,556억 바이트를 보고합니다. 캐시와 임시 샤드를 위한 추가 공간도 확보해야 합니다. |
| GPU 인터커넥트 | 레시피는 8방향 텐서 병렬화를 요구합니다. PCIe 전용 성능을 가정하지 말고, 대여 또는 서버 플랫폼의 토폴로지를 확인하세요. |
| 시스템 RAM | vLLM 레시피에는 범용 공식 수치가 없습니다. 필요한 GPU 메모리를 시스템 RAM 수치로 대체해 판단하면 안 됩니다. |
| 전력 및 냉각 | 범용 공식 수치는 공개되어 있지 않습니다. 하드웨어 구매 전 해당 플랫폼의 8-GPU 전력 및 열 설계 사양을 확인하세요. |
| 소프트웨어 | 공식 레시피에는 vLLM 0.28.0 이상, Transformers 5.15.0 이상이 제시되며 FP8 성능에는 DeepGEMM이 필요합니다. |
공식 기준 최소 서빙 경로
문서화된 배포 경로는 vLLM 0.28.0과 OpenAI 호환 엔드포인트를 사용합니다. 멀티 GPU 노드를 전제로 설계된 구성이라, 더 작은 머신에 명령어만 복사한다고 모델 메모리 요구량이 사라지지는 않습니다.
문서 기준 런타임 설치
uv venv
source .venv/bin/activate
uv pip install "vllm==0.28.0" --torch-backend=auto
uv pip install "transformers>=5.15.0"
vLLM 레시피는 FP8 성능에 DeepGEMM이 필요하다고도 안내합니다. 유료 노드를 프로비저닝하기 전에 대상 GPU 이미지와 현재 레시피의 호환성을 확인하세요.
네이티브 FP8 GLM-5.3 실행
vllm serve zai-org/GLM-5.3 \
--kv-cache-dtype fp8 \
--tensor-parallel-size 8 \
--speculative-config.method mtp \
--speculative-config.num_speculative_tokens 5 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--enable-auto-tool-choice \
--served-model-name glm-5.3
각 플래그의 역할은 다음과 같습니다.
--tensor-parallel-size 8은 체크포인트를 GPU 8장에 분산합니다.--kv-cache-dtype fp8은 더 높은 정밀도의 캐시와 비교해 캐시 메모리 부담을 줄입니다.- 5토큰 MTP 설정은 문서화된 레시피의 추측 디코딩을 활성화합니다.
--tool-call-parser glm47과--reasoning-parser glm45는 도구 사용 및 추론을 위한 모델 출력을 포맷합니다.--enable-auto-tool-choice는 클라이언트가 도구를 제공했을 때 서버가 도구를 선택하도록 합니다.
에이전트 연결 전 엔드포인트 검증
curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "glm-5.3",
"messages": [
{"role": "user", "content": "Write a Python function that reverses a linked list."}
],
"max_tokens": 256
}'
응답이 성공적으로 돌아온다고 해서 로딩은 확인되지만, 도구 사용이나 장문 컨텍스트 동작까지 검증되는 것은 아닙니다. 공식 모델 카드는 SGLang도 다른 OpenAI 호환 경로로 안내하지만, 이 가이드에서는 GPU 토폴로지와 플래그가 전용 레시피로 문서화되어 있는 vLLM을 사용합니다.
숨은 메모리 예산: KV 캐시와 항상 켜진 추론
GLM-5.3 모델 카드와 vLLM 레시피는 thinking이 항상 활성화된 상태로 동작한다고 설명합니다. 지원되는 reasoning effort 값은 low, high, max이며, 지원되는 더 낮은 설정을 지정하지 않으면 기본값은 max입니다.
추론 시간이 길어질수록 출력 토큰이 늘어납니다. 또한 코딩 에이전트는 반복 도구 호출 동안 큰 리포지터리 접두사를 KV 캐시에 유지할 수 있습니다. 모델 가중치가 바뀌지 않아도 동시 시퀀스가 늘어나면 필요한 캐시 용량은 배수로 커집니다.
이 설정은 배포 제어 수단으로 활용하세요.
- Low: 대화형 코딩, 짧은 요청, 지연 시간에 민감한 도구라면 여기서 시작합니다.
- High: 더 많은 계획이 필요하지만 대화형 응답 예산은 유지해야 하는 작업에 사용합니다.
- Max: 추가 추론 토큰이 타당한 어려운 장기 작업에 한정합니다.
공식 레시피는 전체 컨텍스트 B200 구성에 --max-num-seqs 32를 권장하고 FP8 캐시 설정을 사용합니다. 이 수치는 출발점으로 보세요. 서버 메모리가 부족하면 동시성을 낮추고, 실제 요청이 캐시 잘림 없이 그 범위에 도달하기 전까지는 100만 토큰 지원을 주장하지 않는 것이 좋습니다.
API가 더 합리적인 하드웨어 선택인 경우
자체 호스팅은 개발자가 요청을 보내지 않는 시간에도 GPU 용량을 확보해 둬야 합니다. 트래픽이 간헐적이거나 동시성이 낮거나, 팀이 아직 GLM-5.3을 검증하는 단계라면 API를 쓰는 편이 GPU 8장 노드를 구매하거나 계속 대여하는 비용을 피할 수 있습니다. 대신 호스팅된 데이터 처리와 제공업체 의존성이라는 절충점이 있습니다.
Z.ai의 현재 가격 페이지는 GLM-5.3을 입력 100만 토큰당 $1.40, 캐시된 입력 100만 토큰당 $0.26, 출력 100만 토큰당 $4.40으로 표기합니다. GLM-5.3-Flash의 정가는 $0.15 / $0.03 / $0.50이며, 2026년 9월 9일까지 50% 프로모션이 표시되어 있습니다. 예산을 잡기 전에는 현재 청구 페이지를 반드시 다시 확인하세요.
| 워크로드 | GLM-5.3 정가 계산 | GLM-5.3-Flash 정가 계산 |
|---|---|---|
| 신규 입력 10M + 출력 2M | $14.00 + $8.80 = $22.80 | $1.50 + $1.00 = $2.50 |
| 신규 입력 2M + 캐시된 입력 8M + 출력 2M | $2.80 + $2.08 + $8.80 = $13.68 | $0.30 + $0.24 + $1.00 = $1.54 |
이는 토큰 비용 예시일 뿐 자체 호스팅 손익분기 계산은 아닙니다. 로컬 환경과 비교하려면 노드 시간당 가격, 지속 처리 속도, 활용률, 전력비, 저장 비용, 엔지니어링 시간, 실패하거나 재시도된 에이전트 실행까지 포함해야 합니다. 요금 항목별 설명은 AIReiter의 GLM-5.3-Flash API 가격 가이드를 참고하세요.
선택 기준은 다음과 같습니다.
- 플래그십이 필요하지만 수요가 불규칙하거나 보통 수준이라면 호스팅형 GLM-5.3 API를 선택합니다.
- 낮은 토큰 비용, 멀티모달 입력, 더 작은 자체 호스팅 목표가 플래그십 성능보다 중요하다면 GLM-5.3-Flash를 선택합니다.
- 프라이버시, 제어권, 지속적인 활용률이 GPU 8장 배포를 정당화한다면 자체 호스팅 플래그십 GLM-5.3을 선택합니다.
GLM-5.3 하드웨어 요구사항 FAQ
GLM-5.3을 RTX 4090, RTX 5090 또는 24 GB GPU 한 장에서 실행할 수 있나요?
아니요. 풀 모델 기준으로는 불가능합니다. 현재 네이티브 FP8 리포지터리에는 약 756 GB의 safetensors 파일이 있으므로, 24 GB 카드는 일반적인 서빙을 위해 모델을 담는 대신 극단적인 오프로딩 또는 양자화 실험에만 참여할 수 있습니다.
RAM 128 GB나 192 GB면 충분한가요?
플래그십의 네이티브 FP8 배포에는 충분하지 않습니다. 검증된 Flash 프로필은 별도 96 GB GPU 2장, 고정된 4-bpw 체크포인트, 추가 저장 공간을 사용합니다. 이는 192 GB 노트북이나 통합 메모리 워크스테이션과 동등한 구성이 아닙니다.
GLM-5.3과 GLM-5.3-Flash는 무엇이 다른가요?
두 모델은 별개입니다. 플래그십 모델 카드는 총 약 753B 파라미터를 보고하며, Z.ai는 Flash를 총 320B, 활성 18B 파라미터의 네이티브 멀티모달 모델로 설명합니다. Flash가 더 작고 저렴한 것은 맞지만, 18B급 데스크톱 모델이 아니라 여전히 서버급 모델입니다.
어떤 정밀도를 선택해야 하나요?
문서화된 8-GPU 토폴로지를 쓸 수 있다면 네이티브 FP8을 사용하세요. 멀티노드 메모리를 감당할 수 있는 기준 품질 또는 특수 평가에는 BF16을 사용하고, NVFP4는 지원되는 Blackwell 하드웨어에서만 고려하세요. 또한 등재된 NVFP4 체크포인트는 원본 기본 패키지가 아니라 커뮤니티 재양자화본이라는 점을 기억해야 합니다.
GLM-5.3을 코딩 에이전트에 연결할 수 있나요?
가능합니다. 공식 vLLM 레시피는 OpenAI 호환 엔드포인트와 도구 호출·추론 파서를 활성화하므로, 이 인터페이스를 지원하는 클라이언트는 서버 검증 후 연결할 수 있습니다. 다만 채팅 완료 요청이 성공했다고 에이전트 호환성까지 보장되는 것은 아니므로, 실제 하니스, 도구 스키마, 장기 세션 동작을 테스트하세요.
다음 단계
데스크톱 또는 192 GB 미만 호스트라면 먼저 호스팅 API를 시험해 보세요. 대표 워크로드로 문서화된 8-GPU 토폴로지를 대여하거나, 대용량 메모리 멀티 GPU 머신에서 Flash를 평가할 수 있습니다. 측정된 활용률을 통해 제어권과 프라이버시가 인프라 비용을 정당화한다는 판단이 선 뒤에만 자체 호스팅으로 넘어가는 편이 좋습니다.