1240억 파라미터 모델이라면 대개 느리고 서빙 비용도 만만치 않다. 하지만 Ling 3.0 Flash는 다르다. 전체 124B 파라미터 가운데 토큰 하나를 처리할 때 실제로 활성화되는 것은 약 5.1B뿐이다. 게다가 현재는 무료로 실행할 수 있다.
inclusionAI는 2026년 7월 23일, 에이전트 작업을 겨냥한 하이브리드 추론 Mixture-of-Experts(MoE) 모델로 이를 공개했다. 코딩, 도구 호출, 리서치, 장시간 실행 작업이 주요 대상이다.
Ling 3.0 Flash는 어떤 모델인가
Ling 3.0 Flash는 Ant Group의 Ling·Ring 모델 계열을 개발하는 연구 조직 inclusionAI의 모델이다. Ant Group은 Alipay를 운영하는 핀테크 기업이다. 이름의 ‘Flash’는 대형 플래그십 모델보다 아래에 위치하는 고속·비용 효율 중심 티어를 뜻한다.
핵심은 Mixture-of-Experts 구조다. 총 124B 파라미터 중 매 토큰에서 동작하는 파라미터는 약 5.1B에 그친다. 덕분에 작은 모델에 가까운 속도와 비용으로 구동할 수 있다.
또한 하이브리드 추론 모델이기도 하다. 단순한 요청에는 바로 답하고, 어려운 문제에서는 더 긴 사고 모드로 전환한다. inclusionAI가 말하는 목표는 ‘프로덕션 규모 에이전트’다. 도구를 호출하고, 웹을 탐색하며, 코드를 작성·실행하고, 여러 단계에 걸쳐 상태를 유지하는 워크로드를 염두에 뒀다.
더 커졌지만, 토큰당 연산은 줄었다
전작 Ling 2.6 Flash와 비교하면 방향이 뚜렷하다. 전체 파라미터는 104B에서 124B로 늘었지만, 토큰당 활성 파라미터는 7.4B에서 5.1B로 줄었다.
전체 파라미터가 많다는 것은 지식을 담아둘 공간이 더 넓다는 뜻이다. 반대로 활성 파라미터가 적으면 토큰 생성 비용은 낮아진다. 실질적으로는 약 5B 모델 수준의 추론 비용을 지불하면서 124B 규모의 용량을 활용하는 셈이다.
이 차이는 특히 에이전트에서 중요하다. 도구 호출을 반복하며 수천 토큰을 생성하는 작업에서는 토큰당 비용이 전체 청구액을 좌우한다. 이때는 모델의 명목상 크기보다 활성 파라미터를 줄이는 편이 더 큰 효과를 낸다.
내부적으로는 하이브리드 선형 어텐션 스택을 쓴다. inclusionAI 설명에 따르면 KDA(선형 어텐션) 레이어 5개마다 완전 어텐션(MLA) 레이어 1개를 배치하는 반복 구조다. 선형 어텐션은 긴 입력을 저렴하게 처리하고, 주기적으로 들어가는 완전 어텐션 레이어는 순수 선형 모델이 놓칠 수 있는 정밀한 회상을 보완한다. 이 구조 덕분에 Flash는 네이티브 256K 컨텍스트를 지원하며, 1M까지 확장할 여지도 있다. 라우터에서는 정확한 토큰 수인 262,144를 기준으로 이를 262K로 표시한다.
채팅보다 에이전트 작업에 맞춘 설계
Flash는 자유로운 대화형 사용보다 에이전트 업무에 맞춰 튜닝됐다. inclusionAI의 발표는 더 높은 도구 호출 정확도, 장기 작업에서의 안정성, 널리 쓰이는 에이전트 ‘하니스’ 프레임워크와의 개선된 호환성을 강조한다. 공개 데모도 Blender로 만드는 3D 도시, 멀티 에이전트 리서치, MCP 기반 Office 작업, 브라우저 앱 등 이 방향과 맞닿아 있다.
코딩 측면에서는 일반적인 코드 생성에 더해 장면 그리드와 상대 위치 같은 공간·구조 추론 능력을 내세운다.
벤치마크는 한 가지 주의할 점이 있다. 모델이 공개된 지 며칠밖에 되지 않았기 때문에 현재 수치는 inclusionAI의 자체 주장과 초기 커뮤니티 테스트가 대부분이며, 독립 평가 결과는 아니다. inclusionAI는 훨씬 적은 활성 파라미터로도 약 1조 파라미터급 플래그십 모델과 많은 작업에서 동등하거나 더 나은 성능을 낸다고 말한다. 공개 결과표에는 사고 모드에서 SWE-Bench Pro 56.63점도 기재돼 있다. 제3자 검증 전까지는 공급사 발표 수치로 보는 편이 맞다.
Ling 3.0 Flash를 지금 무료로 써보는 방법
가장 빠른 경로는 OpenRouter다. 모델명은 inclusionai/ling-3.0-flash이며, 출시 시점 기준 입력과 출력 모두 $0으로 책정됐다. 무료 제공은 2026년 8월 3일까지이며, 가격은 2026년 7월 24일에 확인했다. ZenMux에서도 무료로 이용할 수 있다. 두 서비스 모두 OpenAI 호환 API를 제공한다.
최소 호출 예시는 다음과 같다.
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "inclusionai/ling-3.0-flash",
"messages": [{"role": "user", "content": "Write a Python function to parse a CSV."}]
}'
이미 chat/completions를 사용하는 클라이언트라면 기본 URL, 키, 모델 문자열만 바꾸면 된다. 모델 라우터를 사용하면 별도 수정 없이 같은 프롬프트로 Ling 3.0 Flash와 현재 모델을 A/B 비교할 수도 있다.
다만 두 가지는 고려해야 한다. 무료 기간은 프로모션이므로 8월 초 이후에는 사용량 기반 과금으로 전환될 가능성이 높다. 참고로 전작 Ling 2.6 Flash는 100만 토큰당 입력 약 $0.01, 출력 약 $0.03으로 표시돼 있다. 또 출시 시점에는 단일 제공사만 이 모델을 서빙했기 때문에 처리량과 가용성은 해당 백엔드 하나에 의존한다.
가중치는 내려받을 수 있을까
‘Ling 3.0 flash download’나 ‘Ling 3.0 flash github’를 찾는다면 여기서 막힌다. 출시 시점에 가중치는 공개되지 않았다. 현재 Flash는 API 전용 모델이다.
이전과는 달라진 부분이다. Ling 2.6 Flash는 Hugging Face에서 오픈 웨이트로 출시돼 지금도 로컬 실행이 가능하다. 반면 Flash 3.0은 아직 그렇지 않다.
자체 하드웨어에서 호스팅하거나 양자화해 쓰고 싶다면 inclusionAI Hugging Face 페이지를 지켜볼 만하다. 2.6 가중치가 이곳에 있으며, 그룹이 기존 패턴을 따른다면 3.0 가중치 역시 이곳에 올라올 가능성이 있다. 그때까지는 위의 API 라우터가 유일한 접근 경로다.
Ling 3.0 Flash와 Ling 2.6 Flash 비교
| Ling 3.0 Flash | Ling 2.6 Flash | |
|---|---|---|
| 출시일 | 2026년 7월 23일 | 2026년 4월 21일 |
| 전체 파라미터 | 124B | 104B |
| 토큰당 활성 파라미터 | ~5.1B | ~7.4B |
| 컨텍스트 윈도 | 네이티브 256K(라우터 표기 262K) | 256K(라우터 표기 262K) |
| 오픈 웨이트 | 출시 시점 미공개 | 예(Hugging Face) |
| 출시 가격 | 2026년 8월 3일까지 무료 | 100만 토큰당 입력 ~$0.01 / 출력 ~$0.03 |
| 주요 초점 | 하이브리드 추론 에이전트, 도구 사용, 코딩 | 에이전트용 고속 인스트럭트 모델 |
짧게 정리하면 3.0 Flash는 활성 연산량 일부를 줄이는 대신 더 큰 용량과 하이브리드 추론 모드를 얻었고, 배포 방식도 API 우선으로 바뀌었다. 로컬·오프라인 실행용 가중치가 꼭 필요하다면 지금 내려받을 수 있는 쪽은 여전히 2.6 Flash다.
FAQ
Ling 3.0 Flash는 무료인가요?
현재는 그렇다. OpenRouter에서는 2026년 8월 3일까지 무료이며 ZenMux에서도 무료로 제공된다. 무료 기간 종료 후에는 사용량 기반 과금이 예상된다.
Ling 3.0 Flash는 오픈소스인가요? 다운로드하거나 GitHub에서 찾을 수 있나요?
출시 시점 기준으로는 아니다. 가중치가 공개되지 않았으므로 다운로드나 저장소 없이 API로만 이용할 수 있다. OpenRouter의 inclusionai/ling-3.0-flash 또는 ZenMux를 사용하면 된다. 이전 Ling 2.6 Flash는 Hugging Face에서 공개돼 있으므로, 3.0 가중치가 나온다면 그곳에 올라올 가능성이 높다.
Ling 3.0 Flash는 중국 모델인가요?
그렇다. Alipay를 운영하는 중국 핀테크 기업 Ant Group과 연결된 AI 연구 조직 inclusionAI가 개발했다.
Ling 3.0 Flash의 규모는 어느 정도인가요?
전체 124B 파라미터를 갖췄고, MoE 설계로 토큰당 약 5.1B 파라미터가 활성화된다. 네이티브 컨텍스트는 256K이며 inclusionAI는 1M 방향으로 확장 가능하다고 설명한다.
Ling 3.0 Flash와 Ling 2.6 Flash 중 무엇을 써야 하나요?
하이브리드 추론 기반 에이전트 작업과 API에서의 낮은 토큰당 비용이 필요하다면 3.0 Flash가 맞다. 가중치를 내려받아 로컬에서 실행해야 한다면, 아직 공개되지 않은 3.0 대신 2.6 Flash를 선택해야 한다.
