코딩과 대규모 작업을 위한 빠른 Qwen 모델
Qwen3.8 Flash는 Alibaba Qwen3.8의 고속 티어 모델입니다. 코딩, 도구 사용 에이전트, 짧은 대화에 다 담기지 않는 긴 문서를 위해 설계되었습니다.
대형 모델, 저렴한 비용
총 1,250억 개의 파라미터 중 각 토큰에 약 60억 개만 사용됩니다. 그렇기 때문에 대량 작업에서도 빠르고 경제적인 비용을 유지합니다.
100만 토큰 컨텍스트
긴 사양서, 수많은 파일, 긴 에이전트 추적 기록을 한 번의 요청에 담을 수 있습니다. 단일 응답으로 최대 131,072개의 토큰까지 생성할 수 있습니다.
텍스트뿐만 아니라 이미지도 인식
단순한 텍스트뿐만 아니라 스크린샷, 차트, 문서까지 이해합니다. 화면의 시각적 요소에서 시작되는 작업에 활용해 보세요.
약 $0.057 / $0.193
100만 토큰당 입력 약 $0.057, 출력 약 $0.193으로 공식 정가의 약 절반 수준입니다. 캐시된 입력은 더 저렴합니다. 위의 가격 바에 실시간 요율이 표시됩니다.
Qwen3.8 Flash의 강점
2026년 8월 릴리스와 함께 발표된 Qwen 자체 모델 카드에 따르면, Flash는 비교 대상 모델 중 코딩 및 도구 사용 부문에서 가장 높은 점수를 기록했습니다.
리포지토리 작업
SWE-bench Pro 62.5, SWE-bench Multilingual 81.0. 버그를 찾고 여러 파일을 수정한 뒤 결과를 검증하는 작업에 활용하세요.
도구를 호출하는 에이전트
DeepSWE 58.7, Toolathlon 73.5. 오류를 확인하고 도구를 호출한 뒤 다시 시도하는 다단계 루프를 안정적으로 수행합니다.
코드 및 고난도 문제
LiveCodeBench v6 91.9, GPQA Diamond 91.7. 경쟁 프로그래밍 및 과학 분야의 복잡한 질문도 문제없이 처리합니다.
화면 분석
OSWorld 부분 점수 52.3. MathVision 90.6(코드 실행 가능 시 95.7). 스크린샷과 차트를 질문과 함께 입력할 수 있습니다.
Flash vs Max
Flash를 선택해야 하는 경우
코딩 에이전트, 테스트 및 수정 루프, 긴 문서 등 비용 효율이 중요한 모든 워크로드에 적합합니다. 1M 윈도우로 분할 없이 긴 추적 기록을 처리할 수 있습니다.
Max를 선택해야 하는 경우
Qwen3.8 Max는 2조 4천억 파라미터의 플래그십 모델입니다. 토큰 비용보다 가장 강력한 Qwen 모델의 성능이 필요할 때 사용하세요. /chat/qwen3-8-max에서 확인할 수 있습니다.
동일한 요청 형식
두 모델 모두 일반적인 chat completion 형식을 사용합니다. Flash의 경우 모델을 qwen3.8-flash로 설정하세요. 답변에 긴 추적 기록이 필요한 경우 max tokens 값을 늘리세요. 기본값은 8,192이며 최대 131,072까지 지원됩니다.
자주 묻는 질문
컨텍스트, 가격, 이미지 지원 및 Max와의 비교 안내입니다.
/ 01Qwen3.8 Flash는 어떤 용도인가요?
빠른 코딩, 도구 활용 에이전트 및 긴 문서 처리를 위한 모델입니다. Max의 축소판이 아닌, 더 저렴하고 빠른 Qwen3.8입니다.
/ 02컨텍스트 길이는 얼마나 되나요?
100만 토큰입니다. 한 번의 응답은 최대 131,072 토큰까지 가능합니다.
/ 03비용은 얼마인가요?
100만 토큰당 입력 약 $0.057, 출력 약 $0.193로 공식 정가의 약 절반 수준입니다. 캐시 읽기 비용은 더 저렴합니다. 도구 호출당 추가 요금은 없습니다. 가격 표시줄에 실시간 요율이 표시됩니다.
/ 04이미지를 인식할 수 있나요?
네. 텍스트와 함께 스크린샷, 차트, 문서 이미지를 모델에서 기본으로 지원합니다.
/ 05Qwen3.8 Max는 언제 사용해야 하나요?
플래그십 성능이 필요하고 토큰당 더 많은 비용을 지불할 수 있을 때 사용합니다. Max는 2.4T 모델이며, Flash는 대량 처리에 최적화된 모델입니다.