Qwen logo

Qwen Models: Local AI from 0.5B to 2.4T

Qwen is the widest open-weight family in the catalog, from 0.5B models that run on iPhones up to the Qwen3.8 2.4T A95B cloud MoE. For local hardware the flagship is Qwen3.8 27B: dense, Apache 2.0, with native vision-language support, 262K context extensible to 1M, and MTP decoding. It runs with `ollama run qwen3.8:27b` on a 24GB machine. Above it, Qwen3.8-Flash-Next is a 125B total / 6B active MoE shipped as a ~123GB IQ1_S GGUF for 256GB-class machines, and the 2.4T A95B stays API-only in practice. The mid range covers Qwen3 8B (the 16GB-machine pick) and Qwen3 14B, then steps down to Qwen3.5 4B and the phone-class 0.5B models.

Alibaba Cloud34 local models+ 2 API
DEVELOPER
Alibaba Cloud
MODELS
34
SIZE RANGE
0.5B–235B
RAM RANGE
2–192 GB
Bar chart: maximum local LLM size by memory tier. 8 GB runs up to 9B, 12 GB runs up to 12B, 16 GB runs up to 14B, 24 GB runs up to 27B, 32 GB runs up to 35B, 36 GB runs up to 35B, 48 GB runs up to 35B, 64 GB runs up to 70B, 72 GB runs up to 70B, 96 GB runs up to 70B, 128 GB runs up to 70B, 192 GB runs up to 70B, 256 GB runs up to 70B, 512 GB runs up to 405B. Data from ModelFit's own catalog.
Key Features
Qwen3.8 27B local flagship (Apache 2.0, vision)
Cloud line tops out at the 2.4T A95B MoE
Qwen3.8-Flash-Next: 125B MoE from 192GB RAM
Mid range: Qwen3 8B and 14B on 12-16GB Macs
Phone-class models from 0.5B, 2GB RAM

All Qwen Models

ModelSizeQuantVRAMMin RAMBest ForQualityOllama
Qwen2.5 0.5B Instruct0.5BQ4_K_M0.8 GB2 GBChat, Mobile
42
Qwen3.5 0.8B Instruct0.8BQ4_K_M0.8 GB2 GBChat, Mobile
56
Qwen2.5 1.5B Instruct1.5BQ4_K_M1.5 GB4 GBChat, Translation
55
Qwen3.5 2B Instruct2BQ4_K_M1.8 GB4 GBChat, Edge tasks
70
Qwen2.5 3B Instruct3BQ4_K_M2.5 GB4 GBChat, Coding
62
Qwen3.5 4B Instruct4BQ4_K_M3.5 GB6 GBCoding, Agents, Multimodal
83
Qwen3.5 4B Instruct (Q8)4BQ8_04.3 GB8 GBCoding, Agents, Multimodal
85
Qwen2.5 7B Instruct7BQ4_K_M5.5 GB8 GBChat, Coding
74
Qwen2.5 Coder 7B7BQ4_K_M5.5 GB8 GBCoding
78
Qwen3 8B8BQ4_K_M6.5 GB12 GBChat, Coding
84
Qwen3 8B (Q8)8BQ8_08.1 GB16 GBChat, Coding
86
Qwen3.5 9B Instruct9BQ4_K_M7 GB12 GBQuality, Coding, Reasoning
89
Qwen3.5 9B Instruct (Q8)9BQ8_010.7 GB16 GBQuality, Coding, Reasoning
91
Qwen2.5 14B Instruct14BQ4_K_M11 GB16 GBCoding, Chat
82
Qwen2.5 Coder 14B14BQ4_K_M11 GB16 GBCoding
85
Qwen3 14B14BQ4_K_M11 GB16 GBCoding, Quality
88
Qwen3 14B (Q8)14BQ8_015.9 GB24 GBCoding, Quality
90
Qwen3.5 27B Instruct27BQ4_K_M16 GB24 GBChat, Coding, Complex reasoning
91
Qwen3.5 27B Instruct (Q8)27BQ8_027.1 GB48 GBChat, Coding, Complex reasoning
93
Qwen3.6 27B27BQ4_K_M18 GB32 GBCoding, Quality, Long context
94
Qwen3.8 27B27BQ4_K_M16.5 GB24 GBCoding, Agent, Vision, Long context
94
Qwen3.8 27B (Q8)27BQ8_027.1 GB48 GBCoding, Agent, Vision, Long context
96
Qwen3.6 27B (Q8)27BQ8_030 GB48 GBCoding, Quality, Long context
96
Qwen3 30B30BQ4_K_M22 GB32 GBQuality, Coding
89
Qwen3 30B (Q8)30BQ8_030.3 GB48 GBQuality, Coding
91
Qwen3.5 35B-A3B Instruct35BQ4_K_M20 GB32 GBReasoning, Coding, Agent scenarios
93
Qwen3.6 35B-A3B35BQ4_K_M22 GB32 GBReasoning, Coding, Agents
95
Qwen3.6 35B-A3B (Q8)35BQ8_038.7 GB64 GBReasoning, Coding, Agents
97
Qwen3.5 35B-A3B Instruct (Q8)35BQ8_038.7 GB64 GBReasoning, Coding, Agent scenarios
95
Qwen3-Next 80B-A3B80BQ4_K_M50.4 GB72 GBChat, Coding, Long Context
94
Qwen3-Next 80B-A3B (Q8)80BQ8_084.8 GB128 GBChat, Coding, Long Context
96
Qwen3.5 122B-A10B Instruct122BQ4_K_M72 GB96 GBFrontier-level reasoning, Complex tasks
97
Qwen3.8-Flash-Next125BIQ1_S123 GB192 GBAgentic coding, Reasoning, Multimodal
92
N/A
Qwen3 235B A22B235BQ4_K_M130 GB192 GBQuality, Reasoning
98

Cloud / API-only models

Weights are open but far beyond consumer hardware — these run as APIs. Each page lists the local alternatives.

ModelSizeAccessBest For
Qwen3.7-PlusUndisclosedAPI onlyMultimodal, Agentic, Vision
Qwen3.8 2.4T A95B2400BAPI onlyFrontier reasoning, Agentic coding

Device Compatibility

Which Qwen models can run on each device class, based on minimum RAM requirements.

ModeliPhoneAirProStudioMini
Qwen2.5 0.5B Instruct (0.5B)ExcellentExcellentExcellentExcellentExcellent
Qwen3.5 0.8B Instruct (0.8B)ExcellentExcellentExcellentExcellentExcellent
Qwen2.5 1.5B Instruct (1.5B)ExcellentExcellentExcellentExcellentExcellent
Qwen3.5 2B Instruct (2B)ExcellentExcellentExcellentExcellentExcellent
Qwen2.5 3B Instruct (3B)ExcellentExcellentExcellentExcellentExcellent
Qwen3.5 4B Instruct (4B)PossiblePossibleExcellentExcellentExcellent
Qwen3.5 4B Instruct (Q8) (4B)PossiblePossibleExcellentExcellentExcellent
Qwen2.5 7B Instruct (7B)PossiblePossibleExcellentExcellentExcellent
Qwen2.5 Coder 7B (7B)PossiblePossibleExcellentExcellentExcellent
Qwen3 8B (8B)PossiblePossiblePossibleExcellentPossible
Qwen3 8B (Q8) (8B)NoPossiblePossibleExcellentPossible
Qwen3.5 9B Instruct (9B)PossiblePossiblePossibleExcellentPossible
Qwen3.5 9B Instruct (Q8) (9B)NoPossiblePossibleExcellentPossible
Qwen2.5 14B Instruct (14B)NoPossiblePossibleExcellentPossible
Qwen2.5 Coder 14B (14B)NoPossiblePossibleExcellentPossible
Qwen3 14B (14B)NoPossiblePossibleExcellentPossible
Qwen3 14B (Q8) (14B)NoPossiblePossiblePossiblePossible
Qwen3.5 27B Instruct (27B)NoPossiblePossiblePossiblePossible
Qwen3.5 27B Instruct (Q8) (27B)NoNoPossiblePossiblePossible
Qwen3.6 27B (27B)NoPossiblePossiblePossiblePossible
Qwen3.8 27B (27B)NoPossiblePossiblePossiblePossible
Qwen3.8 27B (Q8) (27B)NoNoPossiblePossiblePossible
Qwen3.6 27B (Q8) (27B)NoNoPossiblePossiblePossible
Qwen3 30B (30B)NoPossiblePossiblePossiblePossible
Qwen3 30B (Q8) (30B)NoNoPossiblePossiblePossible
Qwen3.5 35B-A3B Instruct (35B)NoPossiblePossiblePossiblePossible
Qwen3.6 35B-A3B (35B)NoPossiblePossiblePossiblePossible
Qwen3.6 35B-A3B (Q8) (35B)NoNoPossiblePossiblePossible
Qwen3.5 35B-A3B Instruct (Q8) (35B)NoNoPossiblePossiblePossible
Qwen3-Next 80B-A3B (80B)NoNoPossiblePossibleNo
Qwen3-Next 80B-A3B (Q8) (80B)NoNoPossiblePossibleNo
Qwen3.5 122B-A10B Instruct (122B)NoNoPossiblePossibleNo
Qwen3.8-Flash-Next (125B)NoNoNoPossibleNo
Qwen3 235B A22B (235B)NoNoNoPossibleNo

RAM Requirements

Qwen2.5 0.5B Instruct
0.8 GB · min 2 GB
Qwen3.5 0.8B Instruct
0.8 GB · min 2 GB
Qwen2.5 1.5B Instruct
1.5 GB · min 4 GB
Qwen3.5 2B Instruct
1.8 GB · min 4 GB
Qwen2.5 3B Instruct
2.5 GB · min 4 GB
Qwen3.5 4B Instruct
3.5 GB · min 6 GB
Qwen3.5 4B Instruct (Q8)
4.3 GB · min 8 GB
Qwen2.5 7B Instruct
5.5 GB · min 8 GB
Qwen2.5 Coder 7B
5.5 GB · min 8 GB
Qwen3 8B
6.5 GB · min 12 GB
Qwen3 8B (Q8)
8.1 GB · min 16 GB
Qwen3.5 9B Instruct
7 GB · min 12 GB
Qwen3.5 9B Instruct (Q8)
10.7 GB · min 16 GB
Qwen2.5 14B Instruct
11 GB · min 16 GB
Qwen2.5 Coder 14B
11 GB · min 16 GB
Qwen3 14B
11 GB · min 16 GB
Qwen3 14B (Q8)
15.9 GB · min 24 GB
Qwen3.5 27B Instruct
16 GB · min 24 GB
Qwen3.5 27B Instruct (Q8)
27.1 GB · min 48 GB
Qwen3.6 27B
18 GB · min 32 GB
Qwen3.8 27B
16.5 GB · min 24 GB
Qwen3.8 27B (Q8)
27.1 GB · min 48 GB
Qwen3.6 27B (Q8)
30 GB · min 48 GB
Qwen3 30B
22 GB · min 32 GB
Qwen3 30B (Q8)
30.3 GB · min 48 GB
Qwen3.5 35B-A3B Instruct
20 GB · min 32 GB
Qwen3.6 35B-A3B
22 GB · min 32 GB
Qwen3.6 35B-A3B (Q8)
38.7 GB · min 64 GB
Qwen3.5 35B-A3B Instruct (Q8)
38.7 GB · min 64 GB
Qwen3-Next 80B-A3B
50.4 GB · min 72 GB
Qwen3-Next 80B-A3B (Q8)
84.8 GB · min 128 GB
Qwen3.5 122B-A10B Instruct
72 GB · min 96 GB
Qwen3.8-Flash-Next
123 GB · min 192 GB
Qwen3 235B A22B
130 GB · min 192 GB

Frequently Asked Questions

What is the best Qwen model for 16GB RAM?
Qwen3 8B is the 16GB-machine pick: `ollama run qwen3:8b-q4_K_M` needs 12GB RAM minimum and loads about 6.5GB. With more headroom, Qwen3.8 27B is the local flagship via `ollama run qwen3.8:27b` at 24GB RAM.
Can the newest Qwen flagship run locally?
Qwen3.8 2.4T A95B is API-only in practice. Its BF16 weights are public on Hugging Face under the Qwen3.8-Max license, but no consumer build is registry-verified. The closest local experience is Qwen3.8-Flash-Next, a 125B / 6B active MoE with a 192GB RAM floor.
What Ollama command runs Qwen3.8 27B?
Run `ollama run qwen3.8:27b` on a machine with 24GB RAM minimum, a load of about 16.5GB. The higher-fidelity Q8 build, `ollama run qwen3.8:27b-q8_0`, wants 48GB.
Can I run Qwen on an iPhone?
Yes. Qwen2.5 0.5B runs from 2GB RAM with `ollama run qwen2.5:0.5b-instruct-q4_K_M`, and Qwen3.5 0.8B (`ollama run qwen3.5:0.8b`) also needs just 2GB. Quality is basic but useful for chat and translation.
What is Qwen3.8-Flash-Next?
It is a 125B total / 6B active MoE from the Qwen3.8 line, shipped as a ~123GB IQ1_S GGUF with a 192GB RAM floor, so it targets 256GB-class machines. There was no Ollama tag at release, so it runs through llama.cpp and similar runners rather than Ollama.

Related Model Families

Getting Started