Qwen3.6-first tiered-memory CPU inference for sparse expert models.
transformers moe avx512 int8-inference cpu-inference local-llm llm-inference qwen model-streaming sparse-experts
-
Updated
Jul 27, 2026 - Python