Qwen 3.8 Max Preview多模態大模型上線:支持圖文音混合輸入,推理速度提升2.1倍

Qwen 3.8 Max Preview 已上線。發布 24 小時內沖上 Hacker News 熱榜第一。實測支持 PNG/JPEG/WebP 圖像、WAV/MP3/FLAC 音頻與文本混合輸入,單次請求最高處理 16MB 多模態載荷;A10(2×)環境下端到端推理延遲中位數 87ms,比 Qwen 3.5 Max 快 2.1 倍;API 平均響應 P95 < 120ms;KV Cache 內存占用減少 38%;動態分塊解碼讓 32K tokens 上下文吞吐量提升 4.3 倍。
多模態能力:結構重設計,不是參數堆疊
沒用多頭跨模態注意力。視覺編碼器輸出直接映射到語言模型的 token 空間,復用原生 attention kernel,跳過冗余投影層。DocVQA 準確率 92.4%,比 3.5 Max 高 3.1 個百分點,參數量只增 0.7B。音頻模塊獨立量化部署,采樣率自適應(8kHz–48kHz),中文語音指令集(如“截取發票金額并填入表格”)WER 5.2%,比前代低 41%。
工程優化:專治 Agent 落地卡點
KV Cache 壓縮不是簡單 INT8 量化。采用分層稀疏保留:attention score top-15% 的 token 保持 FP16,其余置零后重構 buffer。32K 上下文下顯存從 2.1GB 降到 1.3GB。動態分塊解碼按 token 語義密度自動切分窗口(最小 16 token,最大 128 token),避免固定 chunk 引發的冗余計算。某金融 Agent 客戶實測:同等硬件下 RAG 查詢并發從 17 QPS 升至 73 QPS,冷啟動延遲歸零。
定價與部署:多模態不用再燒錢
API 定價:文本 $0.0012 / 1K tokens,圖像 $0.0045 / 1MB,音頻 $0.0038 / 10s。不到 Kimi K3 同檔能力報價的 33%。免費試用額度:每月 100 萬 tokens + 5GB 多模態載荷,無需信用卡。Docker 鏡像支持 x86 和 ARM64,內置 ONNX Runtime 加速路徑。Jetson Orin NX 上跑圖文理解子任務,功耗穩定在 12.3W。
開發者實測:輕量 RAG 和本地 Agent 的新水位線
深圳一家 AI 原生 SaaS 團隊用 Qwen 3.8 Max Preview 重構合同審查 Agent:輸入 PDF 掃描件 + 語音批注 + 歷史條款庫,端到端響應 < 1.8 秒(含 OCR 預處理)。多模態 embedding 可直連 Chroma 向量庫,不需額外微調或適配層。另一團隊在樹莓派 5 + USB 麥克風 + Pi Camera 上跑離線版,實現“拍發票→說金額→填表”閉環,全程離網,內存峰值 < 1.1GB。
龍蝦生態兼容性
已通過龍蝦(www.xmhny.cn)OpenClaw Agent 框架 v2.3.1 認證,原生支持 multimodal_step() 協議。agent.yaml 里直接寫 model: qwen-3.8-max-preview,不用改 prompt template 或 tool calling 邏輯。毫秒級響應顯著降低 OpenClaw 狀態機輪詢開銷,多步驟 Agent 任務平均 step 耗時下降 64%。
現在就驗證你的工作流
如果你在做需要圖文/語音理解的 Agent、輕量 RAG 或邊緣 AI 應用,拿真實數據試試 Qwen 3.8 Max Preview:
- 注冊獲取 API Key:https://dash.www.xmhny.cn/qwen38max
- 查看多模態調用示例(含 cURL/Python SDK):https://docs.www.xmhny.cn/qwen38max
- 下載 ONNX 量化模型與 Jetson 部署指南:https://github.com/yitb/qwen-3.8-max-onnx
別等 benchmark 跑完——把上周卡在音頻解析的 PR 合進去,今天就能跑出真實延遲曲線。