AI风向标

阿里通义 Qwen3.8-Flash 发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9

阿里通义千问团队发布 Qwen3.8-Flash,这是一款 125B 参数的多模态 MoE 模型,每 token 激活 6B 参数,原生支持 262,144 tokens 上下文,并可通过 YaRN 扩展至 1M tokens。

详细介绍

阿里通义千问团队发布 Qwen3.8-Flash,这是一款 125B 参数的多模态 MoE 模型,每 token 激活 6B 参数,原生支持 262,144 tokens 上下文,并可通过 YaRN 扩展至 1M tokens。

AI HOT 详情:https://aihot.virxact.com/items/cmta4mcv101z1roj2nc8w30ak

原文链接:https://www.ithome.com/0/994/735.htm