阿里云栖大会“剧透”Qwen新进展:多模态升级,未来模型参数将达5-10T

   时间:2026-09-22 12:19 来源:互联网作者:任飞扬

在近日举行的云栖大会上,阿里巴巴公布了千问大模型(Qwen LLM)的最新技术突破与应用进展。项目负责人刘大一恒透露,基于递归自我改进(RSI)技术,Qwen3.8-Max已实现全流程自主训练,在无人工干预的33轮迭代中,其性能评分从40提升至45分,跻身全球大模型第一梯队,超越多数国产模型。与此同时,新一代架构的Qwen4已进入训练阶段,未来Qwen4.5、Qwen5版本将扩展至5-10万亿参数规模,持续探索通用人工智能(ASI)的路径。

在技术优化层面,Qwen3.8-Max展现了多维度突破。通过自主适配平头哥新款GPU架构,其推理框架实现单实例吞吐量提升96%;在芯片协同设计领域,该模型仅依赖总线模块规范,通过60小时自迭代与超万次EDA工具调用,将物理实现面积缩减42%。架构创新方面,Qwen3.8-Flash提前开源下一代架构,通过注意力机制优化与信息传递效率提升,训练成本降低近90%,推理效率达到行业领先水平。全模态模型Qwen3.8-Omni的发布则标志着大模型进入多模态统一理解阶段,可同步处理音视频、文本等跨模态数据。

开源生态建设成为另一焦点。数据显示,阿里已开源460余个Qwen系列模型,全球下载量突破30亿次,衍生模型超30万个,稳居开源社区Hugging Face榜首。其中,Qwen3.8-27B模型超越meta-Llama3.1等热门项目,成为该平台最受欢迎开源模型。阿里巴巴ATH技术副总裁郑波预测,三年内将出现原生全模态统一模型,彻底打破模态交互边界。

在应用场景拓展上,视觉与音频生成模型迎来重大升级。面向电商设计的Qwen-Image-3.1将视觉创作周期从数小时压缩至秒级,支持图像精准编辑;音乐生成模型Happy Shrimp 1.1新增百余种曲风与十余种语言支持,覆盖人声与纯音乐场景;世界模型HappyOyster 2.0 Preview通过架构革新,显著提升物理规律模拟与实时交互能力。值得关注的是,下一代视频生成模型将于11月发布,具备更长时长一致性、导演级叙事理解等特性,可精准控制人物、场景与镜头运动。

语音交互领域同样成果丰硕。Qwen-Audio-3.1家族全面升级,ASR-Next模型可识别情绪、环境声等复杂音频信号;TTS-Next模型支持脚本到完整音频的直接生成,大幅提升有声内容制作效率;实时交互模型则强化多语言与共情能力,已应用于千问办公、Qoder等场景。同声传译模型Qwen3.8-LiveTranslate将翻译时延压缩至2.5秒内,低于人类同传平均水平,现已接入AI眼镜、桌面机器人等硬件设备。

终端落地进程加速推进。阿里发布AI手机全栈解决方案Qwen Intelligence,通过深度优化跨应用任务执行能力,为合作伙伴提供可靠的Agent技术平台。目前,Qwen系列模型已覆盖手机、AI眼镜、桌面机器人等多类智能终端,形成从云端到端侧的完整技术布局。

 
 
更多>同类内容
全站最新
热门内容