Qwen3.8-Omni-Flash 是阿里千问推出的新一代原生全模态模型,依托 Qwen3.8-Flash-Next 架构搭建,支持文本、图片、音频、视频四类输入,最大上下文窗口达到 1M token。模型跳出简单多模态识别逻辑,把音视频感知与智能体任务调度融合,接收多媒体素材后自主规划任务、调用外部工具,完成整套内容生产链路。长时长音视频处理时,不会对全部内容做完整解析,会锁定和问题相关的片段,降低算力消耗,音频与视频输入的调用成本大幅压缩,在各类多模态评测项目中拿到优于前代模型的结果。

Qwen3.8-Omni-Flash特点
原生一体化全模态架构,无需拆分不同模块处理图文音视频。百万级长上下文承载,一次性读取完整长文档、数小时音视频素材。
支持双通道、四通道空间音频解析,分辨声源位置信息。内置智能体调度模块,自动串联多轮任务与外部工具。兼容 DashScope 与 OpenAI 两套协议,开发侧迁移成本低。
音视频推理采用选择性片段检索机制,减少冗余 token 计算。
Qwen3.8-Omni-Flash技术原理
底层采用 GDN+QSA 混合注意力结构,搭配门控残差通道与 N-gram 嵌入层,优化长序列读取速度。
模型内置多模态编码单元,将图像帧、音频波形、文字信息映射至统一表征空间。
任务执行阶段启动检索式采样,根据用户指令筛选音视频内关键片段,跳过无关画面与音频。
内置函数调用模块,识别任务需求后触发外部工具,完成跨工具串联执行,整套流程在同一模型内完成多模态感知、推理与任务分发。
Qwen3.8-Omni-Flash项目地址
- GitHub仓库:
- Qwen-MM-Plugins: https://github.com/QwenLM/Qwen-MM-Plugins
- Qwen-Live Harness: https://github.com/QwenLM/Qwen-Live-Harness
Qwen3.8-Omni-Flash功能
多模态内容解析,读取图片、音频、视频素材并提取信息。
长音视频摘要,自动生成字幕、纪要、情节梳理文本。
智能体任务编排,规划视频剪辑、MV 制作、短剧翻译、影视解说全流程。
代码编写与调试,接收图文音视频形式需求输出代码。
联网检索,对接外部信息补充素材背景。结构化输出,返回 JSON 格式数据,适配业务系统对接。
Qwen3.8-Omni-Flash应用场景
企业会议场景,上传长时间会议录音录像,提取会议要点、待办事项,生成完整会议文档。
短视频与影视创作,解析视频素材,撰写解说文案、匹配字幕,规划剪辑脚本。
教育培训场景,解析课堂录播视频,整理课程笔记,提炼知识点。
开发业务场景,对接 API,搭建多模态智能客服、音视频质检系统。
内容本地化场景,识别短剧人物对白,完成翻译、字幕对齐与配音相关规划。
Qwen3.8-Omni-Flash如何使用教程
- 登录千问AI平台,进入 Model Studio 模型调用页面,在模型列表选中 Qwen3.8-Omni-Flash。
- 网页端交互可直接上传图片、音频、视频文件,在输入框填写对应的任务指令。
- API 接入方式,使用 DashScope SDK 或 OpenAI 兼容协议,填写模型 ID 构造请求体,上传多媒体资源。
- 开启工具调用开关,配置可用插件,模型会自动判断是否调用外部工具完成任务。
- 提交请求后等待返回文本结果,长视频任务等待片段检索完成,输出内容包含时间标记、摘要、任务方案。
- 开发者可接入 Qwen-MM-Plugins 插件包,扩展音视频 Agent 相关能力,搭建自定义工作流。
- 调试阶段调整采样参数,设置上下文缓存,降低重复请求的 token 消耗。
Qwen3.8-Omni-Flash同类产品对比
表格
| 产品 | 研发主体 | 产品定位 | 核心特色 | 适用场景 |
|---|---|---|---|---|
| Qwen3.8-Omni-Flash | 阿里通义千问 | 原生全模态 Agent 模型 | 支持文本 / 图像 / 音频 / 视频四模态输入,1M 上下文,强化音视频智能体能力,可自主规划、调用工具完成音视频创作与长视频理解,音视频调用成本极低 | 长会议纪要、短剧翻译、MV 制作、长视频解析、多模态自动化工作流 |
| Gemini 3.8 Flash | 全模态高速推理模型 | 原生多模态,音视频理解能力强,响应速度快,支持实时多模态交互,具备成熟的 Agent 工具调用能力 | 实时音视频对话、多媒体内容分析、多模态智能体应用开发 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



