蚂蚁千亿参数大模型Ming-flash-omni发布
一分耕耘,一分收获!既然都打开这篇《蚂蚁发布千亿参数开源大模型 Ming-flash-omni》,就坚持看下去,学下去吧!本文主要会给大家讲到等等知识点,如果大家对本文有好的建议或者看到有不足之处,非常欢迎大家积极提出!在后续文章我会继续更新科技周边相关的内容,希望对大家都有所帮助!
蚂蚁百灵大模型团队近日正式推出了全新开源全模态大模型——Ming-flash-omni-Preview,标志着首个参数规模突破千亿的全模态模型正式向社区开放。该模型基于Ling 2.0的稀疏MoE架构构建,总参数量达103B,激活参数仅为9B,在保持高效推理的同时显著提升了多模态理解与生成能力。
相较于此前广受好评的Ming-lite-omni-1.5,新模型在图像、视频、语音等多个模态任务中实现了全面升级,尤其在可控图像生成、流式视频理解和高精度语音识别方面表现突出,整体性能位居当前开源全模态模型前列。

Ming-flash-omni-Preview 模型结构示意图:

据团队介绍,Ming-flash-omni-Preview 在技术层面进行了多项关键优化,主要体现在以下三个方面:
1) 基于稀疏专家架构的全模态协同训练
本模型将Ling-flash-2.0所采用的稀疏MoE架构成功扩展至全模态场景,并沿用Ming-lite-omni提出的模态级路由机制,实现对不同模态数据分布和专家分配策略的精准建模,达成“大容量、小激活”的高效运行模式。通过在注意力层引入VideoRoPE(Video Rotary Position Embedding),增强了对长时视频内容的时空建模能力,显著提升视频交互理解水平。
在训练稳定性方面,团队采用了混合式专家负载均衡方案:
- 结合辅助负载均衡损失函数与路由器偏置动态更新机制,确保各专家模块被均匀激活,保障稀疏训练过程中的收敛性;
- 针对语音识别任务,提出上下文感知ASR训练范式,以任务类型或领域信息作为解码条件输入,有效提升专有名词识别准确率及转录一致性;
- 同时引入涵盖湖南话、闽南话、粤语等在内的15种高质量中国方言语料,使方言识别性能获得显著增强。
2)生成式分割与编辑一体化训练范式
在统一多模态系统中,如何深度融合图像的理解与生成能力是一大核心挑战。虽然Ming-lite-omni-1.5通过冻结语言通路并引入多尺度QueryToken注入层级化语义,在一定程度上实现了理解与生成的融合,但由于两类任务目标本质差异,诸如物体属性、空间关系等细粒度视觉知识仍难以有效迁移至生成端,限制了生成质量与控制精度。
为此,Ming-flash-omni-Preview创新性地提出 “生成式分割即编辑”(Generative Segmentation as Editing) 的协同训练框架。该方法将传统图像分割任务重构为语义保持型编辑指令,例如:“把香蕉涂成紫色”。这一设计的关键优势在于:
- 强制统一理解与生成的目标函数:成功的编辑必须依赖对目标对象轮廓和语义的精确理解;
- 编辑结果的质量直接构成对理解能力的监督信号,形成闭环反馈;
- 显著增强模型在时空维度上的细粒度语义控制能力,间接缓解文本到图像生成中的组合性难题。
实验表明,在GenEval基准测试中,Ming-flash-omni-Preview取得0.90分的成绩,超越所有非强化学习(non-RL)方法;在GEdit基准上的精准编辑任务(如物体删除、替换)平均得分从6.9跃升至7.9。这些成果验证了该范式不仅提升了编辑能力,还能有效泛化至自由文本驱动的图像生成任务。
3) 高效全模态训练架构设计
全模态基础模型的训练常面临两大瓶颈:数据异构性(各模态序列长度不一)与模型异构性(专用编码器结构差异导致并行困难),易引发负载不均、内存碎片和流水线气泡,严重影响训练效率。
针对上述问题,团队基于Megatron-LM框架实施了两项关键技术改进:
- 序列打包(Sequence Packing):将多个变长多模态序列智能打包为固定长度批次,大幅提升内存利用率和计算密度;
- 弹性编码器分片(Flexible Encoder Sharding):扩展支持模态特定编码器在数据并行(DP)、管道并行(PP)和张量并行(TP)维度上的细粒度切分,消除流水线等待,实现真正的负载均衡。
这些优化使得Ming-flash-omni-Preview的训练吞吐量相比基线系统提升近一倍,大幅缩短了大规模全模态模型的迭代周期。
目前,Ming-flash-omni-Preview 的完整模型权重与训练代码已全面开源,欢迎开发者与研究者使用:
GitHub: https://github.com/inclusionAI/Ming
HuggingFace: https://huggingface.co/inclusionAI/Ming-flash-omni-Preview
ModelScope: https://www.modelscope.cn/models/inclusionAI/Ming-flash-omni-Preview
到这里,我们也就讲完了《蚂蚁千亿参数大模型Ming-flash-omni发布》的内容了。个人认为,基础知识的学习和巩固,是为了更好的将其运用到项目中,欢迎关注golang学习网公众号,带你了解更多关于的知识点!
Golang动态方法修改与调用技巧详解
- 上一篇
- Golang动态方法修改与调用技巧详解
- 下一篇
- 小强阅读划线笔记方法详解
-
- 科技周边 · 业界新闻 | 15小时前 | 开发工具 · google · ai agent · 智能体 WebMCP Google I/O 2026 Antigravity Managed Agents
- Google I/O 2026 的智能体产品线传递了哪些开发趋势
- 385浏览 收藏
-
- 科技周边 · 业界新闻 | 19小时前 |
- Python 3.14 自由线程文档完善后,扩展兼容性怎么评估
- 376浏览 收藏
-
- 科技周边 · 业界新闻 | 22小时前 | Redis · ai · 向量数据库 · redis 向量检索 Vector Sets 向量集合
- Redis 把向量集合纳入核心数据类型意味着什么
- 306浏览 收藏
-
- 科技周边 · 业界新闻 | 1天前 | 云原生 · kubernetes ·
- CNCF 2026 项目活跃度报告透露了哪些变化
- 489浏览 收藏
-
- 科技周边 · 业界新闻 | 1天前 | 异步编程 · 版本迁移 · Python升级 annotationlib Python 3.14.7 Python兼容性 自由线程
- Python 3.14.7 文档更新后该关注哪些兼容项
- 246浏览 收藏
-
- 科技周边 · 业界新闻 | 1天前 |
- Docker Buildx 内置来源策略解决什么供应链问题
- 222浏览 收藏
-
- 科技周边 · 业界新闻 | 1天前 |
- Redis 8.6 Streams 幂等生产怎么减少重复消息
- 244浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- PubMedQA
- 深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
- 373次使用
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 443次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 450次使用
-
- HELM
- 深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
- 396次使用
-
- MMBench
- MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
- 220次使用
-
- 蒙面演唱引争议,旺仔小乔被平台封禁
- 2025-08-08 501浏览
-
- openGauss向量驱动升级,RAC多写突破内核
- 2025-07-30 501浏览
-
- 安普瑞斯工厂放假,电芯供应受影响
- 2025-07-04 501浏览
-
- 农产品APP开发优势与功能全解析
- 2025-04-30 501浏览
-
- 开店省钱妙招,外卖系统同城配送运营攻略
- 2025-04-26 501浏览

