蚂蚁集团开源百灵系列首个原生多模态大模型Ling-3.0-flash-VL:支持256K上下文与视觉反馈闭环

SmartHey9月9日消息,蚂蚁集团今日正式推出并开源百灵系列首个原生多模态大模型——Ling-3.0-flash-VL。

该模型基于高效MoE(混合专家)架构的Ling-3.0-flash升级而来,总参数量达124B,单次推理仅激活5.5B参数,原生兼容图像、文本与视频三类输入,上下文窗口高达256K Token,显著提升长文档与长视频理解能力。

模型聚焦“更可靠、更高效完成真实任务”的设计理念,创新引入视觉反馈闭环机制。区别于传统单步“看图生成”,该机制构建“观察 → 行动 → 验证 → 修正”的持续迭代流程,已在医疗报告解读、前端代码生成及GUI自动化等复杂场景中展现出动态纠错与结果优化能力。

训练层面采用原生多模态联合建模,视觉信息的深度融合不仅强化了多模态能力,还反哺提升了文本理解性能。在Artificial Analysis Intelligence Index v4.1.1基准测试中,Ling-3.0-flash-VL相较纯文本基线模型Ling-3.0-flash提升4分。

实测显示,在图片转网页任务中,模型可精准解析界面布局与组件语义,生成可用HTML/CSS代码,并通过渲染结果比对实现自我修正;在Image-to-WebDev Arena官方评测中,其代号“linthium”的版本得分超越GPT-5.4。

作为GUI Agent,Ling-3.0-flash-VL能准确识别跨应用界面结构,完成浏览器、IDE、设计工具等多平台协同操作;在医疗领域,支持跨报告整合结构化与非结构化数据,并自动标注关键风险指标。

技术细节上,模型集成任意分辨率视觉编码器与VideoRoPE时序建模模块,语言主干延续42层混合架构(交替部署KDA与Gated MLA模块,比例5:1),兼顾表达力与推理效率。在实时视频对话、多轮视觉交互及长时间任务执行中均保持低延迟响应。

目前,Ling-3.0-flash-VL已上线Ling Studio平台,面向公众免费开放体验。BF16与FP8精度版本同步在Hugging Face及ModelScope开源,FP4与INT4轻量化版本预计将于近期发布。