多模态加速进工作流:从商汤开源、DeepSeek上新到阿里云45%增速
8月21日这一天,国产AI大模型圈连发三件大事:商汤开源轻量级多模态模型、DeepSeek上线视觉理解版本、阿里云交出AI商业化亮眼答卷。多模态模型,正在加速进入生产工作流。
商汤:轻量级多模态,解锁原生4K创作
商汤科技正式开源SenseNova U1.5 Lite,这是轻量级、原生统一多模态大模型的正式版。相比预览版,它强化了复杂指令遵循、中英文文字与布局生成、原生4K输出、图像编辑及精细视觉控制等能力,支持3-4k字符的复杂指令,面向全球开源。
更值得关注的是趋势:随着复杂指令遵循、非编辑区域保持和多轮修改稳定性提升,轻量级视觉模型正由”单次内容生成”向”持续创作与生产交付”延伸。文字排版、局部编辑、多参考图融合等进步,将提升其在广告营销、视觉设计、电商内容、办公创作等场景的实用价值。小参数规模则有助于降低推理和私有化部署成本。
DeepSeek:视觉理解版上线,Agent能力逼近Opus-4.8
DeepSeek-V4-Flash-Vision-Exp上线DeepSeek API平台。该模型在保持V4-Flash原有文本、推理、知识及Agent能力的基础上,新增视觉理解能力。在需要视觉理解的Agent基准测试中,相比纯文本版本明显提升,多模态Agent能力接近Opus-4.8。
这意味着模型可以处理图文文档、网页界面、数据图表及软件操作等信息,拓展Agent可感知和执行的任务边界。较低的调用成本和对主流Agent框架的兼容性,将降低开发者构建多模态应用的门槛,推动视觉Agent在专业场景中加快渗透。
阿里云:AI相关收入连续12季度三位数增长
2027财年第一季度,阿里云外部商业化收入同比增长45%,创22个季度新高;AI云及算力服务收入484.37亿元;AI相关收入123.76亿元,连续12季度同比三位数增长;经调整EBITA同比增长133%。
过去一个月,阿里巴巴模型发布全面提速,大语言、图像、语音、视频、音乐五大类模型密集完成重要版本迭代,性能均跻身国际第一梯队。旗舰模型Qwen3.8-Max总参数达2.4万亿,发布后斩获智能体评测Artificial Analysis Agentic全球第一;Wan3.0视频模型单次可生成30秒视频,支持doc、xls、ppt、pdf、md等文档格式输入;Qwen-Image-3.0在Text-to-Image Arena排名中国第一;Qwen-Audio三类模型(ASR、TTS、Realtime)在Artificial Analysis榜单均斩获第一。截至目前,阿里巴巴累计开源460多个模型,Qwen系列全球下载总量超30亿次,衍生模型数超30万个。
阿里已形成覆盖AI芯片、算力基础设施、基础模型、模型服务和Agent应用的全栈布局,商业化正由需求验证向规模化兑现过渡。
对银行的启示
多模态+Agent对银行意味着什么?票据、合同、影像的智能识别将更精准;网点视频分析、智能柜面交互等”视觉+Agent”场景加速成熟。开源轻量级模型(如SenseNova U1.5 Lite)降低推理与私有化部署成本,中小银行可以采用”开源底座+垂直微调”路线。DeepSeek-V4系列多模态版本,则为银行多模态Agent提供了低调用成本选项。
市场层面,申万计算机行业8月21日PE-TTM为124.58倍,低于2023-2025年历史均值158.59倍,估值处于历史中枢下方——AI商业化的基本面支撑,与低估值形成组合。
多模态不是”能看图”那么简单,它是AI进入生产工作流的门票。对银行而言,这张门票的入场时间,就是现在。
从”能对话”到”能办事”,多模态 Agent 正在成为 AI 进入生产工作流的下一站。