🎨

多模态

让 AI 同时看懂文字、图片、声音、视频,并在它们之间自由转换。

前沿简报

2026-07-06

AI也会“举一反三”了:只看几张例图就能学会新概念

一句话

科研人员设计了一个新任务,让AI像人类一样,只看几张例图就能领悟它们共有的抽象概念,并把这个概念用到新图像上。

为什么重要

目前的视觉语言模型虽然能理解复杂指令,但面对纯视觉的“找共同点”任务时常常失败。比如给它几张不同形态的“毛茸茸动物”照片,它很难自行提炼出“毛茸茸”这个属性。这项研究指出了AI在无文字提示下的概念学习短板,并提出改进方法,让AI开始具备“从实例中总结规律”的能力。这种能力是实现更接近人类智能的关键一步。

对我意味着什么

如果AI能从你随手拍的几张照片(比如喜欢的穿搭风格、家居布置)中自学你的偏好,未来它就能更贴心地帮你生成设计、筛选内容,甚至替你在海量信息中“找感觉”。你不再是给AI下指令,而是给它看例子,它就能懂你。

2026-07-02

AI学会“先看再想”,机器人虚拟训练,工业质检新利器

三篇论文描绘了多模态AI向更精准、更实用迈进的图景,普通人也能感受到它们即将带来的改变。

🤖 RoboWorld:在虚拟世界里训练机器人

突破点:无需实际机器人,仅凭视频生成模型即可模拟机器人的行为,并自动打分评估。
为什么重要:机器人开发成本高、周期长,RoboWorld 让研究者能在数字世界快速试错,验证策略是否可靠,加速机器人进入家庭和工业的进程。
对我意味着什么:未来你家的扫地机器人可能先在“模拟游戏”中学会识别各种复杂场景,再在现实中完美运行,避免在客厅卡壳或扫漏角落。

🔍 感知-推理分离:AI 找茬的新境界

突破点:Perceive-to-Reason 框架让 AI 先找出与问题相关的视觉线索,再基于线索推理答案,模仿人类“先观察后思考”的解题方式。
为什么重要:传统模型容易忽略图片中的微小关键细节,P2R 显著提升了细粒度视觉问题解答的准确率,比如从高分辨率照片中分辨鸟的种类、识别医学影像中的病灶。
对我意味着什么:以后你问 AI “这张照片里有什么奇怪的地方?”,它能像侦探一样定位异常,然后给出可信的解释,而不是乱猜。

🏭 GenAU:工厂里的全能质检员

突破点:一个统一模型同时完成“有没有缺陷、缺陷在哪、是什么缺陷、为什么这是缺陷”四项任务,并用自然语言给出解释。
为什么重要:传统工业质检依赖多个独立模型,且只能二分类(好/坏)。GenAU 不仅能标出缺陷区域、说出缺陷类型(如划痕、裂纹),还能生成可视化依据,让检测结果更透明、可信。
对我意味着什么:未来手机、汽车的零配件出厂前,AI 质检员会像经验丰富的老师傅一样,拍照、标记、说明原因,大大提高产品质量,也减少人工漏检。

2026-06-29

AI 的“相信眼睛”与“相信记忆”:两篇论文看懂模型如何决策

当照片和常识打架,AI 会信谁?

一句话: 科学家通过“脑科手术”般的实验发现,多模态模型在处理图片和已有知识冲突时,默认相信视觉输入,但少数几个关键模块能强行让模型输出记忆里的常识。

为什么重要: 这就像我们在生活中看到一只蓝色的草莓——大脑会纠结“该相信眼睛说它是蓝色的,还是记忆说草莓是红的”。这项研究首次在模型内部找到了负责切换这两种模式的“路由开关”,解释了为什么AI有时会执着于错误的世界知识,或者反过来,忽略视觉细节。

对我意味着什么: 未来自动驾驶遇到从未见过的路牌、或是健康助手分析一张异常皮肤照片时,它们正在经历“信眼睛还是信经验”的挣扎。理解这一点,能帮我们设计出更可靠的AI,也知道什么情况下它可能“说谎”。

AI 看画时,到底在看哪儿?

一句话: 研究者用热力图揭开了多模态模型描述艺术品的“视觉依据”——当它说出画里的某个物体、风格或画家名字时,眼睛实际上落在画面的哪个区域。

为什么重要: 你可能听过AI能准确说出“这是印象派、画的是睡莲”,但一直不清楚它是在认真看画,还是单纯靠背下来的文字线索。这篇论文第一次系统地展示了:说到具体物体(比如“桌子”),模型紧盯画面里的桌子区域;但说到风格(“巴洛克”)或作品名时,它可能根本没看画,而是依赖训练时记住的文本关联——这就解释了为什么它经常把画名说错。

对我意味着什么: 当我们用AI讲解一张名画或者分析一张照片时,可以采用不同的问法:用“你看见什么”引导它真的看图,而不是掉进记忆的陷阱。对艺术爱好者和教育类应用来说,这项研究让AI的鉴赏能力变得可解释,你可以像查水表一样检查它每个说法来自画面的哪里。

2026-06-27

AI能看懂小心机了:从社交帖猜你喜好,看图说出“因为所以”

一句话

最近有两项研究很有意思:一个让AI看图时能像人一样做常识推理(比如“这个人为什么在笑?”),另一个让AI翻你的朋友圈、小红书就能猜出你的隐藏偏好,跟你聊天时更贴心。

为什么重要

现在的AI看图画只看表面描述,跟人对话也只会翻聊天记录找关键词。这些新能力意味着未来的智能助手可能真正“懂你”——从你拍的风景照、转发的段子里读你的生活,甚至理解图片里没直接拍出来的因果关系。这不再是冷冰冰的匹配,而是开始靠近人类的联想式理解。

对我意味着什么

  • 更聪明的相册搜索:你说“找到昨晚那张庆祝升职的合影”,AI能理解庆祝的氛围,而不仅仅是搜“蛋糕”这个单词。
  • 真正个人的助手:你发过的旅游照、收藏的餐厅,不用自己整理,助手就会主动推荐适合你口味的地方,还能用你喜欢的说话风格聊天。
  • 当然,隐私是面镜子:这也提醒我们,AI越来越能从公开信息里“读心”,以后发朋友圈可能要留个心眼,你愿意交给它多少。
2026-06-26

AI看懂视频里的“隐形”伤害,还能揪出自己说了什么瞎话

一句话

HarmVideoBench 让 AI 学会像侦探一样从视频的多个层次理解有害内容;GAVEL 则能指出 AI 看图说话时哪里出了错,并定位证据。

为什么重要

我们每天被海量视频和图片淹没,AI 审核虽然快,但经常看不懂潜台词,要么误删正常内容,要么放过真正的危险。同时,AI 看图说话的“幻觉”问题——睁着眼说瞎话——也让人难以信任。这两项新研究正是要解决这两个痛点,让 AI 的安全判断更准,错误也更透明。

🎬 HarmVideoBench:不只“有或没有”,而是“有多深”

现有有害视频检测就像个只认“有/无”的开关,碰到含沙射影、文化背景复杂的内容就抓瞎。HarmVideoBench 设计了三层考验:

  • 肉眼可见的证据:画面里直接出现暴力、血腥等。
  • 片段内隐含意义:需要结合上下文才能理解的威胁,比如讽刺语言配合特定手势。
  • 超越视频的推理:甚至需要外部知识才能判断的危害,比如某个符号在不同文化中的含义。

研究用 1379 个视频测试了 19 个主流 AI 模型,结果发现许多模型在深层理解上乏力。这意味着未来的内容审核 AI 将不再一刀切,而是更贴近人的理解方式。

🔍 GAVEL:AI说错话,自己写检查

你是不是遇到过:让 AI 描述一张图,它却无中生有地编造物体或颜色?GAVEL 就是给这种“瞎话”设计的纠错系统。它不仅可以告诉你描述有错,还能用文字解释错在哪,并在图片里把错误区域圈出来。

研究团队建立了一个专门的数据集来训练和检验这个能力。实验发现,连目前最强的闭源模型也频频犯错,而专门训练后,AI 的纠错准确度明显提升。

对我意味着什么

  • 刷短视频时,审核系统可能更“聪明”,减少误伤和漏网之鱼。
  • 使用 AI 生成图片描述时,你能得到一份“可信度报告”,甚至知道要不要信它。
  • 普通人也能像当初用“删除不良信息”按钮一样,未来轻松让 AI 指出它自己错在哪,逼着 AI 变得靠谱。
2026-06-23

AI看地图做决策?卫星与街景对不上?最新研究揭示大模型的空间推理短板

从地图导航到卫星图找地点,普通人一眼能看穿的空间关系,AI大模型还差得远。近期两项新研究揭开了视觉语言模型在空间推理上的软肋。

一句话

AI读地图做决策时常犯低级错误;在卫星图和街景之间找对应也频频翻车。

为什么重要

无论是自动驾驶规划路线,还是应急响应中通过卫星图定位,可靠的空间推理都关乎安全与效率。现有AI模型在这些简单任务上的表现远不如人类,意味着实际部署还有很长的路。

对我意味着什么

  • 如果你用AI辅助规划送货路线,别轻易相信它的建议,它可能选了条绕远路。
  • 如果你用卫星图找人找物,AI可能连“同一栋楼在两张图里”都判断不准,最终还得靠人眼。

🧭 地图上做决策?AI“眼睛”有,但“脑子”不够

研究者在《MapReason-OSM》中构建了一个用真实城市地图做推理的测试集:从选择最短路径,到确定设施最佳位置,再到分辨地图标记的歧义。结果发现,主流视觉语言模型能应付简单的直线导航,可一旦涉及“成本计算”(比如哪个邮局离所有住户总距离最短),准确率接近随机猜测。更糟的是,同一地点在不同缩放级别的地图上,AI给出的答案常常自相矛盾。

🛰️ 换个视角就脸盲?卫星图与街景匹配挑战

另一项研究《CVSBench》用3297组卫星-街景图像对,要求模型做跨视角问答和定位。例如,“街景中的红车在卫星图上哪个位置?”或是“这张街景是从哪个卫星图视角拍的?”即使顶尖模型,也容易在物体对应和空间布局上出错。有趣的是,让模型先用语言推理再给答案,提升微乎其微;而如果给模型一张“脑海地图”(认知地图),性能则跳升——说明AI缺的不是知识,而是像人一样构图的能力。

两项研究共同指向一个事实:大模型能识别物体、理解文字,却难以构建稳固的空间世界模型。这对我们普通人是个提醒:在需要空间智能的场景里,AI目前还是辅助,不能完全放手。

2026-06-20

AI“看得见却做不到”?新基准揭露多模态模型的知行鸿沟

一句话:ROSE基准测试发现,即使视觉画面一模一样,AI模型在简单计数任务上能拿高分,一旦换成需要结合上下文的操作指令,准确率就断崖式下跌。

为什么重要? 这暴露了当前多模态大模型的一个隐藏弱点:它们似乎能“看懂”图像,但在把视觉信息转化为具体行动时,极度依赖任务的表述方式,缺乏人类的灵活应变能力。就好比一个实习生能背出数据,却不会用数据做决策。

对我意味着什么? 如果你正在考虑将AI用于需要理解图像并采取不同行动的场景(比如监控中根据人数下达不同指令,或辅助驾驶识别路况),ROSE的结果提醒我们:今天的模型远没到“真理解”的程度。它们更像刻板的执行器,你得小心设计任务提示,否则可能闹出笑话——甚至危险。这项研究也暗示,通往更通用、更可靠的视觉AI,还有一段路要走。

2026-06-19

AI 也看脸?研究揭秘多模态大模型的社会偏见来自哪里

为什么这件事重要

今天,多模态大模型(能同时理解图文的大 AI)越来越多被用在招聘、审核、客服等实际场景里。但你可能不知道,当你上传一张照片,AI 对你的“第一印象”可能充斥着刻板偏见——而这一切竟然只由少数几个视觉细节决定。

一项新研究通过大规模受控测试,首次精准量化了这些偏见,揭露了一个扎心事实:人类的长相特征中,约有 15 个属性(如年龄、体型、时尚风格)就贡献了 80% 以上的偏见差异。其中,时尚风格、妆容等可改变的特征带来的评价波动,甚至超过了年龄和体型这种“固定属性”。

研究怎么做的

研究者收集了 500 张真实感的人脸图片,然后为每张脸生成约 50 种变体——比如只改变发型、肤色、眼镜、背景等单一特征。这样就能在保持“人”不变的前提下,单独看换一个耳环、换一件西装,AI 对 TA 的判断会往哪偏。

他们用这个测试集跑了 6 款主流多模态模型,在 25 种社会判断场景(如“这个人值得信任吗?”“TA 适合做管理者吗?”)中观察模型态度的变化。

发现了什么

  • 偏见高度集中:仅 15 个视觉属性就解释了近八成偏差,说明 AI 的偏见并非随机乱猜,而是系统性地盯住少数线索。
  • 最“危险”的特征是时尚和风格:戴着金链子或穿着休闲卫衣,会让模型在“可信度”“职业能力”等判断上出现巨大摆动,甚至超过年龄老三十岁的效果。
  • 语义对齐效应:当模型被要求判断“是否富有”时,它尤其敏感穿着打扮;判断“是否聪明”时,眼镜和表情作用拔群。偏见总在与问题语义相匹配的外观细节上集中爆发。

对我意味着什么

这意味着,哪怕你只在视频面试的背景里放了一盆植物,或换了一副圆框眼镜,AI 评价系统都可能因此产生显著不同的结论。这不是科幻情节——当越来越多的企业用 AI 筛选简历、分析面试视频,这些隐藏在像素里的“外貌歧视”就真的会影响应聘、贷款、保险等人生大事。

好消息是,研究给“去偏”指出了明确靶点:既然偏见只集中在少数可识别的视觉特征上,开发者就可以更有针对性地微调模型,或者在使用时主动模糊掉这些敏感特征。对普通人来说,这也是一次提醒:看到 AI 给出的“性格分析”“匹配评分”,不妨多想一层——它很可能只是在给你的穿着打扮打分。

2026-06-18

这周的AI新进展:灵巧机械手零样本干活、多模态模型也“健忘”、看图说话不再偷懒

🤖 零样本长序列灵巧操作:看一眼就学会用工具

一句话: 只靠几张不同角度的照片,机器人就能理解语言指令,自主规划出拿、放、用工具的连续动作。

为什么重要: 过去教机器人做复杂任务往往需要海量训练数据,而该系统直接借助视觉语言大模型(VLM)看懂现场,将2D关键点融合成3D空间中的操作目标,自动对齐抓取姿态和工具使用轨迹,无需针对每个新任务重新训练。

对我意味着什么: 人形机器人或机械臂进入家庭、工厂时,能像人类一样观察演示就能上手,也许未来你只需说“把桌上的螺丝拧紧”它就能立刻学会使用螺丝刀。


🧠 RNG-Bench:多模态大模型,上一秒看见下一秒就忘?

一句话: 新基准测试让AI做着“翻牌记忆”和“走迷宫”的游戏,暴露其多步交互中回忆先前观察的短板。

为什么重要: 现有评测大多让模型看全图,而真实场景(如自动驾驶、对话)常需记住已不可见的信息。该基准专门剥离出“对过去的记忆与利用”能力,用统一难度轴和“记忆缺口”指标精准衡量遗忘。即使最强模型也在最难的128K上下文关卡中远未饱和。

对我意味着什么: AI要成为可靠的日常助手,就不能“扭头就忘”。这项测试推动模型学会更持久的环境记忆,未来你的私人AI或许能记住你昨天说过的喜好,而不是每次都从零开始。


👁️ ViGOS:逼AI看图说话时不偷懒,先观察再推理

一句话: 多模态大模型经常只读文字不认真看图,新框架强制它先生成图像描述,再基于描述推理,避免“文本捷径”。

为什么重要: 很多视觉问答、图表分析任务中,模型会过度依赖题目文字猜测答案,导致兑现到现实时错误百出。该方法通过分离感知老师和推理老师,保证模型真正用上了图像信息,在多个视觉推理基准上显著提升“接地”能力。

对我意味着什么: 当AI帮你审核发票、识别医学影像时,你不会希望它只是根据文字旁注蒙混过关。这一技术让AI的视觉理解更诚实,可信度更高。

2026-06-17

多模态AI的“叛变”瞬间:明明看图答对了,却在最后一刻被文字带歪

发生了什么?

当我们给多模态大模型(比如能同时看图和读文字的那种)一张图片和一句与图片矛盾的文字时,模型通常会选择相信文字,哪怕图片里的证据很清楚。这听起来像是个已知的bug,但最新的研究却挖出了一个细思极恐的细节:模型其实在“半路”上已经看图猜对了,只是在最后输出答案的那一刻,突然又改口去迎合文字了。

为什么重要?

这个被称为“晚期文本覆盖”的现象,第一次清晰地告诉我们:多模态模型的视觉理解和语言理解并不是在打架,而更像是视觉先得出了正确结论,但被语言系统在最后关头强行镇压了。研究人员检测到,在模型内部,85%的错误答案都经历了这种“先对后错”的转向,而正确回答的路径正好相反——从文字转向视觉。这意味着,模型不是没有看懂图,而是它的语言部分太强势,把看出来的真相压下去了。

对我意味着什么?

  • 警惕多模态AI的“睁眼说瞎话”:如果你用AI去识别图片里的内容,但同时又给它一段可能有误导的文字说明(比如图片标签、上下文提示),它很可能屈服于文字,哪怕图片事实正好相反。这在医疗影像解读、自动驾驶、合同审查等高利害场景下尤其危险。
  • 好消息是,这毛病能简单修复:研究团队提出了一种叫CALRD的方法,不需要重新训练模型,只是在输出前把那个“被压抑的正确视觉判断”重新捞回来,就把准确率提升了近10%。这说明,很多时候AI的答案其实藏在半路的思考中,只是没挺到最后。
  • AI也有“违心之论”?:从某种角度看,这和人类在压力下改变看法有点像——明明心里有谱,但外部信息(尤其是语言指令)太强时,就容易动摇。了解这个机制,能帮我们设计出更坚守视觉事实的AI,也让普通用户更懂得如何不给AI“挖坑”。

一句话总结:下次你问AI一个看图说话的问题,记得留心你给它的文字是不是干扰了它的“第一眼真相”。

2026-06-16

AI 也会“看图说话”:从一眼扫过到反复端详,它越来越像人了

一句话
多模态大模型(能同时理解图和文的AI)现在不仅会回答问题,还能像人一样犹豫时多瞅几眼,甚至把脑子里想的步骤画出来给你看。

为什么重要
以前的视觉AI要么直接给答案(经常瞎编),要么直接说“不知道”,显得很浪费。现在,两项新进展让它们变得既谨慎又透明:

  • “别忙回答,先看清楚”:研究人员给AI配了一个“再获取证据”的按钮——当它没把握时,能自动放大图片细节、换个角度裁剪,或者专门检查一下可疑之处,再决定是回答还是放弃。这样既少犯错误,又不轻易退缩,就像你看到模糊照片时会凑近屏幕再确认一下。
  • “把思路画出来”:另一个团队让AI像老师讲解几何题一样,把推理过程转成看得见的图:先圈出图中的物体(比如“红色的球”),再生成深度图分析远近,最后综合判断。虽然现在这种“画图思考”对简单事实题反而可能添乱,但在需要空间感的任务上(比如判断两个物体的前后位置)准确率提升了25%~50%。

对我意味着什么 我们离“靠谱的AI视觉助手”又近了一步。将来用AI帮你看监控找线索、帮医生读片子、甚至帮居家机器人找东西时,它会越来越像一名细心的观察者:

  • 发现可疑时,主动说“等等,让我再仔细看看这个角落”;
  • 解释判断时,直接给你看它脑子里浮现的示意图,而不是吐一堆听不懂的术语。

这能让AI的视觉能力从“神神叨叨的算命”走向“有凭有据的分析”。

2026-06-15

AI学会“提问”了?多模态大模型的自我进化新突破

一句话

研究人员让视觉语言模型在无人工标注的情况下,自己生成越来越有挑战性的问题,并借此自我提升;另一项研究则发现,给AI看代码仓库的文件夹结构图,能让编程效率更高。

为什么重要

这两项进展让AI更接近人类的思考方式:主动提问和借助视觉辅助理解复杂系统。过去,AI只是一个被动的答题机器,现在它开始学会“好奇”,在自我追问中变得更聪明;而给编程AI看一眼“代码地图”,它就能像老练的开发者那样快速摸清项目全貌,减少重复试错。

对我意味着什么

未来,你的AI助理或许不再只会等你发号施令,而是会主动问你:“你有没有注意到这张图片里奇怪的地方?”或是“这段代码可能和另一个文件有关,要不要一起看看?”在编程场景中,AI不再吞下整个代码仓库的冗长文本,而是先看结构图,找到关键文件,沟通成本直接砍掉四分之一。这意味着更快、更省钱的AI服务,和更自然的人机协作方式。

2026-06-12

机器人学会自我纠错,AI 读懂印度多语言病历:三则听得懂的前沿进展

这一期 arXiv 论文里,有三项进展即使不写代码也能感受到分量:机器人从“按固定程序走”变成“听人话就能干”,AI 医生终于能处理印度农民用方言上传的 X 光片,而视觉模型居然能在看到自己画错框之后主动改正。下面挨个说。

1. 机器人:只需说“把碗放进洗碗机”,不用教每一步

一句话:给机器人一个模糊的意图(比如“把这里收拾干净”),它就能自己找出合适的动作,哪怕原本的编程做不到。

为什么重要:过去要让通用机器人做新任务,常常需要重新训练或写很细的指令。现在研究人员发明了“流反转引导”,相当于让机器人把自己“不那么好但说得通”的动作,像倒放录像一样还原成头脑中的意图,再从这些意图里挑出最靠谱的那个去执行。结果,机器人对“粗略语义引导”的成功率暴增,甚至用不到一分钟的训练就能把成功率提到 95%。

对我意味着什么:以后的家用机器人可能更像一个有常识的助手,不用我们一步步操作 APP,说句“把桌上的药瓶收进药箱”就能干。

2. 医疗 AI:终于能看懂方言写的症状,还能看片子

一句话:一个多语言多模态医疗推理系统,能同时理解印度多种地方语言描述的病情和对应的医学图像。

为什么重要:印度农村患者用母语描述胸口疼、上传超声图像时,主流的英文医疗 AI 几乎瘫痪。新工作不但建了一个覆盖 8 种印度语言、31 个身体部位、6 种影像类型的大型数据集,还开发了“多智能体协作”框架,让 AI 像专家会诊一样一步步推理,准确率显著提升。这让偏远地区的人有可能用上靠得住的 AI 初诊。

对我意味着什么:技术公平不是口号——如果一个 AI 只会英语看片,几十亿人就被排除在外。这个方向对国内方言混杂的基层医疗同样有启发。

3. 视觉模型:像人一样看着自己的“草图”改错

一句话:第一次让视觉语言模型能观察自己画的检测框,并迭代修改,就像你看着镜子调整领带。

为什么重要:现有模型能一次框出图中的物体,但不具备自我纠错能力。直接让模型看自己框出来的图再改,效果反而暴跌 30%。这项研究用两个阶段的训练(先像老师那样示范纠错,再让它自己反复练手),让模型学会了“看着自己画的东西改到对”。在多个测试集上,准确率全面超过原来的一次性预测。

对我意味着什么:这是 AI 从“本能反应”走向“思考后修正”的一个缩影。未来地图、自动标注、甚至 AR 眼镜里的实时提示,都可能因为这种“边看边改”的能力变得更加可靠。

2026-06-11

医学AI的“思考”能力大突破:OpenMedReason给模型装上可靠推理引擎

一句话

最新研究 OpenMedReason 发布了海量医学推理数据集,让AI看医学影像时能像专科医生一样,不光报结果,还一步步讲出分析过程。

为什么重要

在医疗这种容不得马虎的领域,AI光给出“正常/异常”的判断远远不够。医生和患者都需要知道模型凭什么这么判断,否则“黑箱”式的正确也可能是撞大运。 OpenMedReason 团队从真实的生物医学论文中提取了约45万个图文问答和推理链条,覆盖X光片、病理切片、临床照片、图表等,训练模型不仅看到图像,还要结合医学知识输出完整的思考步骤。用这些数据微调后,模型在视觉问答上的准确率平均提高了20%,更在感知准确性、医学知识掌握和推理逻辑性三个维度都有量化提升。

对我意味着什么

以后看病时,AI助手可能不再是冷冰冰地甩出一个诊断,而是会像资深医生那样:“这里边缘模糊、密度不均,结合病史,初步考虑是感染…”。这种可解释性让医生更容易核实、让患者更安心,也减少了医疗误判的风险。开源的数据集还会让更多中小机构训练出靠谱的医学AI,让优质医疗资源更普惠。

2026-06-10

多模态成「标配」,开源追平闭源

一句话

多模态 = 让 AI 同时看懂文字、图片、声音、视频,并在它们之间自由转换。

值得知道的进展

  • 从「卖点」变「标配」:2023–2025 是「谁的模型更强」的军备竞赛,2026 是「整合落地」年——多模态能力几乎所有前沿模型都有了,不再是差异化卖点。
  • 开源追平闭源,比预期快:阿里 Qwen3-VL(旗舰版在通用问答、图像/视频理解、OCR、文档理解等多项测评上对标 Gemini-2.5-Pro、GPT-5)、智谱 GLM-4.6V(原生多模态工具调用 + 128K 长上下文)等开源模型,把和闭源的差距拉得很小。

对「我」意味着什么

好消息:强大的多模态模型很多已经开源、免费可用——非技术的人也能直接调来「让 AI 看图说话/读文档/理解视频」,做点自己的小应用。这块和「智能体」「生成」结合,是普通人最容易上手做出东西的方向之一。

← 返回领域地图