原生多模态:不是技术炫技,而是通往真实世界的必经之眼

原生多模态正从技术选项升级为智能体理解真实世界的核心能力。相比外挂式视觉工具,其统一表征、低延迟反馈与闭环训练优势,在长链Agent任务中尤为关键。尽管面临算力成本与数据平衡挑战,Kimi K3、Qwen3.8-Max等旗舰模型已集体转向深度多模态融合,标志着行业从‘文本智能’迈向‘具身感知’的关键拐点。

当Agent任务链日益复杂,‘是否必须做原生多模态’已不再是个理论命题,而成为产品落地与能力边界的现实分水岭。一位头部基模团队研究员坦言:‘用户常截图输入——不是不会写提示词,而是描述视觉关系太耗上下文。’视觉直觉对开发者是效率跃升,对普通用户亦非遥不可及:PPT生成、网页操作、界面调试……这些高频场景早已悄然依赖视觉理解。纯文本模型本质‘失明’,虽可通过OCR或外挂VLM补足,但模块化方案终有天花板——LLM是‘老板’,VLM是‘员工’,信息需经压缩、转译、接力,延迟与失真在长链交互中被指数放大。而原生多模态不同:视觉信号与语言主干共享统一表征空间,通信带宽更宽,训练时可闭环反馈(如自评生成图像),推理时能直接感知页面动态并决策。GPT-5.6 Sol操控PC端Agent的震撼,正源于此‘所见即所思’的能力。业内共识尚未形成:苏茨克维视文本为世界投影,杨立昆则强调图像视频才是知识本源——前者高效但高度抽象,后者原始却信息丰沛。当前,GLM、Qwen3.8-Max、Kimi K3等旗舰模型不约而同押注原生多模态,参数规模(K3达2.8万亿)、视觉编码器自研(MoonViT-V2)、早期融合策略(early fusion)均指向深度耦合。然而资源代价不容忽视:更高分辨率、更多视觉token,意味着训练与推理开销激增;对简单字段提取任务,OCR仍比全图理解更经济。多模态并非万能钥匙,却是通向AGI物理世界接口的关键拼图。它不取代Coding的准入门槛地位,却正在重塑‘智能体’的定义边界——前者决定能否上桌,后者决定能走多远。

来源:36氪

AI 前线

外卖飞上天,骑手不下岗:DoorDash获无人机运营牌照背后的混合配送革命

2026-8-4 16:42:10

AI 前线

无人配送驶入真实商业周期:成本破局、车队运营与无图革命重塑产业逻辑

2026-8-4 18:42:10

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索