当Agent任务链日益复杂,‘是否必须做原生多模态’已不再是个理论命题,而成为产品落地与能力边界的现实分水岭。一位头部基模团队研究员坦言:‘用户常截图输入——不是不会写提示词,而是描述视觉关系太耗上下文。’视觉直觉对开发者是效率跃升,对普通用户亦非遥不可及:PPT生成、网页操作、界面调试……这些高频场景早已悄然依赖视觉理解。纯文本模型本质‘失明’,虽可通过OCR或外挂VLM补足,但模块化方案终有天花板——LLM是‘老板’,VLM是‘员工’,信息需经压缩、转译、接力,延迟与失真在长链交互中被指数放大。而原生多模态不同:视觉信号与语言主干共享统一表征空间,通信带宽更宽,训练时可闭环反馈(如自评生成图像),推理时能直接感知页面动态并决策。GPT-5.6 Sol操控PC端Agent的震撼,正源于此‘所见即所思’的能力。业内共识尚未形成:苏茨克维视文本为世界投影,杨立昆则强调图像视频才是知识本源——前者高效但高度抽象,后者原始却信息丰沛。当前,GLM、Qwen3.8-Max、Kimi K3等旗舰模型不约而同押注原生多模态,参数规模(K3达2.8万亿)、视觉编码器自研(MoonViT-V2)、早期融合策略(early fusion)均指向深度耦合。然而资源代价不容忽视:更高分辨率、更多视觉token,意味着训练与推理开销激增;对简单字段提取任务,OCR仍比全图理解更经济。多模态并非万能钥匙,却是通向AGI物理世界接口的关键拼图。它不取代Coding的准入门槛地位,却正在重塑‘智能体’的定义边界——前者决定能否上桌,后者决定能走多远。
来源:36氪
