DeepSeek-V4-Pro正式版发布:智能体能力跃升,多项基准超越Claude Fable 5

DeepSeek-V4-Pro正式版(0813)上线,强化JSON输出、工具调用等智能体能力,在Cybergym、AutomationBench及编程专项DeepSWE测试中均超越Claude Fable 5,DeepSWE得分达62.7。虽API响应自然度待优化、并发限500,但成本下探预期明确,直击开发者Agent落地痛点。

DeepSeek官方API文档确认,deepseek-v4-pro模型已全面升级为DeepSeek-V4-Pro-0813正式版本,调用方式保持兼容,仍使用原模型名即可接入最新能力。本次更新重点强化智能体(Agent)核心功能,原生支持JSON结构化响应、多工具协同调用、Responses API及Anthropic兼容接口。尽管并发上限设为500(低于V4-Flash的2500),其在真实场景中的任务完成质量显著跃升。值得注意的是,部分用户反馈网页端与API输出在思维链(CoT)表达上存在体验落差——API响应偶现语序僵硬、自然度不足。基准测试结果亮眼:在AI安全智能体评测Cybergym与自动化工作流Benchmark AutomationBench中,V4-Pro正式版反超Claude Fable 5;尤为突出的是,在面向长周期、高复杂度软件工程的编程智能体专项测试DeepSWE中,得分从预览版的12.8飙升至62.7。随着昇腾950超节点下半年规模化部署,Pro系列成本有望大幅优化——当前调用成本已成为中小开发者落地Agent应用的核心掣肘,而性能差距正快速收窄,性价比正成为技术选型的关键标尺。

来源:智东西

AI 前线

Redmi K100 Pro系列提前登场:双旗舰芯片+185Hz自适应高刷屏+潜望长焦,重构性能旗舰新范式

2026-8-12 22:45:17

AI 前线

荣耀发布全球首款具身智能手机Robot Phone:可动机械臂+电影级影像+终身免费YOYO AI

2026-8-13 4:45:15

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索