DeepSeek通过发布DeepSeek-V4-Pro-0813正式版,同时推出DeepSeek Harness v0.1开发者预览版及采用MIT许可证的开源项目,扩大了其在开发者人工智能工具领域的竞争范围。Harness为开发者提供了一个可定制框架,用于构建能够处理代码仓库、文件、shell命令和长期工作流的编程代理,而不只是使用模型本身。
V4-Pro目前可通过DeepSeek网页端、手机应用和API接口使用。公司新增了对OpenAI Responses API的原生支持,并与Codex集成;该模型还已在网站和应用中以“Expert Mode”提供。API用户无需更改模型标识符,因为deepseek-v4-pro现在指向V4-Pro的最新版本。
可替换的代理框架
DeepSeek将Harness项目(也称为dsh)描述为一个基于Cordis的开源框架,而Cordis是一个采用可组合插件的框架。公司用“万物皆插件”概括其理念,模型、工具、技能、会话、隔离环境、文件系统、执行循环、协调机制和用户界面都可以替换。
Harness当前支持检查代码仓库、修改文件、执行shell命令、搜索文件和网页、制定计划、调用技能、将任务委派给子代理,以及执行审批策略。DeepSeek表示,Standard模式可作为完整的编程代理运行,并配备本地网页界面,以便选择工作区和批准敏感操作。
代码托管于GitHub,用户可以通过npm使用npx @deepseek-ai/dsh web命令运行界面,DeepSeek也提供了从源代码构建的说明。不过,代码仓库明确将该软件描述为“开发者预览版”,并警告可能发生破坏兼容性的变更,因此公司尚未将其作为稳定的生产平台推出。此外,Harness并不是Claude Code或Codex体验的完整替代品,而是一个开放且模型中立的框架,重点在于组合代理周边的基础设施。
V4-Pro专注于代理任务
8月13日的发布标志着V4-Pro从预览阶段转为正式版,而不是DeepSeek首次推出V4系列。该系列包括拥有1.6万亿参数、每个令牌激活490亿参数的V4-Pro,以及拥有2840亿参数、每个令牌激活130亿参数的V4-Flash。两款模型均支持最长达100万令牌的上下文窗口。
DeepSeek表示,新版本在代理能力方面实现了大幅改进,尤其是在生产环境中,并支持工具调用、JSON输出、Responses API,以及适用于V4-Pro和V4-Flash的Anthropic格式API接口。公司还新增了明确的推理努力程度控制级别:Non-think用于快速处理常规任务,Think High用于更复杂的问题和规划,Think Max用于需要密集推理的任务。
根据DeepSeek公布的数据,V4-Pro-0813在Terminal Bench 2.1中取得87.9分,在Toolathlon-Verified中取得74.1分,在DSBench-FullStack中取得71.1分,在DSBench-Hard中取得67.2分。公司说明,部分Code Agent任务的结果是在使用Harness的“最低模式”下测试的,这意味着它们衡量的是模型在代理执行环境中的表现,而不是模型单独运行时的独立表现。
根据使用时段调整的新API价格
在发布的同时,DeepSeek宣布自UTC时间8月16日16:00起放弃API接口的统一定价。高峰时段将为UTC时间01:00至04:00和06:00至10:00,其余时间归类为非高峰时段;非高峰价格为新的高峰价格的一半。
V4-Pro每百万未缓存输入令牌的价格将从目前的0.435美元上调至非高峰时段的0.66美元和高峰时段的1.32美元;输出价格则从0.87美元上调至1.98美元和3.96美元。V4-Flash的输入价格将从0.14美元上调至非高峰时段的0.22美元和高峰时段的0.44美元,输出价格则从0.28美元上调至0.66美元和1.32美元。
缓存令牌的价格也将上涨:V4-Pro将从每百万令牌0.003625美元上调至非高峰时段的0.022美元和高峰时段的0.044美元;V4-Flash则从0.0028美元上调至0.007美元和0.014美元。按100万未缓存输入令牌和100万输出令牌计算,V4-Pro的成本将从目前的1.305美元上升至非高峰时段的2.64美元和高峰时段的5.28美元,实际成本会因缓存比例和输出比例不同而有所差异。
这些新版本使DeepSeek直接参与编程代理运行层面的竞争,而不仅仅是模型质量和令牌价格的竞争。另一方面,Harness的早期预览以及API价格上涨意味着,各团队需要在计算总体成本时,同时评估框架稳定性、缓存行为和任务调度,以及在自有基础设施上运行开放权重这一选项。