DeepSeek V4-Flash 正式版来啦,原生支持 Response API

前言

7 月 31 日,DeepSeek V4-Flash 正式版 API 上线公测。

比起模型本身的性能提升,这次更新里有个容易被忽略但很重要的变化,原生支持了 Response API 格式,还专门适配了 Codex。

可能有人会问,之前不是已经有 Chat API 了吗,为什么又来一个 Response API?

它俩到底差在哪?今天就来聊聊。

先说结论

Chat Completions API 是目前最通用的接口,几乎所有大模型平台都兼容,适合做对话类应用。

Response API 是 OpenAI 在 2025 年推出的新一代接口格式,设计上更贴近 Agent 场景,内置了联网搜索等工具,流式输出也是全新的事件驱动模型。

DeepSeek 这次选择跟进 Response API,核心目的是让 Codex 这类编程工具能零改造接入。

两个 API 长什么样

先看看两者的基本调用方式。

Chat API 你传一个 messages 列表,每条消息有 role 和 content,模型返回一个 completion。

Response API 你传一个 input,可以是纯字符串,也可以是一个 item 列表。另外多了个 instructions 参数,用来放系统指令,跟 messages 里的 system 消息是同一件事,只是换了个位置。

看起来差不多,但底层设计思路差别很大。

真正的区别在哪

内置工具

Chat API 的 tools 只支持 function,也就是你自己在代码里定义的函数。

如果你想联网搜索,得自己实现,模型只负责告诉你”我需要搜索”,剩下全靠你的后端去调。

Response API 直接内置了 web_search 工具,服务端帮你执行搜索,结果自动喂回给模型。

你只需要在 tools 里声明一个 web_search,模型自己决定什么时候搜、搜什么、怎么用结果。

这对 Agent 场景来说省了很多事,不用再手搓搜索逻辑了。

流式输出

Chat API 的流式输出比较朴素,服务端不断推 SSE 数据块,最后以 data: [DONE] 结尾。

你收到的是一段一段的文本增量,自己拼起来就行。

Response API 换了一套完全不同的事件驱动模型。

每个事件都有明确的类型,比如 response.created(响应已创建)、response.output_text.delta(文本增量)、response.reasoning_text.delta(思维链增量)、response.function_call_arguments.delta(函数调用参数增量)。

流以 response.completed 或 response.failed 结束,没有 data: [DONE]。

好处是你能精确知道模型在干什么,是在思考、在输出正文、还是在调用工具,不用猜。

思维链处理

Chat API 里思维链是通过 message 里的 reasoning_content 字段返回的,跟正文混在一起。

Response API 把思维链独立成了一个 reasoning 类型的 item,跟 message、function_call 平级。

这意味着你可以单独读取思维链内容,单独做处理,不用从消息体里去捞。

对需要展示推理过程的 Agent 应用来说,这个设计干净很多。

状态管理

两个 API 都是无状态的,服务端不存储会话历史。

区别在于,Response API 的设计天然支持 future state(有状态扩展),比如 OpenAI 原版支持 previous_response_id 来串联多轮对话。

不过 DeepSeek 目前不支持这个参数,多轮对话还是得客户端自己维护完整上下文。

Codex 适配

这次更新的另一个重点是 Codex 适配。

Codex(OpenAI 的编程工具)默认使用 Response API 格式跟模型通信。

之前 DeepSeek 只提供 Chat API,想用 Codex 的话需要额外的转换层。

现在 DeepSeek 原生支持了 Response API,开发者不用改 Base URL,直接在 Codex 配置里把模型换成 deepseek-v4-flash 就行。

官方还提供了 apply_patch 这个特殊的 custom 工具,专门给 Codex 的代码补丁功能用的。

对独立开发者来说,这意味着多了一个高性价比的编程 Agent 后端选择。

价格和限制

V4-Flash 的定价延续了 DeepSeek 一贯的路线。

百万 tokens 输入 1 元(缓存命中只要 0.02 元),输出 2 元。

并发限制 2500,比 V4-Pro 的 500 高了五倍。

注意有个峰谷定价机制,北京时间每天 9:00 到 12:00、14:00 到 17:00 是高峰时段,价格翻倍。

如果你想省钱,错峰用就行。

该选哪个

如果你只是做聊天机器人或者简单的文本生成,Chat API 完全够用,兼容性也最好。

如果你在做 Agent、需要联网搜索、用 Codex 编程、或者需要精细控制思维链的展示,Response API 是更好的选择。

两个 API 可以共存,不用非此即彼。

DeepSeek 表示 V4-Pro 将在 8 月初也支持 Response API,到时候选择面会更宽。

你打算用 Response API 还是继续用 Chat API?

有没有遇到过 Agent 开发里工具调用太麻烦的问题?

评论区聊聊你的选择。