社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  Git

API降价还不够?DeepSeek V4 账单再打折:4亿Token只花12刀!冲上HN热榜,Github 已获七千星

51CTO技术栈 • 3 月前 • 364 次点击  
编辑 | 林芯

刚刚,一款名为 DeepSeek Reasonix 的开源项目冲上 Hacker News 热榜!

小编就去扒了一下 Reasonix 的来龙去脉:Reasonix 在4月21号出现在 Github,随后被 DeepSeek 收录官方文档。

前两天 Deepseek 宣布 V4-Pro 模型API价格永久降价,围绕“低成本长上下文 Agent”的讨论被点燃。

借着这股东风,Reasonix 的热度直接暴涨。截至今天,DeepSeek‑Reasonix 在 Github 上已经获得 7 千 star。

一个专为 DeepSeek 设计的 Agent 项目,有什么亮点?

凭什么能突然爆火?

Reasonix:为 DeepSeek量身定制的省钱 Agent

Reasonix 是什么?

官方博客里的描述: 一款基于 DeepSeek 的原生 AI 编码代理,围绕前缀缓存稳定性进行设计。

简单来说 Reasonix 是一款“DeepSeek 原生”的省钱终端 Agent。

hero-terminal.svg

为什么不用 Claude Code,Reasonix 却火了 ?

如果只是模型便宜,大家直接用 OpenCode 或 Claude Code 连 DeepSeek API 就行了,为什么偏偏是 Reasonix 火了?

正如 Hacker News 网友热议的那样,Reasonix 戳中了一个痛点:Prefix Cache(前缀缓存)的命中率。

DeepSeek 提供了极其夸张的缓存折扣(命中缓存的输入 Token 价格低至 $0.003625/百万)。这意味着如果你的上下文在多轮对话中保持不变,几乎是在白嫖算力。

然而,像 OpenCode 或其他通用 Agent 的架构,为了通用性,往往会在每一轮对话的系统提示词里动态注入一些新信息(比如:当前时间戳、当前 Git 分支名、最新文件列表等)。

只要前缀里变了一个 Token,整个模型的 KV 缓存就会失效,下一轮又得全量重新计算。

Reasonix 是“缓存优先”的设计。它在工程上严格保证了 Prompt 前缀的绝对稳定,绝不乱塞动态信息。

加上它内置了 Flash 与 Pro 模型的双模智能切换(平时用极其廉价的 Flash 跑日常迭代,遇到难关输入 /pro 一键武装 Pro 模型),在终端里简直是省钱利器。

4.35 亿 Token 仅花 12 刀!揭秘 Reasonix 三大支柱

根据博客,DeepSeek‑Reasonix 有三大支柱:

第一支柱:缓存优先循环

DeepSeek 将缓存输入计入未命中率的约 10%。自动前缀缓存仅在与前一个请求的字节前缀完全匹配时才会激活。大多数代理循环会在每次迭代中重新排序、重写或注入新的时间戳——实际缓存命中率:3% 到 20%。

解决方案:将上下文划分为三个区域。

┌─────────────────────────────────────────┐
│ IMMUTABLE PREFIX                        │ ← fixed for session
│   system + tool_specs + few_shots        │   cache hit candidate
├─────────────────────────────────────────┤
│ APPEND-ONLY LOG                         │ ← grows monotonically
│   [assistant₁][tool₁][assistant₂]...    │   preserves prefix of prior turns
├─────────────────────────────────────────┤
│ VOLATILE SCRATCH                        │ ← reset each turn
│   R1 thought, transient plan state      │   never sent upstream
└─────────────────────────────────────────┘

不可变前缀:会话期间固定不变(包含系统提示词、工具声明、Few-shots 示例),是缓存命中的核心。

仅追加日志:保存历史对话轮次,严格保留先前轮次的前缀。

易失性草稿:每轮重置(如 R1 的思考过程、临时的计划状态),绝不发送给上游模型,从而避免污染后续的缓存。

并行工具调度:支持声明 parallelSafe?: boolean 的工具并发执行,在保证效率的同时,通过串行屏障(Serial Barrier)确保数据的读写顺序和模型看到的历史一致。

第二支柱——工具呼叫维修

问题:DeepSeek 在实际使用中存在一些特定的失效模式:工具调用的 JSON 错误地遗留在标签内部,未输出到最终消息中;当参数架构包含超过 10 个参数或存在深度嵌套时,参数容易丢失;连续多轮用完全相同的参数调用同一个工具;由于达到 max_tokens 导致 JSON 在中间被截断。

解决方案:通过四个阶段的管道进行自动修复。

Flatten:自动检测复杂 Schema,将其转换为“点号标记法”(dot-notation)展示给模型,在调用前再重新组装。

Scavenge:利用正则表达式和 JSON 解析器,强行从 reasoning_content(思考内容)中捞出模型忘记正常发射的工具调用。

Truncation:检测未闭合的 JSON,通过补全右括号或请求续写来修复。

Storm:在滑动窗口内如果出现完全相同的(工具, 参数)元组,则直接抑制该调用,并注入一轮反思。

第三支柱——成本控制 

问题:如果 Agent 默认一直调用最强的前沿模型(如 v4-pro,成本约为 flash 的 12 倍),且在上下文中堆积大量的全量工具结果,活跃用户每月成本可能高达 $150–$250。但实际上,大多数对话轮次不需要顶尖的推理能力,且许多工具结果往往只在当下有用。

解决方案:通过以下四个机制协同控费(无需人工微调)

分层默认(Flash 优先):默认采用 auto 预设,即“平时用 v4-flash,遇到困难轮次才自动升级到 v4-pro”;所有辅助调用(如截断修复、摘要生成)硬编码强制使用成本极低的 v4-flash。

轮次结束自动压缩:当一轮对话结束时,任何超过 3000 tokens 的工具结果都会被就地压缩。后续轮次只能看到紧凑的摘要,如果需要全量数据可以重新读取(重新读取一次的成本远低于让几万 token 滚雪球般拖累后续的每一次对话)。

/pro 单轮手动解锁:用户预测任务艰难时可输入 /pro,仅让下一轮对话强制运行在 v4-pro 上,随后自动降级,避免忘记切回而产生不必要的开销。

失败信号自动升级:实时统计当前轮次中“Flash 正在挣扎”的信号(如文件修改报错、找不到文件、触发工具修复等)。一旦信号达到阈值(如 3 次),当前轮次的剩余部分将自动升级到 v4-pro 运行,确保任务不卡死。

官方博客里给出了真实案例:4.35 亿个输入token, 缓存命中率 99.82% ,成本约为 12 美元,而使用 v4-flash 且不使用缓存时,相同工作负载的成本约为 61 美元。

网友:前沿模型成本飙升,它来得恰逢其时

对 Reasonix,网友的评论大多集中于功能讨论。

“我不确定是否需要 Reasonix 才能利用 DeepSeek 的缓存”

“鉴于其他前沿模型的成本飙升,此时推出这款产品可谓恰逢其时。”

还有吐槽网站页面效果的:“动画文字效果导致示例页面不断调整大小,使得下方的内容上下移动。用户体验太差了。”

小编也觉得这个页面有点潦草。

写在最后

有网友在评论区下面玩起了梗:“计算机科学里只有两个难题,命名和缓存失效。”

而 Reasonix 的整个设计,本质上就是在解决缓存问题。

各位大佬体验过了吗?欢迎在评论区分享~

参考链接:

https://esengine.github.io/DeepSeek-Reasonix/

https://github.com/esengine/DeepSeek-Reasonix/tree/main

——好文推荐 ——

“构建你的第一个AI Agent团队”指南!5步快速打造个人Agent,全自动内容Agent团队实例:30分钟内自动出稿,Agent团队高效运转的技巧

面壁智能正式开源中国首个基于国产算力平台训练的 1.58-bit 端侧高效大模型 BitCPM-CANN

Claude比你更懂你的需求?Anthropic工程师公开内部用法:用HTML作为AI规范,反而比Markdown更省Token;让“验证”成为Agent的原生特性

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/196841