Token 是 AI 编程时代的"燃料"——用得好是生产力倍增器,用不好是吞金兽。Token 不是省出来的,是用出来的。真正值得追求的是:让模型少走冤枉路,把 Token 花在判断上,而不是花在搬运上。
理解 Token 消耗的底层机制,建立正确的成本认知
中心思想:深入解析 Token 消耗机制,帮助开发者理解成本构成并提供优化策略,实现同样的 Token 额度完成更多工作。
/context 命令,查看当前上下文的 Token 明细分布从 Prompt 设计到上下文管理,立即可用的具体操作方法
中心思想:Token 消耗的大头不是模型输出,而是 Agent 为回答问题而"搬运"的上下文信息。优化提问策略可大幅节省成本。
场景:要在项目中找到并修改用户登录相关的逻辑
中心思想:通过"审计-瘦身-运行时压缩"的优化方案,解决上下文窗口膨胀导致的 Token 浪费和性能下降问题。
将 Rules、Skills、MCP 配置统一放到一个 Git 仓库,各 IDE 通过软链接引用
根据查询类型选择最合适的检索工具,避免"大炮打蚊子"
| 查询类型 | 推荐工具 | 原因 | 示例命令 |
|---|---|---|---|
| 找函数定义、调用链、类继承关系 | CodeGraph | 结构化索引,精准定位 | @codegraph find-caller UserService.login |
| 找概念、语义相似代码、业务逻辑 | ccc | 语义向量匹配,理解意图 | @ccc "用户登录后如何生成 JWT" |
| 全文搜索特定字符串 | grep | 最简单直接 | grep -r "login" src/ |
在 Rules 中配置 Headroom 压缩,自动压缩工具返回的大段输出
在对话开头或 Rules 中加入压缩指令,让 Agent 用极简风格回复
中心思想:Token 消耗差异源于使用习惯。通过"多快好省"的策略,可以显著缓解"Token 焦虑"。
中心思想:额度变少并非坏事,它倒逼用户从"随手问模型"升级为"会调度模型",将有限资源投入到真正高价值的任务上。
中心思想:从输出端、输入端、处理端三个维度提高信噪比,科学提效而非盲目省钱。
中心思想:主动管理上下文可以显著降低 Token 消耗,同时提升 AI 的响应质量。
| 策略 | 适用场景 | 配置方式 |
|---|---|---|
| always | 编码规范、输出格式要求(每轮都需) | Rules 文件头部加 mode: always |
| agentic | 复杂项目背景、架构说明(AI 自主决定何时加载) | Rules 文件头部加 mode: agentic |
| manual | 参考资料、文档索引(用户主动 @ 才加载) | Rules 文件头部加 mode: manual |
中心思想:模型"看到"的内容远比你输入的多。系统性地剖析 AI 模型实际处理的内容,揭示隐藏的巨大 Token 消耗。
中心思想:通过精准的上下文控制和输出格式优化,在不降低工作质量的前提下,将 Token 使用效率提升一倍。
中心思想:通过标准化评估框架对比国产模型,筛选效果接近但成本更低的替代方案。
| 任务类型 | 推荐模型 | 预估成本 | 备注 |
|---|---|---|---|
| 代码补全/简单重构 | DeepSeek-V3.2 | 极低 | 速度快,适合日常编码 |
| 复杂逻辑/架构设计 | Kimi-K2.5 / GLM-4.7 | 中 | 推理能力强 |
| UI/前端代码生成 | Kimi-K2.5 | 中 | 对 Tailwind/React 支持好 |
| 代码 Review | DeepSeek-V3.2 | 低 | 能发现潜在问题 |
| 文档/注释生成 | 任意免费模型 | 免费 | 无需强模型 |
通过工程化架构和团队协作,实现大规模成本优化
中心思想:将一次完整开发拆成多个阶段,每个阶段由不同 Agent 角色负责,贵的只用在关键决策,便宜的用于跑测试和归档。
| 模式 | 成本倍率 | 适用场景 |
|---|---|---|
| Economic | x0.03(省 97%) | 原型开发、内部工具、探索性编码 |
| Balanced | x0.12(省 91%) | 日常业务功能开发(推荐) |
| Quality | x1.05(省 56%) | 核心模块、支付/安全相关代码 |
中心思想:通过 Runtime 架构让经济型模型也能稳定执行复杂生产级任务,将 Token 成本降低高达 90%。
中心思想:将确定性环节固化成脚本管道,只在真正需要思考的地方让 AI 介入,实现"脚本骨架 + AI 灵魂"。
场景:自动生成代码变更并创建 PR
中心思想:通过上下文卸载 + Mermaid 无限画布实现短期记忆压缩,让 Agent 学会"一语胜千言"。
把 AI 当作按字数收费的顶级外包专家,需求给准、资料给对、废话不说。Token 成本不在于你说了多少,而在于配置侧精简系统税 + 对话侧保护缓存。
Rules 按需加载、禁用无用工具、精炼 Memory 和 CODEBUDDY.md,将 System Prompt 从 25k 压到 12k,每轮省 1.3k 等价 Token
一个 Session 干到底、不中途改配置、不频繁切模型。长对话缓存命中率高(×0.1),新窗口才是最贵的操作
先低成本定位找出最相关的 3-5 个文件,确认范围后再读取指定片段。"你自己找"可能多花 20 万 Token
简单任务用便宜/免费模型,复杂判断才用强模型。"分层使用 AI"而非默认上最强
任务换了/跑偏了/超 1 小时 → 开新对话。阶段性结论写入文件,让 AI 按需读取
验证过的固定流程脚本化,AI 只在需要智能决策的环节介入。确定性工作流比 Agent 自主决策更稳更省
按任务复杂度分级分派,双 Reviewer 交叉验证,升级兜底机制保证质量
上下文卸载 + Mermaid 画布实现四级分层存储,让 Agent"少背负"而非"少知道"
固定放前面,动态放后面。规则要短,知识要散。AGENTS.md 放地图,不放小说。命令别喷泉,日志先压缩。MCP 少暴露,结果再过滤。SubAgent 隔离探索,别把小事外包。输出别作文,废话会复利。