Agent Context Economics 101|00|Reading Guide:Agent 为什么需要上下文经济学
Agent 的上下文不是免费的聊天记录,而是一份每轮都要重新处理、缓存和计费的运行时资产。这份阅读指南给出从机制、架构到成本与运维的完整路线。
阅读全文关于 Agent Engineering 的文章、框架与实践记录。
98 篇文章
Agent 的上下文不是免费的聊天记录,而是一份每轮都要重新处理、缓存和计费的运行时资产。这份阅读指南给出从机制、架构到成本与运维的完整路线。
阅读全文
一句 continue 为什么也可能很贵?拆开 Agent 每轮请求里的未缓存输入、缓存写入、缓存读取、输出 token 与首 token 延迟。
阅读全文Prompt Cache 依赖的不是语义相似,而是稳定的 token 前缀。缓存友好性因此首先是一份确定性的上下文组装契约。
阅读全文工具 schema 位于上下文前部时,动态增删一个工具可能让后面的长会话重新 prefill。省下少量定义 token,不一定省下完整任务成本。
阅读全文Session ID 只是产品状态和路由线索;真正决定缓存复用的是 token prefix。分支、回退、fork 与 resume 因此会产生不同结果。
阅读全文缓存内容完全相同也可能 miss:TTL 会过期,模型会切换,路由会变化,worker 会淘汰状态。一次短请求可能因此重算整段长上下文。
阅读全文删除旧上下文会缩短未来请求,也会让删除点之后的前缀重新计算。追加、裁剪和压缩必须按完整任务的质量与成本共同决策。
阅读全文上下文预算不是一个 token 上限,而是一组任务级决策:质量、延迟、缓存复用、成功率与 Provider 灵活性要一起衡量。
阅读全文缓存健康不能靠账单猜。把缓存读写、未缓存输入、TTFT、请求变化与路由线索放到同一条时间线上,才能解释一次 miss。
阅读全文
Loop Engineering 不是让 Agent 多跑几轮,而是在不确定的 Agent 之上,设计一条能够产生证据、识别进展并走向可判定终态的路径。
阅读全文
为什么 Claude Code、Codex 这类 coding agent 在长任务里容易吃额度、首 token 变慢?原因之一是长上下文反复 prefill。KV Cache 和 Prompt Cache,分别解决了两层重复计算问题。
阅读全文
用一张总图把 Pi Agent 101 串起来:模型、工具、消息、会话、上下文、扩展、UI 和可观测性如何组成一个 Agent Harness。
阅读全文新文章直接送到邮箱。没有信息流焦虑,只有值得保留的工程与产品方法。
免费订阅