直接回答:成本大头通常是:冗长的系统提示词和检索上下文(每次请求重复付费)、多轮对话累积的历史、Agent 多轮工具调用的循环开销、以及用大模型干了小模型能干的活。降本手段按见效速度排:prompt 瘦身、上下文裁剪、缓存、模型分级路由、以及把能规则化的环节移出 LLM。

实践要点:第一,prompt 工程降本:删掉示例中的冗余、把固定长前缀放最前以命中 prefix caching(各厂商对缓存命中部分大幅降价)。第二,上下文管理:多轮对话做摘要压缩或滑动窗口,RAG 严格 top-k 而不是越多越好。第三,语义缓存:对相似问题直接返回缓存答案,FAQ 型业务命中率很高。第四,模型路由:用分类器或简单规则把简单请求发给小模型(分类、改写),只有难题走旗舰模型,通常 70% 以上流量可以降级。第五,批处理 API:离线任务(评测、数据清洗)走 batch 接口一般半价。第六,量化自托管:流量稳定且规模大时,自建推理的边际成本可能低于 API。先做好按功能的 token 计量(哪类请求烧多少钱),没有计量就没有优化。

追问方向:prefix caching 的命中条件是什么?语义缓存的相似度阈值怎么定?蒸馏小模型替代大模型的流程是什么?

(约 460 字)