成本最大的操作
RAG 评测(非线上):¥10.88 / 486 次。 离线 RAG 评测与线上问答分开统计,不再把测试预算算成用户流量。
近 30 天 · 真实调用 token 与延迟 · 成本按调用时的模型价目快照估算
外部嵌入、重排、生成与支持度审计占中位请求约 99.4%; 当前最慢 p95 阶段是 生成回答(9.5s)。优化优先级应放在供应商往返、超时和降级,不是本地 SQL 微调。
RAG 评测(非线上):¥10.88 / 486 次。 离线 RAG 评测与线上问答分开统计,不再把测试预算算成用户流量。
108 次使用调用时模型价目快照;3,352 次旧记录只能使用历史 fallback。旧金额只适合看趋势, 不能当供应商账单。
保持 SiliconFlow 嵌入/重排不变;在 模型配置中切换 DeepSeek 生成模型后,用新调用积累可比较的成本、延迟和质量快照。
| 操作 | 调用 | 输入 token | 其中命中缓存 | 输出 token | 平均延迟 | 估算成本 | 每次 | 价格口径 |
|---|---|---|---|---|---|---|---|---|
| RAG 评测(非线上) | 486 | 7,429,604 | 4,013,056 54% | 255,541 | 5.2s | ¥10.88 | ¥0.0224 | 历史 fallback |
| RAG 问答生成 | 469 | 6,724,598 | 3,794,048 56% | 278,822 | 6.2s | ¥9.99 | ¥0.0213 | 历史 fallback |
| 内容结构化 | 1,672 | 2,379,113 | 736,000 31% | 727,956 | 4.0s | ¥9.48 | ¥0.0057 | 历史 fallback |
| 推荐理由 | 725 | 1,001,963 | 232,320 23% | 60,437 | 2.4s | ¥2.14 | ¥0.0029 | 历史 fallback |
| 内容结构化 | 60 | 95,162 | 74,368 78% | 31,924 | 3.9s | ¥0.09 | ¥0.0014 | 调用时快照 |
| 推荐理由 | 32 | 44,601 | 17,408 39% | 2,619 | 1.8s | ¥0.03 | ¥0.0010 | 调用时快照 |
| 报告生成 | 15 | 42,673 | 8,704 20% | 3,903 | 3.9s | ¥0.04 | ¥0.0028 | 调用时快照 |
| RAG 问答生成 | 1 | 14,384 | 14,336 100% | 350 | 2.9s | ¥0.00 | ¥0.0010 | 调用时快照 |
命中缓存的输入 token 按更低费率计价,且它包含在输入 token 内—— 两者都按全价算会把缓存记成花钱而不是省钱。
| 阶段 | 样本 | p50 | p95 / SLO | p99 | 占单次请求比例 | 位置 |
|---|---|---|---|---|---|---|
| 生成回答 | 206 | 5.9s | 9.5s / 15.0s 达标 | 28.1s | 54.3% | 外部 API |
| 高风险数值关系审计 | 3 | 3.8s | 4.0s / 15.0s 样本不足 | 4.0s | 26.9% | 外部 API |
| 交叉编码器重排 | 206 | 2.7s | 3.8s / 10.0s 达标 | 5.5s | 25.9% | 外部 API |
| 引用支持度打分 | 91 | 1.7s | 3.6s / 10.0s 达标 | 4.8s | 16.2% | 外部 API |
| 问题嵌入 | 206 | 1.7s | 2.1s / 5.0s 达标 | 2.5s | 14.2% | 外部 API |
| 稠密召回 | 206 | 49ms | 188ms / 10.0s 达标 | 344ms | 0.4% | 本地 |
| 关键词召回 | 206 | 22ms | 97ms / 10.0s 达标 | 139ms | 0.2% | 本地 |
| 父块展开 | 206 | 6ms | 18ms / 10.0s 达标 | 25ms | 0.1% | 本地 |
| RRF 融合 | 206 | 5ms | 11ms / 10.0s 达标 | 14ms | 0.0% | 本地 |
| temporal | 6 | 3ms | 7ms / 10.0s 样本不足 | 8ms | 0.0% | 本地 |
| 证据选择 | 206 | 3ms | 8ms / 10.0s 达标 | 10ms | 0.0% | 本地 |
| 查询规划 | 206 | 0ms | 0ms / 10.0s 达标 | 0ms | 0.0% | 本地 |
阶段样本数可以少于问答总数:重排在 reranker 不可用时会被跳过并记为降级, 把缺席当成 0 毫秒平均进去,会报出一次从未发生的提速。
比例是先按每次请求算、再取中位数,不是「阶段 p50 ÷ 总 p50」。 后者拿两个不同样本群的中位数相除——支持度打分只在有引用的 36 次请求上计时, 生成在全部 151 次上——却把它们当成同一个整体的切片, 结果是几项加起来 122.7%。现在每一格单独成立: 「在中位数的那次请求里,这个阶段占了多少」。
答案命中率 0% 是设计结果,不是缓存坏了:键里含语料指纹, 而采集每 120 秒写一次,所以时间型问题几乎必然未命中——这正是它该有的行为。 对照之下嵌入命中率 0% 是真的在省钱: 嵌入是纯函数,同一段文字永远得到同一个向量,没有新鲜度可言。
近 30 天 92 次真实提问、3744 个候选的聚合。90 题黄金集回答不了这一节——那是事先选定的固定样本, 这里是总体。
| 候选去向 | 条数 | 含义 |
|---|---|---|
dropped_budget | 1067 | 证据位已满(上限 10 条) |
dropped_document_cap | 803 | 同一篇文章已超额(单篇霸榜保护) |
evidence_uncited | 548 | 进入证据集,但答案没用上 |
dropped_source_cap | 509 | — |
cited | 350 | 进入证据集,且答案引用了它 |
ranked_out | 264 | 重排后排名不够靠前 |
dropped_story_fold | 203 | 同一事件已有代表(四家媒体报道同一件事只算一条) |