
第一章 你被 PDF 偷偷收割了多少 token
先问个扎心的:你有没有干过这事——把几百页的合同、年报、论文往 Claude 里一丢,说”帮我总结一下”,然后接着追问”第 47 页那个终止条款到底啥意思”。第一遍回答挺爽,可你每追问一句,账单就悄悄涨一截。
为什么?因为 Claude 默认会把每一页转成图片、再提一层文字,光文字层每页就有 1500 到 3000 token,图片 token 还没算。更要命的是:对话历史每一轮都会重新发给模型。那本 200 页的 PDF 不是一次性收费,而是你每追问一次,整本文档就重新被计费一次。1000 页的教材,你只想找两段相关内容,却逼着模型在 1000 页里大海捞针——又贵,又容易幻觉。这坑,几乎人人踩过。
第二章 Token Saver 是什么
它就是一个专治这个病的开源工具。Token Saver 是一个 MCP(Model Context Protocol)扩展,专门给 Claude Desktop 用,MIT 协议,目前 v1.0。作者 Arnav Rai 是罗切斯特理工学院(RIT)的计算机本科生,在 Marktechpost 实习时做出的这个项目,项目地址 github.com/Marktechpost/Token-Saver。
一句话概括它的思路:别把整堆数据塞进上下文窗口,搜索这件事放在本地代码里做,只把最相关、带页码标注的一小片结果喂给模型。它本质上是个跑在你自己机器上的本地 MCP server——一个轻量后台进程,Claude 把它当成一个工具来调用。你的 PDF 从头到尾不会离开你的硬盘。
第三章 核心思路:搜索放本地,只给模型两三段
这个思路同时在两件事上得分。第一是省钱:上下文每轮重发,你只喂一小片,小片段只付一次钱,而不是整本文档在每轮追问里反复被付费。第二是更准:一个被 200 页无关内容淹没的模型,推理质量反而比只拿到正确两段的模型差——相关事实容易在”中间”被忽略掉,这是大模型著名的”中间迷失”现象。
Token Saver 用的叫”本地混合 RAG”(Local Hybrid RAG)。所谓混合,就是同时用两种检索:关键词匹配(BM25,跑在 SQLite 自带的 FTS5 上)负责精确术语;语义检索(余弦相似度,本地小模型 all-MiniLM-L6-v2)负责理解你问题的”意思”。两种方式在本地融合打分,服务器只挑出高度相关的段落交给 Claude,附上精确页码,还顺手给你一个”刚才省了多少 token”的累计统计。一个工具,又省钱又提准,这种好事不多见。

第四章 手把手装好它
别被”MCP 扩展”吓到,装起来就三步。第一步,把项目拉下来并装依赖:git clone https://github.com/Marktechpost/Token-Saver,进目录 pip install -r requirements.txt。第二步,打开 Claude Desktop 的配置文件(Windows 在 %APPDATA%\Claude\claude_desktop_config.json),在 mcpServers 里加一个块,command 指向你的 Python 解释器,args 指向 server.py,重启 Claude Desktop 即可。
第三步,一次性加个系统提示词(Settings → Custom Instructions):告诉 Claude “只要我给的是 PDF 路径,先调用 Token Saver 工具,只基于它返回的带页码片段回答”。搞定之后,你直接说”总结一下 C 盘下那份 report.pdf”,Claude 会自己调用本地检索,读的是精简后的文本,最后还跟你报一声省了多少 token。全程本地,数据不出机。
第五章 本地混合 RAG:两种搜索打配合
想用好它,得懂它背后那套八阶段流水线。文本先被 pypdfium2 抽出,切成约 180 词、重叠 40 词的段落;再用 BM25(权重 0.4)加语义模型(权重 0.6)混合打分;过一道门槛——没有关键词重叠的段落,语义相似度必须超过 0.25 才放行;去重、裁剪到只留直接答题的句子、把返回量封顶在 8000 字符,最后每段裹上文件名和精确页码再交给 Claude。
实测省钱幅度随文档变长而飙升:33 页 FDA 标签省 95.7%,88 页 GDPR 省 98.6%,233 页哈佛诉讼案省 99.4%。而且那个嵌入模型是可选的——万一加载失败,系统会自动降级成纯关键词匹配,官方说检索质量其实也不差。这种”降级不崩”的细节,是真正跑过生产的人才写得出来的。

第六章 省钱之外,它还有两个被低估的好处
第一,更准。只给模型正确的两三段,比塞它 200 页无关内容推理质量高得多,相关事实不再淹没在中间。尤其是小模型,被无关上下文淹没时幻觉更严重,Token Saver 等于帮你把噪声切掉了。
第二,隐私零泄露。文档从不离开你的机器,靠文件夹白名单 + stdio 本地通信,而不是走网络socket。对法务、医疗、财报这类敏感文档,这点比省钱还重要。另外它还有个隐藏优势:长文档的”中间迷失”问题被直接绕开,你问第 47 页的条款,它真就只去看第 47 页附近的片段。
第七章 一个被低估的趋势
Token Saver 不是一个孤例。它代表一个正在成型的方向:用本地 RAG + MCP,把”让 AI 读长文档”从烧钱黑洞变成便宜又准的日常操作。同样思路的项目还有 pdf-mcp(转 markdown 省 60%~72%)、mcp-pdf-tokensaver(布局感知、省 90%)等等,说明”别把整本文档喂给模型”已经成了共识。
对天天跟 PDF 打交道的知识工作者——律师、研究员、分析师、产品经理——这类本地 MCP 工具迟早是标配。2026 年用 AI 的正确姿势,不是拼命堆上下文窗口,而是把搜索和精简留在本地,只把对的片段交给模型。Token Saver 就是这套姿势里,最顺手的那把刀。
暂无评论内容