我常驻的 AI 工具清单(都是开源或免费可用的)
只列我自己长期在用、能讲清适用边界的:本地推理、检索、评测、辅助开发,每类一个主力加一个备选。
被问过几次"该装哪些"。我倾向于少装:每类留一个主力、一个备选,剩下的用完卸载。下面这些是留在我机器上超过三个月的。
一、本地推理
| 用途 | 主力 | 备选 | 我的取舍理由 |
|---|---|---|---|
| 跑本地模型 | Ollama | llama.cpp | Ollama 装模型像 docker pull,改参数要写 Modelfile;llama.cpp 底层、参数全暴露、能压榨性能,但每次上手都要重新查 |
| 图形界面 | LM Studio | Open WebUI | 前者桌面端零配置,后者适合挂在服务器上多人访问 |
| 调本地接口 | 直接 curl | LiteLLM 代理 | 端点少时不引额外层;模型一多、需要统一 OpenAI 兼容格式时,代理层值得加 |
什么时候真的需要本地跑:数据敏感不能出机器、离线环境、或者只是要低成本反复跑批量任务。要最新最强能力的场景,本地模型是拿不到结果的,别为"不想用 API"这个理由硬折腾。
二、检索与向量
- pgvector — 我首选这个。已经跑着的 Postgres 上装一个扩展就够用,不用为向量再维护一套独立存储。十万级向量以内没有压力,超过这个规模再考虑专门的向量库。(部署记录在这篇实践里。)
- Chroma — 做原型最快,几行代码起一个本地向量库。生产环境我不太依赖它。
- Qdrant — 真要独立向量库时我会选它,资源占用适合小机器。
- bge 系列中文向量模型 — 中文语料上召回表现对我够用,本地能跑,不需要外部 API 服务。
- BM25(Postgres 自带 tsvector) — 别忽视。中文要配分词器(zhparser / pg_jieba),配好之后精确术语检索经常比向量更准,混合检索时它是那一路。
三、评测与观测
- 自己写的 200 行脚本 + 一份人工标注集(见这一篇)。我最终没用重型的评测框架,因为评测集格式一变,改框架的时间就超过了收益。
- Ragas — 想看 RAG 端到端指标(忠实度、相关性)时用它起量,但指标含义要自己读论文确认,不能当黑盒。
- 一个 git 管理的 CSV。最重要的评测基础设施不是工具,是"金标准数据集进了版本控制"这件事。
四、辅助开发
- 编辑器内的 AI 助手 — 补全和局部改写。跨文件一致性改动我不用它。
- 命令行 Agent 工具 — 边界清楚、可自动验证的任务交给它,前提是先配好测试和忽略文件。
- git 的
diff和status— 最被低估的两个 AI 协作工具。我每次让助手改完,第一件事都是看改动面。
五、学习与查阅
- 各模型的官方技术报告(不看二手解读)。
- 模型的 Hugging Face 模型卡片——尤其看 license 和 limitations 两段,很多坑在这里。
- arXiv 的 cs.CL / cs.LG 列表,配合"只看摘要 + 有开源代码才精读"的过滤规则。
- 一份自己维护的问题清单。攒够十几个真实问题再去看评测,比围观排行榜有效。
六、我删掉的几类东西
- 各种"提示词模板市场":拿来的模板不解决我的实际问题,反而会让我误以为问题在措辞上。
- 早期装过的一堆 Agent 编排框架:多数场景我自己写 200 行 Python 更可控,且能看懂报错。
- 需要把本地文档同步到云端才能用的笔记工具:数据出机器这件事,我要为它单独做一次评估,不想默认发生。
- 各类"AI 一键生成网站/文章":产物需要重做,等于没省时间。
七、选型时我固定问的四个问题
- 它能不能离线跑,或者至少能不能本地跑通全流程?
- 出问题的时候,我能看到底层吗(原始响应、错误堆栈、日志)?
- license 允许我的用法吗(尤其涉及模型权重和商业使用)?
- 如果它明天停止维护,我要花多久换掉?
第 3 条最容易忽略也最要命。不少开放权重的模型附的是受限协议,能不能用于商业产品要读原文。第 4 条决定我敢不敢把它放进核心链路。
内容标识:本文为本人使用记录,工具的能力描述以各官方仓库文档为准,我写的只是我自己的使用体感,不构成评测结论。
本文出处:http://honeysss.cn/post/open-source-ai-toolbox.html 转载请注明出处。