FEATURED · 精选文章

如何复现wigolo基准测试:与WebSearch、Tavily、Exa四方对比实验

发布时间 / 2026/9/16 13:55:26
来源 / 创域科博编辑部
栏目 / 资讯中心
如何复现wigolo基准测试:与WebSearch、Tavily、Exa四方对比实验 如何复现wigolo基准测试与WebSearch、Tavily、Exa四方对比实验【免费下载链接】wigoloThe go-to web for your AI coding agent — local-first search, fetch, crawl research over MCP. No API keys, no cloud, $0/query. Public beta.项目地址: https://gitcode.com/GitHub_Trending/wi/wigolo想亲眼验证本地搜索工具真的能打吗这篇文章带你完整复现wigolo 基准测试——它是专为 AI 编程代理打造的本地优先 Web 智能工具提供搜索、抓取、爬取与深度研究全程无需 API Key、不上传云端、每查询成本 $0。我们还将复现它与内置 WebSearch、Tavily、Exa 的四方对比实验看清证据质量差距。为什么值得自己跑一遍基准测试官方对比实验的结论是四个工具在同一个冷启动查询上收敛到了相同的核心答案但只有 wigolo 同时交出了逐字引用、按字节定位的原文证据并附带可解释的评分分解与实时引擎遥测。官方功能对照表截至 2026 年 7 月能力wigoloFirecrawlExaTavily多引擎网页搜索✅✅✅✅抓取与结构化提取✅✅✅✅整站爬取与映射✅✅—✅按字节定位的逐字原文证据✅———可解释的单条结果评分分解✅———本地持久缓存——离线秒级重查✅———需要 API Key / 账号无需要需要需要单次查询成本$0计费计费计费最后一行对 Agent 场景尤其重要Agent 是爆发式提问的云端计费会持续累积而本地缓存让重复提问瞬间完成。一键安装跑基准测试前的准备工作环境要求清单Node.js ≥ 20约1.5 GB磁盘空间用于浏览器引擎与本地模型macOS / Linux / Windows 均可最快配置方法git clone https://gitcode.com/GitHub_Trending/wi/wigolo cd wigolo npm install npx wigolo init # 下载浏览器引擎 本地模型并做健康检查 npx wigolo doctor # 随时自检搜索、抓取、爬取、提取、缓存、相似查找全部零 Key 可用只有research/agent的合成答案才需要 LLM可免费用 Gemini或完全本地走 Ollama。更多安装渠道Docker、Homebrew、单文件二进制见 docs/installation.md。基准测试套件全解四个可复现的测试轨wigolo 的基准代码全部开源在 benchmarks/ 目录package.json里预置了四个 npm 脚本脚本测什么核心指标npm run bench:search搜索排序质量PrecisionK、MRR、nDCG、延迟npm run bench:agent端到端任务完成度事实准确率、引用准确率、完整性、延迟npm run bench:extraction页面正文提取质量对 21 个黄金标注样本打分npm run bench:embedding本地向量化质量嵌入质量RUN_FASTEMBED1搜索基准离线可复现的排序实验这是最适合新手上手的一轨完全离线——它用预录制响应喂给一个模拟引擎逐条查询计算排序指标npm run bench:search实验由三部分组成查询集benchmarks/search/fixtures/queries.json按docs / error / conceptual / code等类别组织的真实查询如 playwright page.goto options人工相关性判定benchmarks/search/fixtures/relevance.json每个 URL 打了 0–3 分的相关性等级指标计算benchmarks/search/metrics.ts 实现 PrecisionK、MRR、nDCG主流程在 benchmarks/search/runner.ts最终输出 JSON Markdown 双格式报告Agent 基准像真实用户一样出题benchmarks/agent/fixtures/tasks.json 内置了 5 类任务事实查找、多步研究、数据提取、对比、代码文档例如fact-lookup找到最新 TypeScript 版本及其关键特性期望命中 typescriptlang.orgmulti-step-research对比 Playwright 与 Puppeteer 用于网页抓取最多 6 步评估规则写在 benchmarks/agent/fixtures/expected.json——每个任务列出一组应找到的事实区分 required 与可选benchmarks/agent/evaluator.ts 会在代理收集到的内容中做规范化匹配汇总出事实准确率、引用准确率与完整性。执行与汇总逻辑见 benchmarks/agent/runner.ts。npm run bench:agent提取与嵌入基准提取基准跑在 21 个黄金标注样本上文章、文档、GitHub 页面、表格、SPA 空壳…见 benchmarks/extraction/npm run bench:extraction嵌入基准用RUN_FASTEMBED1 npm run bench:embedding实测本地向量化质量复现官方四方对比实验的方法论README 中的对比实验设计值得借鉴核心思路是同题同判同一个冷查询在同一个 LLM 会话内并行扇出给四个工具内置 WebSearch、wigolo、Tavily、Exa条件完全对等由 Agent 仅凭返回的证据打分不靠主观印象——四个工具最终收敛到同一答案、同一头部来源证明基础能力持平差异出现在证据形态wigolo 独有一份份钉死在原文字节偏移上的逐字摘录 可解释评分 逐引擎遥测且自己的评分器把两条弱结果直接标记为 junkExa 也有亮点——完整渲染了官方文档的对比矩阵你可以照搬这套设计挑一个自己关心的技术问题让代理同时调用这四个工具对比答案是否一致与证据是否可溯源。完整查询入口在 docs/tools.md现成可运行的示例在 examples/。结果解读与已知坑报告输出每轨在各自output/目录生成.json机器可读.md人可读两份报告对比版本迭代时直接 diff 即可基线存档benchmarks/baselines/ 保存了 v1 之前的基线_skip-reasons.md 如实记录了哪些基线因沙箱限制跳过、为何跳过——这种诚实输出正是项目设计哲学的延伸网络敏感度搜索/提取基准走预录制数据稳定可复现Agent 基准调用真实搜索与抓取跨日数字会有波动对比时建议固定同一时段数据隐私所有缓存、嵌入、模型都留在~/.wigolo/跑基准测试不会把查询发给任何第三方总结三步完成一次可信的对比实验npx wigolo init一键装好本地引擎npm run bench:search跑离线排序基准得到 MRR / nDCG 报告用同题同判法把 wigolo 与 WebSearch、Tavily、Exa 放在一个查询下对比证据质量你会发现答案趋同是基础可溯源的证据才是分水岭——而这正是 wigolo 以 $0 成本给出的东西。【免费下载链接】wigoloThe go-to web for your AI coding agent — local-first search, fetch, crawl research over MCP. No API keys, no cloud, $0/query. Public beta.项目地址: https://gitcode.com/GitHub_Trending/wi/wigolo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻