资讯 Wigolo:把搜索、抓取、爬取全部跑在本地,无 Key 无额度的 AI 网页能力工具

2026-08-26 15:10:35 views 13

Wigolo:把搜索、抓取、爬取全部跑在本地,无 Key 无额度的 AI 网页能力工具

之前我们介绍过 Firecrawl 这类云端网页抓取工具,用起来确实方便,但必须注册账号、获取 API Key。免费额度也有限——Firecrawl 每月送 1000 页,用得稍微勤快些就得精打细算,始终不能随心所欲。

最近发现了一个完全按另一条路走的工具:wigolo。它的搜索、抓取、爬取整套网页能力全部跑在本地电脑上,核心功能不需要 API Key,也不按次收费,没有额度限制。如果之前被 Firecrawl 的免费额度卡过,可以试试这个。

Wigolo 是什么?

简单说,wigolo 是专门给 AI Agent 提供网页能力的工具。它以 MCP Server 的形式接入 Claude Code、Cursor、Codex、Gemini CLI 等工具,Agent 需要上网时直接调用。不玩 MCP 也没关系,它同时提供 REST API 和 TypeScript、Python 的 SDK,自己写程序或接入 n8n 这类自动化工具都没问题。

相比之前的云端方案,wigolo 的核心优势是本地优先。缓存、向量模型、配置文件全部放在 ~/.wigolo/ 目录里,查询记录不离开自己的机器——除非你主动接一个外部模型来做报告汇总。

项目采用 AGPL 协议开源,目前由作者一人维护,处于公开 beta 阶段,背后有 7000 多个测试用例在跑。

它能做什么?

wigolo 内置 10 个小工具,覆盖各种场景:

搜索:一次并行查 18 个引擎,带来源和打分

search 工具背后接了 18 个公开搜索引擎,调用一次就并行查询,结果融合排序,再用本地模型重排一遍。可以把多个关键词组成数组一次传入,同时查出去——这是 Agent 自己一个个调工具做不到的。

返回的不是一串裸链接。每条结果都带有原文摘录,摘录标明它在源页面中的具体位置,另外还有引用 ID 和详细打分。哪条结果质量不行,评分器会直接标出来;哪个引擎这次没有响应,返回里也会写明。

抓取:普通请求读不动,就换浏览器

fetch 负责读取单个页面,内部做了多层降级:先发普通 HTTP 请求,遇到反爬验证或 SPA 空壳页面,自动升级为无头浏览器渲染。最终输出干净的 Markdown,附带元数据和链接。

此外,它能读 PDF,支持带登录态的会话,也可以在页面上点击、输入、滚动、截图。

有一个细节值得注意:遇到实在过不去的验证墙,它不会把验证页面当成正文返回,而是明确标记 blocked_by_challenge。拿到了什么、没拿到什么,输出里写得非常清楚。

爬取与结构化提取

crawl 是多页爬取,支持广度优先、深度优先、sitemap 三种模式。默认遵守 robots.txt,按域名限速,并过滤页面里的样板内容。

extract 负责从页面中抽结构化数据,表格、JSON-LD、文章或商品等常见格式可直接识别,也可以自定义 JSON Schema 让它照着抽取。

本地缓存:查过的内容都留在本地

所有查询结果会进入本地缓存,支持关键词和语义两种方式混合检索。相同问题再问一遍,立等可取,不花钱,断网时也能用。

找相似、做研究、自动跑流程

  • find_similar:给一个网址或概念,找出相似的页面,关键词、语义、实时网页三路结果合并。
  • research:把一个复杂问题拆成多个子问题,同时搜索,最后汇总成带引用的报告。
  • agent:更进一步,自己规划步骤,搜索、抓取、提取一步步完成,可以设置时间限制,跑完输出结果。

researchagent 需要接一个语言模型来写最终报告。不配也不影响其他功能,它们会把搜到的原始材料和证据直接交出来,让 Agent 自己组装。

页面监控:diff 与 watch

  • diff:列出页面与上次访问相比的变化。
  • watch:定期复查,有变化就往 webhook 推送。

盯文档更新、价格变动这类事情,直接交给它就行。

安装很简单

一行命令搞定:

npx wigolo init

它会自动下载浏览器引擎和本地模型,然后跑一遍健康检查,每个组件的状态都会列出来。要求是 Node 20 以上,磁盘预留约 1.5GB,支持 macOS、Linux、Windows。

安装时可以把常用的 Agent 一并接入,只需加一个参数:

npx wigolo init --agents=claude-code,cursor

装完后运行 npx wigolo doctor 检查状态,哪个组件有问题、对应的修复命令是什么,都会直接列出来。

核心的搜索、抓取功能到此就能用,不需要任何 Key。researchagent 这类需要写报告的功能,得配一个语言模型。官方支持多家服务,本地 Ollama 也可以直接用,完全不用依赖外部。

实际使用体验

查最新文档:以前 Agent 只能凭训练数据猜测,现在说一句话,它就去读官方文档,返回的内容带原文位置,答案可信度高很多。

盯项目更新日志:把 watch 挂上,有变化自动推送,不用每天手动刷。

接自动化流程:用 wigolo serve 启动本地 REST 服务,n8n 这类工具直接 curl 调用,不需要配置 MCP。

省钱:Agent 查信息很频繁,一个问题可能同时发出十几个查询,按量付费的服务用起来成本不低。wigolo 查询零成本,还有缓存。

几句实在话

需要预留至少 1.5GB 磁盘,主要是本地模型和浏览器引擎,这部分省不了。公共搜索引擎偶尔出问题也正常,不过 wigolo 融合了 18 个引擎,单个挂了影响不大。作为 beta 阶段的开源项目,跟成熟的付费服务比,某些复杂抓取场景还不够完善。

但作者放了一组实测对比:在同一场 Claude 会话里,内置 WebSearch、wigolo、Tavily、Exa 四个工具跑同一个问题,结论一致,头号信源也一致,而 wigolo 是唯一返回带字节级定位证据的,打分和引擎状态全部透明展示。爬取能力反而是它的强项,这些能力在付费服务里都是按次收费的,这里免费。

本地工具,不要 Key,不要账号,数据不出机器,AGPL 开源协议也不用担心哪天突然收费。这个项目确实值得一试。

开源地址:https://github.com/KnockOutEZ/wigolo

复制全文 生成海报 AI Agent 网页抓取 本地优先 开源

推荐文章

程序员茄子在线接单