gemma-gem:Chrome 扩展本地运行 Gemma 4,还能操作网页
以前想用大模型,要么调 API,要么本地搭环境。调 API 得管密钥、算成本、担心数据上传;本地部署要装 Python、配显卡、啃文档。前端开发者想玩 AI,往往卡在第一步。
最近 GitHub 上有个项目:kessler/gemma-gem。它是个 Chrome 扩展,把 Google 最新发布的 Gemma 4 模型直接塞进浏览器,通过 WebGPU 在本地跑起来。不用 API Key,不用云端,数据完全不出设备。
关键是,它不只是个聊天窗口,还给了模型 6 个工具,让它能读网页、点按钮、填表单、跑 JavaScript。
一句话定位:一个完全本地运行的 AI 助手,能聊天,也能操作你正在看的网页。目前 GitHub Star 600 多,但值得关注。
开发者 Yaniv Kessler 是 Unity 员工,Google 4 月 2 日发布 Gemma 4,他一周内就把这个项目做出来了。
为什么浏览器能跑大模型
Gemma 4 是 Google 专门为边缘设备优化的系列。E2B 版本只有 2.3B 参数,量化后约 500MB,E4B 版本约 1.5GB。配合 WebGPU,浏览器第一次能以接近原生的速度跑起十亿参数级模型。
模型下载一次后缓存到本地,之后完全离线可用。没有 API 调用费用,也没有配额和速率限制。在隐私敏感的场景下特别友好,比如处理公司内部文档、个人笔记、敏感数据等,所有内容都只在你自己的机器上运行。
6 个浏览器工具
项目为模型内置了 6 个浏览器工具:
- 读取页面内容
- 页面截图
- 点击指定元素
- 在输入框输入文本
- 滚动页面
- 执行 JavaScript
使用时非常自然。你可以直接问它"这个页面有什么表单?",模型就会自动调用工具去读取页面并告诉你结果。你说"帮我把搜索框填上 XX",它就会找到对应的输入框并完成填写。
思考模式与模型切换
Gemma 4 原生支持思考模式,项目已完整集成。每次推理时,模型会先输出详细的思考过程(Chain of Thought),再给出最终答案。你可以清晰地看到它如何拆解任务、分析当前页面状态、决定调用哪个工具。
v0.2.0 版本新增 E2B 和 E4B 自由切换功能。E2B 模式轻量快速,适合简单任务;E4B 模式推理能力更强,适合处理复杂、多步的操作。切换结果会持久化保存,下次打开时依然保持上次选择的模式。
可复用的 Agent 循环
Agent 循环逻辑单独抽离在 agent/ 目录,完全零外部依赖。项目清晰定义了 ModelBackend 和 ToolExecutor 接口。如果你想在自己的项目中复用这套 Agent 循环,可以直接把整个 agent/ 目录拿走,稍作调整即可集成。
安装步骤
注意安装过程用到了 git、nodejs、npm、pnpm,还没有的朋友请先安装。
克隆代码:
git clone https://github.com/kessler/gemma-gem.git
安装依赖:
cd gemma-gem
pnpm install
构建扩展:
pnpm build
完成后,项目里会多一个 .output/chrome-mv3-dev/ 目录。打开 Chrome,地址栏输入 chrome://extensions,打开右上角"开发者模式",点左上角"加载已解压的扩展程序",选择 .output/chrome-mv3-dev/ 文件夹即可。
随便打开一个网页,右下角会出现一个宝石图标。点击它弹出聊天窗口。第一次使用会提示下载模型,E2B 约 500MB,图标上显示环形进度。下载完成后就可以直接聊天了。
限制说明
E2B 是 2.3B 参数的小模型,复杂推理能力有限。作者在 Hacker News 上也很坦诚:简单页面问题和跑 JavaScript 没问题,但多步工具链有时会失败,模型偶尔会忽略工具直接回答。
另外,WebGPU 需要 2020 年后的设备和最新 Chrome。Safari 不支持,移动端 Chrome 扩展也不支持。
适合的人群:隐私敏感用户、想零成本体验本地 AI 的开发者、需要在网页上做简单自动化的人。如果你只是想聊天,云端大模型体验更好;但如果你在意数据不出设备、在意零成本、在意离线可用,这个项目值得试一下。
项目地址:https://github.com/kessler/gemma-gem