Clicky:macOS 语音屏幕助手,AI 直接用光标指点操作,3.9K Star
以前学 Blender 最头疼的就是功能多到爆炸,想找个按钮就是翻不出来。翻官方文档密密麻麻找半天,看视频教程拖来拖去找细节,截个图发给 ChatGPT 等回完答案,切回 Blender 又忘了刚才说的位置在哪。就在软件和聊天窗口之间反复横跳,真想有个人直接在屏幕上给我指一下该点哪。
最近在 GitHub 刷到个项目叫 Clicky,获得 3.9K Star。它把截图、上传、等回复、切回应用这一套,直接压缩成按个快捷键、说话、听回复就行,还能让 AI 直接点屏幕上的按钮。
核心体验
Clicky 在 macOS 菜单栏,按下 Control + Option 就能激活。激活的瞬间,它会截图当前屏幕,然后你可以直接说话提问。它会通过语音回复你,还能让一个蓝色光标飞到屏幕上的某个位置,告诉你点这里。就像有一个老师坐在你旁边,看着你的屏幕,告诉你下一步该怎么做。
它不只是看屏幕,还能直接指着屏幕操作。回复的时候,可以嵌入一个类似 [POINT:x,y:label:screenN] 的标签,系统识别到后会用蓝色光标飞到屏幕的指定位置。以前你截图给 AI,它只会告诉你"点击右上角的导出按钮",你要自己找;现在直接让鼠标自己跑过去,你要做的只有跟着点。
新手学习像 DaVinci Resolve、Blender、After Effects 这种复杂软件,界面上按钮很多,有时候你知道功能在哪但就是找不到,有时候甚至不知道这个功能存不存在。有了光标指点,AI 不只是告诉你在哪,而是直接指给你看,比看视频教程省事——视频教程你得拖进度条,还得暂停、回放。
技术架构
背后用到三个服务:
- Claude:负责理解屏幕内容和用户问题
- AssemblyAI:做实时语音转文字
- ElevenLabs:把文字转成语音说出来
整个过程是流式的,延迟很低。你说话的同时,语音已经在转录;AI 回复的时候,语音也在同步生成。
隐私设计
很多人看到"能看屏幕"第一反应是隐私问题。Clicky 是这样设计的:只在按下快捷键时截图,不会被动监控你的屏幕。而且 API 密钥不是打包在应用里,而是存储在一个云端代理服务里,就算有人拿到你的应用文件,也拿不到你的密钥。
部署指南
注意 Clicky 用了 Cloudflare Worker 部署代理服务,但这个服务是国外的,国内访问可能不稳定。国内用户可以用腾讯云云函数替代,效果一样,访问更快。
准备工作:三个 API 密钥(Anthropic、AssemblyAI、ElevenLabs,官网注册即可,都有免费额度)、腾讯云账号、macOS 14.2+ 系统。
克隆代码:
git clone https://github.com/farzaa/clicky.git
用腾讯云部署云函数:打开腾讯云控制台,搜索"云函数",创建新函数,运行环境选 Node.js 18,代码把本地 worker 目录传上去,配置 ANTHROPIC_API_KEY、ASSEMBLYAI_API_KEY、ELEVENLABS_API_KEY 环境变量,再配置 API 网关触发器获取 HTTPS 地址。腾讯云每月 100 万次免费调用,个人使用足够。
用 Xcode 改配置运行:在代码里找到 Clicky.xcodeproj,用 Xcode 打开,把云函数的 HTTPS 地址填入代理地址位置,点击运行。首次启动需授权麦克风、屏幕录制、辅助功能权限。
同类对比
Clicky 不是第一个"能看屏幕的 AI"。Claude Desktop 有截图功能,Microsoft Copilot Vision 在 Windows 上做屏幕理解,Apple 也宣布 2026 年的 Siri 会有类似能力。但 Clicky 的独特之处在于:开源,你可以自己部署、修改、扩展;光标指点,不只是看,还能指;隐私优先,按需截图,不持续监控。
项目地址:https://github.com/farzaa/clicky