一个运行在桌面端的 AI 代理系统,目标是把你屏幕上的信息、交互与上下文,转化为可调用的智能能力。它以桌面应用为入口,结合多模型与工具执行,面向“浏览器自动化 + 语音/视觉理解 + 任务协作”的场景。
- 桌面端 AI 助手:面向日常办公、搜索、会议、信息整理
- 工具驱动:模型通过工具完成浏览器操作、截图、脚本执行
- 多模型接入:支持 Claude / Gemini / OpenAI / 本地 Ollama 等
- 可扩展架构:Electron 桌面端 + 工具服务 + 模型配置层
- Ask 对话:基于历史屏幕内容与上下文问答
- 浏览器自动化:通过 browser-use 工具执行网页搜索、滚动、提取
- 截图能力:独立 ScreenshotTool 支持视觉上下文采集
- 会议记录:实时要点、总结、会话记录(依赖 STT)
- Node.js 20.x
- Python 3
- Windows 需安装 Visual Studio Build Tools
npm run setupCtrl/Cmd + \\:显示/隐藏主窗口Ctrl/Cmd + Enter:基于历史屏幕与音频提问Ctrl/Cmd + Arrows:移动窗口位置
支持:
- OpenAI API(https://platform.openai.com/api-keys)
- Gemini API(https://aistudio.google.com/apikey)
- Claude / aihubmix
- 本地 Ollama + Whisper
src/features/ask/:Ask 对话与多轮工具调用流程src/features/common/ai/tools/:工具注册、执行与实现src/ui/:Electron 界面与渲染层src/python/:browser-use 服务端与自动化逻辑