AutoMind 使用手册

会自己动手干活的 AI 智能体平台 — 零基础入门 · 功能深度解读 · 场景指南
版本 v1.6.3 🏷 社区版 / 专业版 / 企业版 🖥 本地运行 · 数据不上传 🛡 全程审批与审计 🧠 10+ 模型提供商
🏷 版本体系 — 开源部分为社区版(MIT 免费):对话/工作/编程三模式与全部工具、技能、MCP、记忆、安全能力。 🤝 协同、🔁 循环、⏰ 定时任务、📊 高级统计、⭐ 自定义模板、📄 审计导出 PDF专业版👥 多用户会话池、🔐 SSO/LDAP、🧩 RBAC 权限、🚪 私有模型网关企业版 — 由商业扩展包 automind-pro 提供,配置许可证(AUTOMIND_LICENSE)后自动激活; 社区版对应入口显示 🔒。安全能力(鉴权/限流/脱敏/审计)不设付费墙。详见 docs/EDITIONS.md
🖥 v1.2 桌面版 — Windows 安装包双击即用:独立窗口(WebView2)+ 系统托盘 + 内嵌服务,无需 Python 环境与命令行; 关窗最小化到托盘,任务与定时任务继续运行;数据存放于 %APPDATA%\AutoMind(托盘菜单一键打开)。 自行构建见仓库 desktop/README.md
🎉 v1.0 正式版四大升级🖥 界面全面重构(React 18 + TypeScript + Ant Design,全部功能与操作位置不变)· 📚 RAG 知识库(上传 PDF/Word/MD/TXT,对话自动检索引用;社区版 5 文档/10MB, 专业版无限文档/200MB/多库/Reranker/引用溯源,企业版混合检索/热度统计/检索审计/批量导入)· ⚡ 语义缓存 + 🧭 模型智能路由(专业版:相似问题秒回 + 2 级路由;企业版:高级缓存 + N 级路由 + 💰 成本仪表盘)· 📏 版本限额(社区版每日任务 100 次 / 工作区 3 个;专业版任务不限 / 工作区 30 个;企业版全部不限)。
🏢 v0.8 商业功能扩容 — 专业版新增 ⭐ 自定义模板📄 审计报告导出 PDF; 企业版新增 🔐 SSO/LDAP 单点登录🧩 细粒度权限 RBAC🚪 私有模型网关。 社区版功能不减,对应入口显示 🔒。
🚀 v0.9 三大能力📄 代码编辑器(右栏「代码」标签:文件树 + Monaco 编辑器 + Diff 预览,浏览器直接改代码,Ctrl+S 保存可撤销)· 👥 团队协作(任务分配看板 + 同事 Agent 改文件实时通知;工作区/模板/专家服务器级共享)· 🎓 专家市场(官方精选 10 个一键安装、自建专家、激活后所有任务带角色设定执行; 专业版无限创建/分享/导入导出/统计,企业版审批发布)。
✨ v0.7 体验升级🌓 浅色模式(右上角随时切换)· 🗂 工作区(多目录多上下文,任务互不污染)· 📚 模板库(内置 10 个基础模板一键开跑)· 🧭 新手引导(首次自动弹出,❓ 重看)· 💰 实时成本(Token 花费估算,可自定义单价)· 📜 历史回溯(持久化 + 查看/复制/重跑)· ▶ 中断续跑(从断点继续省 Token)· ↩️ 撤销回滚(Agent 改过的文件一键恢复)· 🔌 Agent 集成(OpenAI 兼容接口 + Continue.dev 一键配置,见左下角「⚙ 设置」菜单 → 集成)。

01产品简介

普通 AI 聊天工具只能"说";AutoMind 除了聊天,还能真正在你的电脑上执行操作: 创建文件、修改代码、运行命令、抓取网页、生成报告——并且做每件事之前先自己规划步骤, 做完自己检查结果,出错自己纠正重试

🧭
先规划再动手

大任务自动拆解为目标树,按依赖顺序逐步执行,每步验证效果

🛡️
安全可控

每次工具调用经风险评估与审批门控,高危操作必须你亲自批准

🔄
自我纠错

失败时自动分析错误、生成修正方案重试,必要时回溯调整计划

🔌
模型自由

OpenAI / Claude / DeepSeek / Kimi / 通义 / 智谱 / 豆包 / Ollama / 中转代理

🧩
三套扩展体系

技能 Skill · MCP 服务器 · 生命周期插件,随需接入你的专属能力

🏠
本地私有

配置、聊天记录、API Key 全部保存在你自己的电脑,绝不上传

它能帮你做什么?

你想做的事AutoMind 怎么帮你
问问题、写文案、翻译💬 对话模式,像聊天软件一样直接问
「帮我建一个 Python 项目」⚙️ 工作模式:自动建目录、写配置、装依赖
「修复 main.py 里的 bug」💻 编程模式:读代码 → 分析 → 改代码 → 验证
「写一份行业调研报告」🤝 协同模式:研究员 + 编写员 + 审阅员多角色协作
「持续优化代码直到测试全过」🔁 循环模式:反复"执行→检查→改进"直到达标
「每天 9 点汇总昨日日志」⏰ 定时任务:后台自动执行并记录结果

02快速上手(零基础五分钟)

1
安装

命令行执行
pip install "automind-agent[web]"

2
启动

python -m automind.server
浏览器打开 localhost:8765

3
配置模型

左下角「⚙ 设置 → API Keys」填 Key,
点「🔌 测试连接」变绿即成功

4
第一个任务

切「⚙️ 工作」模式,输入任务,
看它实时规划并执行

前提:电脑已安装 Python 3.11+(命令行输入 python --version 查看)。 服务器部署可直接 docker compose up --build

三种安装方式

方式命令适合
PyPI(推荐)pip install "automind-agent[web]";升级:pip install -U "automind-agent[web]"直接使用
GitHub 源码git clone https://github.com/yl13571844594-arch/AutoMind.gitcd AutoMindpip install -e ".[web]"改代码 / 参与贡献
本地源码目录在软件目录执行 pip install -e ".[web]"压缩包 / 网盘分发
[web] 含 Web 工作台依赖;想用 Claude / Gemini 官方 SDK 等全部后端换成 [full]。 国内提速:命令末尾加 -i https://pypi.tuna.tsinghua.edu.cn/simple

三种启动方式

方式操作适合
Windows 一键双击 launch.bat,选 [2] 自动打开浏览器最简单
命令行python -m automind.server --port 8765 → 浏览器打开 http://localhost:8765通用
Dockerdocker compose up --build服务器部署
没有任何 API Key?两个零成本方案: ① 本地 Ollama——安装后 ollama run llama3.2,无需 Key; ② 中转代理——API Keys 面板底部「自定义 OpenAI 标准接口」填入代理的 api_base、模型名和 Key。

试一试:第一个任务

# 模式切到「⚙️ 工作」,输入框输入:
在当前目录创建 hello.txt,内容为 Hello AutoMind

执行时:聊天区出现「⚙️ 执行过程」实时轨迹(计划生成 → 逐步执行 → 完成), 右侧「📋 执行计划」同步刷新每步状态(○ 待执行 → ◐ 执行中 → ✓ 完成), 完成后项目目录里 hello.txt 真实存在。

03界面总览

⬢ AutoMind 工作区 💬 对话工作台 📋 计划视图 🔧 工具面板 系统 📈 观测中心 📊 统计分析 ⏰ 定时任务 📜 任务历史 🛡️ 安全审计 💬对话 ⚙️工作 💻编程 🤝协同 🔁循环 ⚡ 自动 ▾ deepseek/chat ● 📚模板 ❓引导 🔄新会话 👋 欢迎使用 AutoMind 通用自动化 Agent 顶部可切换五种模式… 创建一个 FastAPI 项目,带健康检查 ⚙️ 执行过程 🧠 规划:拆解为 4 个步骤… 🔧 terminal → mkdir fastapi-demo ✓ 🔧 file_write → main.py ✓ ◐ 正在执行:pip install fastapi… 📎 🎤 输入消息,Enter 发送,Shift+Enter 换行… 📊 实时状态 步骤3 Tokens2,418 🪙 Token 用量 📋 执行计划 ✓ 创建项目目录 ✓ 编写 main.py ◐ 安装依赖 ○ 运行验证 🌐 HTML 预览 report.html → 🛡️ 审计概览 terminal allow file_write allow ① 侧边栏 ② 模式 + 审批 + 状态 ③ 观测面板
图 3-1 · 界面三区布局:① 侧边栏导航 ② 顶部控制 + 聊天工作区 ③ 右侧实时观测面板

键盘快捷键v1.4 起为完整快捷键系统

macOS 上把下表的 Ctrl 读作 。应用内按 ? 可随时调出这张表(侧栏「⚙ 设置 → ⌨ 键盘快捷键」也能打开), 内容与实际生效的按键同源,不会出现"文档写了却按不动"。

快捷键功能
Enter / Shift+Enter发送 / 换行
EscCtrl + .停止当前任务;有弹窗时先关弹窗
Ctrl + NCtrl + L新会话(清空当前模式对话,会二次确认)
Ctrl + K打开模板库
Ctrl + ,打开通用设置
Ctrl + Shift + W切换工作区
Ctrl + /光标定位到输入框
Ctrl + Shift + L切换深色 / 浅色主题
Ctrl + = / Ctrl + - / Ctrl + 0增大 / 减小 / 复位字号
?显示快捷键帮助
Ctrl + 1 ~ Ctrl + 3切换模式:对话 / 工作 / 编程
Alt + 1 ~ Alt + 4切换视图:对话工作台 / 计划 / 工具 / 历史
带修饰键的组合在输入框里照常生效,不会打断打字;? 这类单字符快捷键只在非输入状态生效,否则你就打不出问号了。中文输入法组词过程中不会被抢键。

界面偏好(字号 / 通知 / 动效)v1.4 新增

在「⚙ 设置 → ⚙ 通用设置 → 🎨 界面偏好」里,三项都是本机生效、立即生效、自动记住, 不改变任何功能,也不会同步到别的机器。

项目说明
字号85% ~ 130% 无级调节,界面整体等比缩放(含 antd 组件)。也可用 Ctrl + = / Ctrl + - / Ctrl + 0
任务完成通知任务跑完发系统通知,只在窗口不可见时提醒; 点通知直接跳回应用。解决"发个 5 分钟的任务切走干别的,回来才发现早跑完了"
减少动效关闭淡入等动画,老机器上更跟手;系统级「减少动态效果」也会被自动尊重
关于通知权限:首次勾选时浏览器/系统会询问授权,必须允许才会收到提醒。 若曾误点"拒绝",需先到浏览器或系统的通知设置里放行 AutoMind,再回来重新勾选。桌面版直接使用系统通知中心。
会话隔离:五种模式的聊天内容互相独立,切换模式不丢各自记录; 每个浏览器也持有独立会话 ID,多人共用一台服务互不可见。

04五种交互模式深度解读

模式决定了 AutoMind「怎么思考、要不要动手、如何收尾」。选对模式,事半功倍。

💬 对话模式 —— "问答专家"

原理:纯多轮对话直连大模型,不调用任何工具,响应最快。支持图片输入(需视觉模型如 gpt-4o / qwen-vl)。

知识问答文案 / 翻译 / 润色头脑风暴看图提问 / 读报错截图
不适合:需要操作文件/命令的任务——它在此模式下没有"手",请切工作或编程模式。

⚙️ 工作模式 —— "项目经理 + 执行团队"(Plan-and-Execute)

① 分层规划 任务拆成目标树 ② 依赖排序 先建目录再写文件 ③ 逐步执行 工具调用过审批门控 ④ 符号验证 校验预期效果 ⑤ 纠错 / 回溯 失败自动修正重试 修正后重新执行该步
图 4-1 · 工作模式五步流水线
「初始化一个 FastAPI 项目,带健康检查和 Dockerfile」 「合并目录下所有 CSV 并生成汇总图表」多步骤有依赖的自动化
建议:任务描述越具体(目标目录、技术栈、验收标准),规划质量越高。 执行时盯右栏「📋 执行计划」树与聊天区「⚙️ 执行过程」轨迹即可看懂它"在想什么"。

💻 编程模式 —— "结对程序员"(ReAct 循环)

🧠 思考 下一步该做什么? 🔧 行动 读文件 / 改代码 / 跑命令 👁 观察 结果如何? 带着观察结果进入下一轮,直到判断任务完成
图 4-2 · ReAct 思考-行动-观察循环

与工作模式的区别:不预先定死计划,边做边调整——更适合"看了代码才知道下一步"的探索性任务。 思考(蓝卡)与工具调用(绿卡)全程流式展示。

「找出 main.py 启动报错的原因并修好」补类型注解 / 写测试 / 重构 代码审查
建议:先在「⚙ 设置」把项目目录指到代码仓库根——它读写以此为根,且受路径防护约束不会越界。

🤝 协同模式 —— "多角色专家组"(多智能体编排) 🔒 专业版

原理:任务分派给多个角色(规划者 / 研究员 / 编程者 / 审阅者), 各自基于共享白板完成子任务并互相看得到彼此成果,最后综合产出。

「调研三个向量数据库优劣并给选型建议」 「设计签到系统:方案 + 骨架 + 风险评估」需要多视角的复杂长任务

🔁 循环模式 —— "不达目标不罢休"(Loop Engineering) 🔒 专业版

原理:执行 → 判定"目标达成了吗" → 未达成则带着反馈继续下一轮。内置四重停止条件防死循环:

① 语义完成 模型判定任务已达标 ② 输出收敛 连续两轮相似度 > 0.95 ③ 连续空转 两轮无任何实际操作 ④ 最大轮数 兜底上限
图 4-3 · 循环模式四重停止条件
「优化到基准测试 <100ms」「修到测试全部通过」 「压缩到 500 字且保留要点」
关键技巧:任务里写清验收标准("直到测试全过"),判定器才有明确依据。可随时 ■ 中断。

模式选择决策

只是想问 / 写点东西?       → 💬 对话
让它替我做一件多步骤的事?  → ⚙️ 工作
围绕代码读改测?           → 💻 编程
复杂问题要多角度方案?      → 🤝 协同(专业版)
有明确标准要迭代到达标?    → 🔁 循环(专业版)

05工具审批与安全体系

每次工具调用都被安全体系拦截评估——你可以精确控制"它能做什么"。

工具调用请求 terminal / file_write… 风险评估 权限等级 + 动态风险分 命令预检 / 路径检查 审批门控 deny > ask > allow 按当前审批模式 放行执行 ✓ 弹窗请你批准 直接拒绝 ✗ 🛡️ 全部 记入审计
图 5-1 · 工具调用安全流水线:评估 → 门控 → 审计

三种审批模式(顶部下拉切换)

模式行为适合场景
🙋 询问除只读操作外,每次工具调用都弹窗请你批准首次使用 / 重要项目 / 想完全掌控
自动(默认)低风险自动放行;风险分 ≥60 的敏感操作与所有高危操作需确认日常使用最佳平衡
全批准跳过所有审批,完全自主运行沙箱环境批量任务;慎用

权限分级

等级示例处理
safe 安全读文件、列目录、git status直接放行
sensitive 敏感写文件、装依赖、git commit按审批模式处理
dangerous 高危rm -rf、sudo、强制推送必须人工批准
三重硬防护(独立于审批模式,始终生效):命令注入拦截 —— rm -rf /、fork bomb、写磁盘设备等灾难命令直接拒绝; ② 路径防护 —— 文件读写限定在项目目录内,../ 越界直接拒绝; ③ Python 沙箱 —— 代码执行仅允许白名单模块,禁止 os / subprocess。

事后追责:侧边栏「🛡️ 安全审计」记录每次调用的时间、工具、参数、决策、风险分与原因, 并汇总放行 / 询问 / 拒绝 / 高危次数。

06模型配置详解

支持的提供商(左下角 ⚙ 设置 → 🔑 API Keys)

OpenAI

gpt-4o · platform.openai.com

Anthropic Claude

claude-sonnet · console.anthropic.com

DeepSeek

deepseek-chat · 性价比之选

Kimi (Moonshot)

moonshot-v1 · platform.moonshot.cn

百炼 (通义 Qwen)

qwen-max · dashscope.aliyun.com

智谱 GLM

glm-4 · open.bigmodel.cn

豆包 Doubao

volcengine.com

Gemini / Grok

ai.google.dev · x.ai

Ollama 本地 🆓

llama3.2 · 无需 Key,本机 ollama serve

自定义中转代理:API Keys 面板底部填 api_base (如 https://api.your-proxy.com/v1)+ 默认模型 + Key, 即可对接任何 OpenAI 兼容 /v1/chat/completions 服务。 Key 只保存在本地 .automind_config.json;也支持环境变量 (OPENAI_API_KEYDEEPSEEK_API_KEY 等)。

省钱与提效:各模式专用模型

设置菜单的「🖥 模型配置」面板可为五种模式分别指定不同模型—— 对话用便宜快的 deepseek-chat,编程用强力的 claude-sonnet, 实现成本 / 能力的精准分配。未指定的模式沿用全局默认。

通用设置(左下角 ⚙ 设置 → 通用设置)

设置项说明建议
项目目录Agent 一切文件操作的根(带可视化目录浏览器)为不同项目切换对应目录,准确又安全
Temperature0–2,越低越严谨、越高越发散代码 0–0.3;创意 0.7+
最大输出 Token单次回复长度上限默认即可,长文档任务调大
排障利器「🔌 测试连接」:逐阶段验证 解析 → 连接 → 认证 → 响应, 精确告诉你 Key 失效、api_base 写错还是网络不通。

07工具面板:工具 / 技能 / MCP / 插件

侧边栏「🔧 工具面板」四个分段,对应 AutoMind 的四类可扩展能力。

AutoMind Agent 核心 🔧 工具 终端·文件·沙箱·浏览器 ✨ 技能 内置12个 + SKILL.md + .py 🔌 MCP 外部工具生态接入 🧩 插件 生命周期钩子扩展
图 7-1 · 四类能力围绕 Agent 核心:工具是"手",技能是"专家流程",MCP 接生态,插件挂钩子

🔧 工具 —— Agent 的"手"

工具等级功能
terminal敏感执行命令行(装依赖、跑脚本、git)
file_read安全读取文件内容
file_write敏感创建 / 覆盖文件
file_edit敏感精确字符串替换编辑(带 diff 与回滚)
python_sandbox敏感沙箱执行 Python 片段(计算 / 数据处理)
web_fetch安全抓网页提取正文与链接
browser敏感Playwright 浏览器自动化
screenshot_tool / ocr_tool敏感截屏 / 图片文字识别
ppt_tool敏感PowerPoint 生成 / 读取 / 追加
git_tool敏感结构化 git 操作(含危险门控)
image_tool / chart_tool敏感图像缩放裁剪水印 / 数据图表
csv_tool敏感CSV 与 JSON 读写转换合并
clipboard_tool敏感读写系统剪贴板
audio_tool / video_tool安全/敏感音频信息 / 视频信息与抽帧
process_tool敏感进程列表 / 端口占用 / 结束进程
开关用法:每个工具卡片带开关,关掉后 Agent 就"看不到"它。 不想让它上网 → 关 web_fetchbrowser;只读分析 → 只留 file_read

✨ 技能 —— 预制的"专家流程"

内置技能功能典型指令
project_init项目脚手架(目录/pyproject/venv/git)「初始化一个新项目」
code_generator代码生成 / 补全 / 脚手架,带语法校验与自动修复「生成一个爬虫脚本」
test_runner发现并运行测试、收集失败「跑一下测试」
log_analyzer日志级别统计 / 错误样本 / 高频模式聚类「分析这个日志文件」
doc_generator从 Python 源码生成 Markdown API 文档「给 src 生成 API 文档」
dep_audit依赖审计:未固定版本 / 重复声明「检查依赖健康度」
excel_report表格数据汇总成 Markdown 报告「把这张表做成周报」
web_research多来源搜索 + 抓正文,带引用调研报告「调研这个话题」
data_insight描述性统计 + 相关性,输出关键发现「这组数据有什么规律」
doc_batch批量合并 / 提取文本 / 重命名 Word、PDF「把 PDF 合成一个」
article_writer公众号 / 小红书 / 新闻稿风格写作「写一篇种草笔记」
env_doctor环境诊断:依赖 / 端口 / 磁盘体检「为什么跑不起来」

导入自定义技能:「📁 加载目录」批量导入 SKILL.md 技能包(YAML 头 + 指令正文,无代码); 「📄 导入 .py」导入继承 AbstractSkill 的 Python 技能(模板见 examples/03-skill-development/); 「⬇️ 一键导入桌面 skills 文件夹」直接吸收技能库。

🔌 MCP —— 连接外部工具生态

MCP(Model Context Protocol)是开放协议,接入后外部服务的工具自动出现在工具列表供 Agent 调用(文件系统、数据库、搜索、地图…)。支持单个添加(stdio 本地命令 / sse URL) 或直接粘贴 Claude Desktop 格式的 {"mcpServers": {...}} 批量导入。需先 pip install mcp

⭐ 官方适配(一键添加):内置 GitHub、PostgreSQL、MySQL、Slack、飞书、钉钉、 Playwright 浏览器 7 个预设,点「添加」即写入配置并连接;需密钥的服务会提示在系统 环境变量里设置(如 GITHUB_PERSONAL_ACCESS_TOKENDATABASE_URL)。

🧩 插件 —— 生命周期钩子扩展

插件在任务开始 / 结束 / 解析后 / 计划后 / 出错等时机自动执行你的逻辑 (记日志、发通知、审计上报),不改动主程序。面板中「加载 / 卸载」即时生效。

内置 4 个插件(随包分发、默认自动加载,面板以「内置 / 自定义」区分): cost_tracker(Token/耗时入账 CSV)、pii_guard(敏感信息检测告警)、 task_notify(任务完成通知,可选 AUTOMIND_NOTIFY_WEBHOOK)、 hello_hooks(示例模板)。

# 插件目录结构
~/.automind/plugins/task-timer/
├── plugin.json     # {"name":"task-timer","version":"1.0.0","description":"…"}
└── hooks.py        # def get_hooks() -> AgentHooks
安全设计:插件内部异常会被系统吞掉,永远不会影响任务主流程。 完整示例见 examples/04-plugin-development/

08高级功能

🔄 自主任务闭环(v0.3 新增,默认开启)

工作 / 编程模式任务完成后自动执行"质检流水线",不合格自动返工—— 把"AI 说做完了"变成"验证过真的做完了"。

任务执行完成 工作 / 编程模式 🧪 TDD 测试 自动跑 pytest(编程) 🧐 多Agent审查 审阅者复核(工作) ✅ Loop 验收 语义判定是否完成 🔧 自动修复 带反馈返工 ≤2 轮 修复后重新验收
图 8-1 · 自主任务闭环流水线(各环节可在设置中单独开关)
开关(⚙ 设置 → 通用)作用何时关闭
🧐 多Agent审查工作模式完成后审阅者角色复核,可调用只读工具核实(MCP 工具共享)追求极致速度 / 省 Token
✅ Loop 验收语义验收 + 未过带反馈自动修复(≤2 轮)简单任务不需返工
🧪 TDD 测试编程模式改 .py 即时语法验证;收尾自动跑 pytest项目测试极慢时
⚡ 并行执行计划中互不依赖的步骤 asyncio.gather 并发步骤有隐式资源冲突时
📦 子任务缓存同任务内相同只读调用结果复用需每次强制重读时
编程模式 TDD 内环:每次写入/编辑 .py 后系统立即语法检查, 把 syntax_check: OK / FAILED 注入模型观察——有错它下一步就看到并立刻修复, 形成 编辑 → 验证 → 修复 闭环。另有 code_generate 工具 (语言检测、语法校验 + 自动修复、mode='complete' 代码补全)。
安全边界:并行只发生在互不依赖的步骤间;缓存只作用于 SAFE 级只读工具 (写文件、执行命令永远真实执行);审阅者只能调用只读工具。
定时任务 🔒 专业版

任务内容 + 模式(五种均可)+ 间隔(每5分钟 / 每小时 / 每6小时 / 每天)。 后台调度、结果入历史、重启自动恢复。

场景:每天汇总日志错误、每小时抓数据追加 CSV、每 6 小时跑测试。

📊
统计分析仪表盘 🔒 高级部分为专业版

四个命中率圆环(工具/计划/任务/自我修正 + 综合平均)、上下文使用率发光条、 最近 50 次趋势折线、Token 效率、记忆系统指标。

用途:评估模型效果、监控 Token 花销、发现异常任务。

🌐
HTML 预览

Agent 生成的 HTML(报告/图表/页面)出现在右栏列表,点击即在弹窗内直接渲染,免去手动找文件。

📎🎤
多模态输入

对话模式上传图片(可多张)配视觉模型看图问答;🎤 语音实时转文字输入(Web Speech API)。

👥
多用户会话隔离

每个浏览器独立会话 ID:团队共用一台服务,聊天记录互不可见、互不清除。

📚
RAG 知识库 v1.0 · 社区版起

侧边栏「📚 知识库」上传 PDF/Word/MD/TXT → 自动分段 + embedding → 对话时自动检索你的资料作答(可开关)。 社区版 5 文档/10MB;专业版无限文档/200MB/多库/Reranker/引用溯源/定时重嵌入/外部向量后端; 企业版混合检索(向量+词法)/热度统计/检索审计/目录批量导入、总量不限。

语义缓存 🔒 专业版

对话模式相似问题秒回历史答案(0 Token)。专业版基础缓存(300 条/24h), 企业版高级缓存(2000 条/7 天 + 命中率与节省统计)。「🧭 路由与成本」视图可调阈值/清空。

🧭
模型智能路由 🔒 专业版

按任务复杂度(长度/代码特征/多步骤,0~100 打分)自动分级选模型:简单问答走便宜小模型、复杂任务走强模型。 专业版 2 级路由,企业版 N 级 + 💰 成本仪表盘(按模型/日聚合成本 + 缓存节省)。

📈
观测中心 v1.3 · 社区版起

侧边栏「📈 观测中心」把 Agent 的执行过程画成实时更新的 DAG:任务 → 计划步骤 → 工具调用三层, 六种状态配色(待执行/执行中/成功/失败/回溯/已中断),点节点看耗时与失败原因。 社区版可看当前任务的实时 DAG(只读、仅当前任务); 专业版加实时看板(成功率 / P50·P95 耗时 / 工具热度 / 失败归因)、200 次运行历史回看与 JSON 导出; 企业版历史扩到 2000 次并按会话维度分组。全程本机内存构建,不额外消耗 Token。

📏
版本限额 v1.0

社区版每日任务 100 次、工作区 3 个;专业版任务不限、工作区 30 个;企业版全部不限。 顶栏 📅 徽标实时显示当日用量,超限给出友好升级提示(跨天自动清零)。

输出便捷操作

每条 AI 消息悬浮「⧉ 复制」;每个代码块带语言标签和独立复制按钮。

09命令行与 REPL

不开浏览器也能用。安装后命令行直接可用 automind 命令。

# 单次任务(默认工作模式)
automind "创建一个 requirements.txt 包含 fastapi 和 uvicorn"

# 指定模式 / 模型 / 项目目录
automind --mode react --provider deepseek -p D:\myproj "修复 main.py 的报错"

# 信息查询
automind --version        automind --list-tools
automind --list-skills    automind --list-providers

Rich REPL(交互式彩色终端)

不带参数运行 automind 进入:

┌──────────────── REPL ────────────────┐
AutoMind v1.6.3                        
模式: plan_and_execute · 模型: deepseek/…
输入任务开始,/help 查看命令           
└──────────────────────────────────────┘
automind> _
REPL 命令功能
/help帮助
/mode react · /mode plan_and_execute切换执行模式
/tools · /skills表格列出工具 / 技能
/stats本次会话任务数与 Token
/clear · /exit清屏 · 退出(带 Token 总摘要)
其他任何输入作为任务执行,结果 Markdown 面板渲染

10部署与运维(团队 / 生产)

Docker 部署

docker compose up --build
# 数据(配置/记忆/检查点)持久化在 automind_data 卷
# 镜像特性:非 root 用户、/data 工作卷、自带健康检查

生产加固环境变量(默认全关,按需开启)

变量作用建议
AUTOMIND_AUTH_TOKEN所有 API 与 WebSocket 需带 Bearer 令牌暴露公网必开
AUTOMIND_CORS_ORIGINS收紧跨域来源(逗号分隔)配合前端域名
AUTOMIND_MAX_CONCURRENT并发任务上限(默认 8,超出 429)按机器性能调
AUTOMIND_RATE_LIMIT/api/run 每客户端每分钟次数(0=关)公网建议 30
AUTOMIND_REDACT_SECRETS输出中的 API Key / 密码自动打码多人环境建议开
AUTOMIND_ALLOWED_ORIGINSWebSocket Origin 白名单防跨站劫持
运维接口:GET /api/health(免鉴权)返回版本 / 运行任务数 / 并发上限 / 运行时长,供探活与负载均衡。 安装 structlog 输出 JSON 结构化日志,未装自动降级标准格式。服务退出自动释放 MCP / 向量库 / 模型连接池。

🗄 数据与存储(v1.1:SQLite)

v1.1 起高频数据从零散 JSON 平面文件收敛到 SQLite(WAL 模式,并发安全、增量写入)。 首次启动自动把旧 JSON 数据一次性导入,旧文件原地保留作备份,升级零感知。

数据存储位置说明
任务历史 / 团队任务 / 每日限额.automind/automind.db滚动上限 200 条历史;限额跨天自动清零
对话会话(多用户隔离).automind/sessions.db每会话最近 200 条消息
知识库(文档/片段/向量/检索日志).automind/kb/kb.db片段与向量增量落库,检索走内存热路径
配置 / API Key / 工作区.automind_config.json保持纯文本 JSON(体量小、可手工编辑)
备份:停止服务后整体拷贝 .automind/ 目录与 .automind_config.json 即完成全量备份;迁移到新机器原样放回即可。 SQLite 文件可用任意 SQLite 工具(如 sqlite3 CLI、DB Browser)直接查看。

11常见问题 FAQ

顶部模型徽标一直是红色「未配置」?
还没配 API Key。左下角「⚙ 设置 → API Keys」为当前提供商填 Key 并「测试连接」。
徽标黄色带 ⚠?
有 Key 但初始化失败。常见原因:Key 失效、api_base 写错、网络不通。「测试连接」会告诉你卡在哪个阶段。
任务卡住不动 / 想中断?
点输入区 ■ 或按 Ctrl + .。循环模式还会在收敛 / 空转时自动停止。
为什么它说「文件不存在」?
检查右上角 📁 项目目录是否指向正确位置——所有相对路径以它为根,且出于安全不允许访问目录之外的文件。
担心它乱删文件?
三层保险:① 审批切「🙋 询问」逐一批准;② 高危命令(rm -rf 等)被硬拦截;③ 事后「🛡️ 安全审计」核查每次调用。
换台电脑打开,聊天记录不见了?
正常。会话按浏览器隔离(多用户设计)。记录都在服务器本地 .automind/chats/ 下。
Token 花得快怎么办?
① 设置菜单「🖥 模型配置」给对话模式配便宜模型;② 「📊 统计分析」看 Token 效率定位大户任务;③ 任务描述精准、避免反复试错。
想让它用我公司内部的工具?
三选一:写 Python 技能(最简单,见 examples/03);架 MCP 服务器(标准协议,生态互通);写插件(适合通知 / 审计等旁路逻辑)。

12附录:速查表

五种模式一句话

模式引擎一句话
💬 对话直连 LLM只聊不动手
⚙️ 工作Plan-and-Execute先列计划再逐步干
💻 编程ReAct 循环边看边改边验证
🤝 协同多智能体编排专家组分工协作
🔁 循环Loop Engineering迭代到达标为止

常用 API 端点(二次开发)

端点方法功能
/api/healthGET健康检查(免鉴权)
/api/runPOST执行任务 {task, interaction, session_id}
/wsWebSocket流式执行 + 实时事件 + 审批交互
/api/status · /api/stats/detailGET状态 · 高级统计
/api/skills · /api/mcp · /api/pluginsGET/POST三类扩展管理
/api/schedule · /api/auditGET/POST定时任务 · 审计日志

文件位置

内容位置
配置与 API Keys项目目录 .automind_config.json
聊天记录.automind/chats/<会话ID>.json
长期记忆(向量库).automind/chroma/
检查点.automind/checkpoints/
插件~/.automind/plugins/
教程示例仓库 examples/ 目录

13更新日志

每次升级带来了什么,按版本倒序。完整记录见仓库 CHANGELOG.md

v1.6.32026-08-22 当前版本
别再为看不见的东西付钱;长会话与长任务不再卡
  • 🧰 每一步不再重发整本工具说明书:以前 Agent 每走一步,都要把全部 31 个 工具的说明重新发给模型一遍(约 6000~8000 token/步)—— 跑二十步,光"介绍自己有 哪些工具"就烧掉十几万 token,而其中绝大多数跟你的任务毫无关系。现在只发跟当前 任务相关的那批,其余留一份"名字 + 一句话"的目录;模型需要哪个,说一声下一步就 补上。能做的事一件没少,账单直接对半砍。
  • 🗜「省钱功能」以前在花冤枉钱:用量到 80% 时系统会调用一次 AI 生成摘要来 "压缩上下文",但压的根本不是真正每轮重发的那份内容 —— 摘要的钱花了,请求一点 没变小。现在改为直接折叠早前的工具执行结果,不额外花一分钱,而且随用量 上涨可以反复压。
  • 📚 知识库不再每轮重复注入:围绕同一份文档连问五个问题,以前那几段参考 资料就要重复发送五遍(每轮约 500~900 token)。现在同一段只发一次;换了话题检索 到新内容才会补充,被挤出上下文后会自动补发。你的原话也不会再被改写。
  • 📡 又一批「加载失败」不再伪装成「没有数据」:工具面板、专家市场、定时 任务、工作区、右侧观测栏、路由与成本、知识库统计,现在都会分别告诉你 正在加载 / 加载失败(可重试,带原因) / 确实一条都没有工具面板加载中不再显示「没有匹配的工具」 —— 上一版最误导的一处。
  • ✍️ 保存失败不再一声不吭:以前保存设置、启用插件、添加 MCP、删除文档失败 时,界面什么都不说,你以为改好了其实没有。现在会明确弹出失败原因。清空会话时若 服务端没清掉,也会直说而不是谎报「已清空」。
  • 💬 聊到 100 多条不再卡:消息列表默认只渲染最近 40 条(可点「载入更早」 逐批展开,展开时你正看的那条不会跑掉),新消息进来不再牵动整个页面重排。
  • ⌨️ 长回答尾部不再一个字一个字往外蹦:流式输出改为只处理新长出来的部分, 不再每 50 毫秒把整篇回答重新排版一遍。
  • 📈 长任务的执行过程面板不再卡死:单个面板保留最近 300 条执行轨迹并标明 折叠了多少条;完整过程在「任务历史」与「观测中心」里照常可查。
v1.6.22026-08-19
把"看起来没事"的失败都变成看得见的
  • ⏳ 审批弹窗有倒计时了:以前审批框可以一直挂着,但后台 5 分钟没等到你点就 按「拒绝」处理、任务悄悄失败了。现在弹窗显示剩余时间(最后 1 分钟变红), 超时会明确告诉你"已按拒绝处理",而不是让你对着一个早已失效的框继续等。
  • 📡「加载失败」不再伪装成「没有数据」:以前服务没起来、令牌过期、接口报错, 界面统统显示"暂无数据",你根本没法判断出了什么事。现在会分别告诉你 正在加载 / 加载失败(可重试,带具体原因) / 确实一条都没有
  • ⏳ 首屏不再把"正在加载"画成"空":慢一点的机器上,知识库、任务历史、 统计分析会空好几秒,看着像数据丢了。现在有明确的加载骨架屏。
  • 🛡 单个面板出错不再整页白屏:以前任何一处渲染异常都会让整个界面变成一片空白。 现在只有那个面板显示错误提示(可重试、可复制诊断信息),侧边栏与正在跑的任务都还在, 可以直接切到别的页面继续用。
  • 🧪 自我纠错补上测试:顺带修好两个真 bug —— 自我纠错的公开接口此前 每次调用都会报错;重试的等待时间会超出设定的上限。
v1.6.12026-08-18
开箱可用性与社区门面:浏览器零配置、审批可改参数、界面细节收拾干净
  • 🙋 「修改后批准」真的能用了:以前审批只有「批准」「拒绝」两个选择 —— 遇到"命令基本对、就是路径写错了",只能拒绝再让模型重来一轮。现在弹窗里多了 ✎ 修改参数:逐项改、标出改过哪几项,Agent 就按你改后的参数执行。 命令行下按 M 同理,会一项一项问你(回车表示不改)。
  • 🌐 浏览器不用再单独装了:以前网页自动化要另外下载约 150MB 的浏览器, 没装就是一大段英文报错,桌面版用户照着提示也做不了。现在会自动改用你电脑上 已有的 Edge 或 Chrome(Win10/11 自带 Edge),零下载即可用
  • 📈 观测中心的字不再画到框外:中文步骤名比英文宽一倍,原来按字数截断, 22 个汉字远超节点宽度,文字糊到隔壁节点上。现在按实际显示宽度截断, 完整内容鼠标悬停可见。
  • 🌓 启动不再闪一下黑屏:用浅色主题时,每次打开都会先闪一下近黑的启动画面 再跳成白色。现在启动画面在第一帧就用对配色,深色浅色都不再闪。
  • 📋 计划视图重做:以前只有一列灰字。现在有进度概览(目标总数/已完成/ 进行中/失败),每一步能展开看前置条件与预期结果,带工具标签与状态, 还能看到计划被修订过几次。
  • 🤝 开源门面补齐:安全策略、行为准则、Issue/PR 模板,README 补上徽章与界面截图。
v1.6.02026-08-13
开箱即用能力大扩容:内置插件 / 工具 / 技能 / MCP 适配 + 界面美化
  • 🧩 内置 4 个插件(随包分发、默认自动加载,插件面板区分「内置 / 自定义」): cost_tracker(Token/耗时入账 CSV)、pii_guard(敏感信息检测告警)、 task_notify(任务完成通知,可选 Webhook)、hello_hooks(示例模板)。
  • 🛠 内置 11 个工具screenshot_toolocr_toolppt_toolgit_toolimage_toolcsv_toolclipboard_toolchart_toolaudio_toolvideo_toolprocess_tool。全部可选依赖懒加载,缺库时返回可照抄的安装命令。
  • ✨ 内置 6 个技能excel_reportweb_researchdata_insightdoc_batcharticle_writerenv_doctor
  • 🔌 内置 7 个 MCP 官方适配(一键添加):GitHub、PostgreSQL、MySQL、Slack、 飞书、钉钉、Playwright 浏览器。MCP 面板新增「官方适配」卡片。
  • 🖼 浏览器交互可视化:浏览器/截图工具返回的网页截图直接渲染在对话框的执行流程里。
  • 🎨 界面美化:观测中心指标卡片化 + DAG 节点悬停提示;通用设置分组化。
  • 🎨 各面板视觉打通:工具、技能、MCP、插件、知识库、专家市场、团队协作、 统计分析、任务历史此前各写各的样式,同一个"卡片"在不同页面里边距圆角字号都不一样。 现在统一成一套语汇(页头 / 卡片 / 徽标 / 统计块 / 空态 / 看板),并且空态会说清楚 为什么是空的、下一步该做什么,而不是只写"暂无数据"。
  • 🏷 一眼看出能力从哪来:工具面板给每项标注 内置 / MCP / 插件,可按来源筛选与搜索;技能、插件同样区分 "随软件内置"与"你自己导入的"。工具图标不再被长描述挤出卡片。
  • 🇨🇳 工具面板讲中文:工具说明原本是写给模型看的英文提示词,界面上排着 31 段英文没人会读。现在内置能力都配了中文名与一句话说明(原始英文标识符附在后面), 模型那一侧一个字没改。
  • 🔢 统计数字不再自相矛盾:重启后统计页会同时显示"累计 Token 0"和 "编程模式 108,203 tk" —— 前者读的是重启即清零的内存计数器。现在两个数字出自 同一份历史记录,对不上都不可能。
v1.5.22026-08-12
开箱即用 — 第一次跑就会撞上的 7 个问题
  • 🖥 命令行启动不再直接崩溃:中文版 Windows 的命令行窗口默认用 GBK 编码, 而界面里的方框线、✅ 这类符号它显示不了 —— 此前不是显示成乱码,而是 程序当场退出并甩出一串英文报错。按说明书敲 python -m automind.serverautomind 的用户, 第一步就会卡在这里。现在程序会自己把命令行切到能显示中文的模式 (退出时自动还原,不影响你在同一个窗口里跑的其它程序)。
  • 🔑 只配了一家的 Key 也能直接用:软件出厂默认用 OpenAI 的模型, 但大多数人只填了 DeepSeek 的 Key,于是一打开就提示"模型连接失败", 却不告诉你要去哪儿改。现在会自动认出你填了哪家的 Key 并直接用它, 同时明确告诉你:"未检测到 OpenAI 的 API Key,已检测到 DeepSeek Key, 将使用 deepseek-chat"。你要是自己在设置里指定过某一家,则不会被擅自改掉, 只会提醒你 Key 还没填。
  • 🔀 多个标签页同时跑任务不再互相干扰:此前所有并发任务共用同一份运行状态 —— 一个标签页在"对话"、另一个在"循环编程",模式会互相覆盖, 两边的上下文互相串进对方的对话,Token 统计也会被对方清零,而且没有任何提示。 现在每个会话都有自己独立的运行环境(共用的只是工具、技能这些只读部分, 所以几乎不占额外开销)。
  • ⚡ 切换模式/模型不再卡 2~3 秒:此前在界面上点一下模式切换, 程序会把整个引擎重建一遍(重新扫描项目、重建记忆库、重新加载全部工具与技能), 而实际变化的只有一个模型名。现在只替换模型本身,点击即时生效(实测由 1.1 秒降到 1 毫秒以内)。
  • 🚀 文件浏览与编辑不再拖慢全局:打开目录选择器、预览文件、 保存编辑器内容时的读写磁盘操作,此前会把服务端的主循环整个占住 —— 连正在逐字输出的对话也会一起卡住。现在这些操作都挪到后台线程。
  • 📦 automind 命令可用:此前照说明书敲 automind 会提示"不是内部或外部命令"。现在已随包安装,命令行用法与文档一致。
  • 🔌 端口被占用会说清楚,不再让你看着旧版本发懵:如果已经有一个 AutoMind(多半是安装好的桌面版)在跑,新启动的那个其实根本没起来 —— 但屏幕上最后一句仍是"打开浏览器访问 http://127.0.0.1:8765"。你照做, 看到的是那个一直在跑的旧版本,于是以为"更新没生效"。现在启动前会先检查端口, 并直接告诉你:"端口 8765 已被占用,占用者 AutoMind v1.5.0(桌面版安装包); 现在用浏览器打开看到的是它,而不是你刚启动的 v1.5.2",并给出换端口的命令。
v1.5.12026-08-09
可靠性与可观测性 — 不再"悄悄出错"
  • 💬 聊天记录不再悄悄丢失:此前保存失败是完全静默的, 你下次打开发现对话没了也无从查起。现在会自动重试,仍失败则在界面上明确告知 (并提示检查磁盘空间与目录权限);不会因此中断正在进行的任务
  • ⏱ 任务卡住会自己停下:模型服务"连上了却不再回话"时,此前任务会 无限期挂着,界面停在"执行中"永远不动。现在单轮超过 5 分钟自动中止并说明原因; 执行期间每几秒刷新一次状态,显示"正在思考 / 正在生成回答 已 N 秒", 让你分得清"在想"和"挂了"。
  • 🪙 Token 数实时更新:此前要等整段回答生成完才跳一次,长回答期间一直显示 0, 看起来像没在计费。现在每次模型调用结束就更新。
  • 🛡 用量超预算会真正拦住:预算保护此前一直是空转的(代码建好了却从未被调用)。 现在用到 80% 会提醒并自动压缩上下文,用满则停止调用,不会无声无息地一直花钱。
  • ⛔ 坏掉的工具不再反复重试:同一个工具连续失败 3 次即停用, 失败原因在对话区标红显示并附上连续失败次数 —— 此前它会一直重试到步数耗尽, 既慢又看不出发生了什么。任务开始前还会自检模型配置与目录权限。
  • 🧭 计划出现循环依赖能自动化解:此前检测到循环却不做处理,任务会直接报错中止。
v1.5.02026-08-07
新增 12 个办公与集成工具 — AI 现在能直接帮你处理表格、文档、邮件
  • 📊 办公四件套Excel(读写表格、增删行、和 CSV 互转)、 Word(读取内容、生成文档、插入表格)、 PDF(提取文字、合并、拆分、旋转)、 邮件(发送邮件、收取和查看收件箱)。 直接说"把这个表格里的数据汇总成一份 Word 报告"就行。
  • 🔧 通用五件套联网搜索网页/接口请求数据库查询文件检索(按文件名或内容找)、 压缩解压(zip / tar.gz)。
  • 🤝 协同三件套桌面通知(长任务跑完弹窗提醒)、 日历(ICS 日程文件,Windows 上还能直接写进 Outlook)、 群机器人(钉钉 / 企业微信 / 飞书 / Slack)。
  • 📦 按需安装,不臃肿:办公功能依赖的库不会随主程序一起装。 桌面版已内置;用 pip 安装的用户,第一次用到时会提示一行安装命令, 照抄即可(pip install "automind-agent[office]")。
  • 🔐 外发动作一律需要你点确认:发邮件、发群消息属于「发出去就收不回」的操作, 默认每次都要经过审批。另外刻意不提供群发功能(收件人上限 20 人)—— 能被 AI 驱动的无限群发就是垃圾邮件工具,专业版同样不会解锁。 邮箱密码只从环境变量读取,不会出现在任何记录里。
  • 🛡 联网与解压的安全防护:网络请求默认禁止访问内网地址 (防止 AI 被网页内容诱导去读取你的内网服务或云端凭据); 解压会校验压缩包内的路径,防止文件被释放到目录之外。
  • ⭐ 社区版与专业版的分界:分界线划在具体动作上,不是整个工具 —— 社区版能真正把表格读出来、把报告写出去。 进阶动作(Excel 样式美化、Word 模板套打、PDF 加水印与加密、 企业数据库读写)属专业版。
v1.4.62026-08-07
堵上一条上版没能覆盖到的跨站通道 — 建议立即升级
  • 🚨 阻止外部网页通过 WebSocket 操纵本机:上一版收紧了跨站访问,但 WebSocket 走的是另一条路,不受那套规则约束 —— 也就是说,你访问的任何网页 仍可能在后台连上本机 AutoMind,让它执行任务、读写文件。现已改为 默认只接受本机页面的连接,外部来源一律拒绝并记录日志。 命令行与 SDK 调用不受影响;只在本机使用无需任何额外设置。
v1.4.52026-08-06
安全加固第二轮 — 承接 v1.4.4,建议一并升级
  • ✅ 「询问」模式的最后两个漏口:上一版只补了一处,另外两条执行路径 (编程模式的 ReAct 循环、工作模式的计划执行)仍会在没有审批通道审批出错时直接放行 —— 需要你点「批准」的操作被悄悄执行了。现已全部改为 问不到人就不做,并在界面上说明原因。
    若你希望无人值守运行,请把审批模式设为「自动」或「全批准」—— 这是明确的授权表达,而不是靠配置疏漏放权。
  • 🌐 收紧跨站访问(重要):此前的配置会让你浏览的任何网页都能在后台 调用本机 AutoMind 并读取结果 —— 包括让它执行任务。而本地默认又不开鉴权。 现在默认只信任本机页面;需要其它来源请显式配置。
  • 📁 目录浏览限定范围:选择项目目录时不再能浏览整块磁盘,只限 主目录、当前项目与已配置的工作区。实测 C:\ 下可见目录从 22 个收敛到 1 个。
  • 🔑 开放到局域网时自动开启鉴权:以 --host 0.0.0.0 启动而又没设访问令牌时, 系统会自动生成一个随机令牌并在启动信息里醒目打印(同时保存下来)。 只在本机使用则完全不受影响,无需任何额外操作。
  • 🔒 IDE 接入配置接口:该接口会返回明文访问令牌,现在未设令牌时只允许 本机读取,并禁止被缓存。
v1.4.42026-08-06
安全加固专版 — 强烈建议升级
  • 🔒 代码沙箱重写(最高危):此前 Agent 执行的「Python 代码」能跑出沙箱, 读写你机器上的任意文件、甚至执行任意系统命令。已重写为三层防御: 执行前静态检查、受限运行环境、并放到独立子进程里跑。 另外修复了「超时不生效」——死循环代码此前会把程序卡住无法恢复,现在会被真正终止。
    说明:沙箱防的是"AI 写出的代码越权",不等于可以放心执行来路不明的代码; 确有此需要请在容器/虚拟机中部署。
  • 💉 修复测试技能的命令注入:运行测试时的文件匹配参数由 AI 填写, 此前会被当成系统命令的一部分执行,构造特殊内容可执行任意命令。现在改为 参数化调用(不经过命令行解释器)并做严格字符校验。
  • ✅ 修复「询问」模式可能被静默跳过:审批通道出错时(最常见的是你关掉了页面), 系统此前会默认放行,等于「询问」模式悄悄变成了「全批准」。现在一律按 拒绝处理,并在界面上说明原因。命令行审批里「直接回车」也不再等于同意。
  • 📁 收紧目录浏览接口:此前任何人都能通过接口列举本机任意目录。 若你把服务开放到局域网又没设访问令牌,等于把磁盘目录结构公开了。现在 未设令牌时只允许本机访问,并禁止浏览系统敏感目录。本机选择项目目录不受影响。
v1.4.32026-08-05
修复输入框被挤出界面 · 任务历史可搜索 · 执行进度看得见
  • 🩹 修复长会话把输入框挤出界面:消息一多,对话面板会被内容撑破容器, 消息区不再滚动、输入框被顶到视口之外彻底看不见。实测 80 条消息时面板高度 被撑到 11821 像素(可用高度仅 648)。已修复:同样 80 条消息下消息区 正常滚动、输入框稳定停在底部。
  • 🔍 任务历史可搜索、可翻页:新增关键词搜索(任务内容与产出一起匹配, 命中处高亮)、模式筛选成功/未完成筛选;列表改为分页(每页 20 条), 不再一次性把全部记录铺出来。另外,此前界面只能看到最近 50 条,而系统实际 保留 200 条 —— 剩下的记录够不着,现在都能搜到了。
  • ⏱ 执行进度看得见:输入框上方新增一条轻量进度指示 —— 当前阶段 · 第 X / N 步 · 正在做什么 · 已耗时,右侧「查看详情」可直接跳到 观测中心看完整执行过程。解决"长任务跑着跑着,界面看起来像卡住了"。 对话与编程模式没有预先生成的计划,此时不显示编造的百分比, 改用流动条表示"正在进行、总量未知"。
v1.4.22026-08-05
消息可编辑/删除 · 断线可视化 · 恢复语义纠正 · 界面精修
  • ✎ 消息编辑与删除:把鼠标移到任意气泡上,右上角会浮出操作条 —— 复制 / 编辑 / 删除。此前发错问题只能"复制原文 → 手动改 → 重发"。 编辑用内联输入框(Enter 发送、 Esc 取消),重发时会自动移除该条及其之后的消息, 因为问题都改了、基于旧问题的回答留着只会让上下文自相矛盾。删除有二次确认, 且只影响本地会话记录,不会回滚已产生的文件改动
  • 🔌 断线时看得见"正在重连":新增顶部横幅,显示重连倒计时与已尝试 次数,并可点「立即重连」跳过等待;顶栏状态徽标区分「⟳ 重连中」与「○ 未连接」; 重连成功会给出提示。此前断线只有一个不起眼的灰色「未连接」, 用户常常是发消息没反应才发现。
  • ⚠ 任务执行中断线不再卡死:连接一断,本次执行的结果就送不回来了, 而界面此前会一直停在"执行中"、输入框永久禁用。现在会落一张失败卡片 (带重跑入口)并解锁界面。
  • 🩹 「继续此任务」改名,避免误导:经核对,本软件没有真正的断点续传—— 检查点只在任务成功结束后才写,任务失败时并不会留下检查点。所以按钮改为 「▶ 检查现状后接着做」(重发任务并要求模型先核对已完成的部分)与 「↻ 从头重跑」,并注明:两者都会重新执行一次任务,已写出的文件不会被回滚。
  • 🔢 修复升级日志里的退出码记错:可见模式重试安装成功时,安装日志却仍记录 为失败码,排查升级问题时会被带偏。现已修正。
  • 🎨 界面精修:气泡改用双层阴影、悬停轻微抬起,头像加内描边,滚动条静止时 隐入,输入区聚焦时整条底栏提亮,数字统一等宽字形;并补上全局键盘焦点环, 纯键盘操作时能看清焦点位置。
v1.4.12026-08-05
修复"点升级后应用消失" · 输入框草稿保护 · 任务失败可一键恢复
  • 🛠 修复升级后应用不再启动:桌面版是无控制台的 GUI 进程,升级脚本又以 分离方式启动,此前没有显式指定标准输入输出句柄 —— 脚本里的重定向和管道 全部失效,批处理在装之前就退出了,于是"应用退出、再也没回来"。现已修复, 并给脚本加了三重兜底:静默安装失败自动改用可见模式重试(装在 Program Files 需要 UAC 提权)、安装前清理残留实例、 无论成败最后都把应用拉起来。安装日志与执行轨迹留在临时目录便于追查。
  • ✍ 输入框草稿自动保存:打到一半切模式、切视图、关窗口,内容不再丢失, 重新打开自动回填(按会话与工作区隔离)。语音听写与模板填入的内容一并保护。
  • 🎯 打开即聚焦:进入对话区、切换模式、任务跑完后自动把光标交还输入框, 省掉"先点一下输入框"这步;有弹窗时不抢焦点。
  • ⧉ 自己发的提问也能复制:此前复制按钮只挂在 AI 回复上。同时改为复制 Markdown 原文(旧实现取气泡可见文本,会把复制按钮自己的图标一起带走), 并在非 HTTPS 环境下自动回退,局域网访问时复制不再失灵。
  • 🚑 任务失败有了恢复入口:失败/中断从"一行红字"改为一张卡片 —— 可展开完整报错、▶ 继续此任务(从中断处续跑,不重做已完成部分)、 ↻ 重新执行⧉ 复制错误,并针对 Key 失效、限流、超时、网络不通、 上下文超长等常见原因给出下一步建议。任务原文随卡片一起留存, 重启应用后依然能续跑
  • 📖 手册新增本章:更新日志现可在手册内直接查阅。
v1.4.02026-07-30
四项体验增强:字号调节 · 无闪烁切换 · 完整快捷键系统 · 任务完成通知
  • 🔤 字号调节:85%~130% 无级调节,Ctrl + = / - / 0 可直接调,"标准"档与升级前像素级一致。
  • ✨ 消除切换时的黑屏闪烁:对话面板改为常驻挂载、只切显示,DOM 不再重建, 顺带修复切回对话时滚动位置丢失;新增「减少动效」开关。
  • ⌨ 完整快捷键系统:新增 19 项全局快捷键,按 ? 查看; 帮助弹窗内容由注册表直接生成,与实际生效的按键同源。
  • 🔔 任务完成桌面通知:仅在窗口不可见时提醒,点通知跳回应用, 完成/失败/中断三种终态都会通知。
v1.3.22026-07-29
三平台安装包 · 兼容版界面补齐升级提示
  • 首个三平台同时发布的版本:Windows(代码签名)/ macOS(通用二进制 DMG)/ Linux。
  • 修复 PyPI 元数据死链与许可字段。
  • 兼容版界面补齐升级提示与检查更新入口。
💡 应用内点击左下角 「⚙ 设置 → 检查更新」 可查看是否有新版本并一键升级; 升级过程中应用会短暂退出,安装完成后自动重新启动