AutoMind 使用手册
automind-pro 提供,配置许可证(AUTOMIND_LICENSE)后自动激活;
社区版对应入口显示 🔒。安全能力(鉴权/限流/脱敏/审计)不设付费墙。详见 docs/EDITIONS.md。
%APPDATA%\AutoMind(托盘菜单一键打开)。
自行构建见仓库 desktop/README.md。
01产品简介
普通 AI 聊天工具只能"说";AutoMind 除了聊天,还能真正在你的电脑上执行操作: 创建文件、修改代码、运行命令、抓取网页、生成报告——并且做每件事之前先自己规划步骤, 做完自己检查结果,出错自己纠正重试。
大任务自动拆解为目标树,按依赖顺序逐步执行,每步验证效果
每次工具调用经风险评估与审批门控,高危操作必须你亲自批准
失败时自动分析错误、生成修正方案重试,必要时回溯调整计划
OpenAI / Claude / DeepSeek / Kimi / 通义 / 智谱 / 豆包 / Ollama / 中转代理
技能 Skill · MCP 服务器 · 生命周期插件,随需接入你的专属能力
配置、聊天记录、API Key 全部保存在你自己的电脑,绝不上传
它能帮你做什么?
| 你想做的事 | AutoMind 怎么帮你 |
|---|---|
| 问问题、写文案、翻译 | 💬 对话模式,像聊天软件一样直接问 |
| 「帮我建一个 Python 项目」 | ⚙️ 工作模式:自动建目录、写配置、装依赖 |
| 「修复 main.py 里的 bug」 | 💻 编程模式:读代码 → 分析 → 改代码 → 验证 |
| 「写一份行业调研报告」 | 🤝 协同模式:研究员 + 编写员 + 审阅员多角色协作 |
| 「持续优化代码直到测试全过」 | 🔁 循环模式:反复"执行→检查→改进"直到达标 |
| 「每天 9 点汇总昨日日志」 | ⏰ 定时任务:后台自动执行并记录结果 |
02快速上手(零基础五分钟)
命令行执行pip install "automind-agent[web]"
python -m automind.server
浏览器打开 localhost:8765
左下角「⚙ 设置 → API Keys」填 Key,
点「🔌 测试连接」变绿即成功
切「⚙️ 工作」模式,输入任务,
看它实时规划并执行
python --version 查看)。
服务器部署可直接 docker compose up --build。三种安装方式
| 方式 | 命令 | 适合 |
|---|---|---|
| PyPI(推荐) | pip install "automind-agent[web]";升级:pip install -U "automind-agent[web]" | 直接使用 |
| GitHub 源码 | git clone https://github.com/yl13571844594-arch/AutoMind.git → cd AutoMind → pip install -e ".[web]" | 改代码 / 参与贡献 |
| 本地源码目录 | 在软件目录执行 pip install -e ".[web]" | 压缩包 / 网盘分发 |
[web] 含 Web 工作台依赖;想用 Claude / Gemini 官方 SDK 等全部后端换成 [full]。
国内提速:命令末尾加 -i https://pypi.tuna.tsinghua.edu.cn/simple。三种启动方式
| 方式 | 操作 | 适合 |
|---|---|---|
| Windows 一键 | 双击 launch.bat,选 [2] 自动打开浏览器 | 最简单 |
| 命令行 | python -m automind.server --port 8765 → 浏览器打开 http://localhost:8765 | 通用 |
| Docker | docker compose up --build | 服务器部署 |
ollama run llama3.2,无需 Key;
② 中转代理——API Keys 面板底部「自定义 OpenAI 标准接口」填入代理的 api_base、模型名和 Key。试一试:第一个任务
# 模式切到「⚙️ 工作」,输入框输入:
在当前目录创建 hello.txt,内容为 Hello AutoMind
执行时:聊天区出现「⚙️ 执行过程」实时轨迹(计划生成 → 逐步执行 → 完成),
右侧「📋 执行计划」同步刷新每步状态(○ 待执行 → ◐ 执行中 → ✓ 完成),
完成后项目目录里 hello.txt 真实存在。
03界面总览
键盘快捷键v1.4 起为完整快捷键系统
macOS 上把下表的 Ctrl 读作 ⌘。应用内按 ? 可随时调出这张表(侧栏「⚙ 设置 → ⌨ 键盘快捷键」也能打开), 内容与实际生效的按键同源,不会出现"文档写了却按不动"。
| 快捷键 | 功能 |
|---|---|
| Enter / Shift+Enter | 发送 / 换行 |
| Esc 或 Ctrl + . | 停止当前任务;有弹窗时先关弹窗 |
| Ctrl + N 或 Ctrl + L | 新会话(清空当前模式对话,会二次确认) |
| Ctrl + K | 打开模板库 |
| Ctrl + , | 打开通用设置 |
| Ctrl + Shift + W | 切换工作区 |
| Ctrl + / | 光标定位到输入框 |
| Ctrl + Shift + L | 切换深色 / 浅色主题 |
| Ctrl + = / Ctrl + - / Ctrl + 0 | 增大 / 减小 / 复位字号 |
| ? | 显示快捷键帮助 |
| Ctrl + 1 ~ Ctrl + 3 | 切换模式:对话 / 工作 / 编程 |
| Alt + 1 ~ Alt + 4 | 切换视图:对话工作台 / 计划 / 工具 / 历史 |
界面偏好(字号 / 通知 / 动效)v1.4 新增
在「⚙ 设置 → ⚙ 通用设置 → 🎨 界面偏好」里,三项都是本机生效、立即生效、自动记住, 不改变任何功能,也不会同步到别的机器。
| 项目 | 说明 |
|---|---|
| 字号 | 85% ~ 130% 无级调节,界面整体等比缩放(含 antd 组件)。也可用 Ctrl + = / Ctrl + - / Ctrl + 0 |
| 任务完成通知 | 任务跑完发系统通知,只在窗口不可见时提醒; 点通知直接跳回应用。解决"发个 5 分钟的任务切走干别的,回来才发现早跑完了" |
| 减少动效 | 关闭淡入等动画,老机器上更跟手;系统级「减少动态效果」也会被自动尊重 |
04五种交互模式深度解读
模式决定了 AutoMind「怎么思考、要不要动手、如何收尾」。选对模式,事半功倍。
💬 对话模式 —— "问答专家"
原理:纯多轮对话直连大模型,不调用任何工具,响应最快。支持图片输入(需视觉模型如 gpt-4o / qwen-vl)。
⚙️ 工作模式 —— "项目经理 + 执行团队"(Plan-and-Execute)
💻 编程模式 —— "结对程序员"(ReAct 循环)
与工作模式的区别:不预先定死计划,边做边调整——更适合"看了代码才知道下一步"的探索性任务。 思考(蓝卡)与工具调用(绿卡)全程流式展示。
🤝 协同模式 —— "多角色专家组"(多智能体编排) 🔒 专业版
原理:任务分派给多个角色(规划者 / 研究员 / 编程者 / 审阅者), 各自基于共享白板完成子任务并互相看得到彼此成果,最后综合产出。
🔁 循环模式 —— "不达目标不罢休"(Loop Engineering) 🔒 专业版
原理:执行 → 判定"目标达成了吗" → 未达成则带着反馈继续下一轮。内置四重停止条件防死循环:
模式选择决策
让它替我做一件多步骤的事? → ⚙️ 工作
围绕代码读改测? → 💻 编程
复杂问题要多角度方案? → 🤝 协同(专业版)
有明确标准要迭代到达标? → 🔁 循环(专业版)
05工具审批与安全体系
每次工具调用都被安全体系拦截评估——你可以精确控制"它能做什么"。
三种审批模式(顶部下拉切换)
| 模式 | 行为 | 适合场景 |
|---|---|---|
| 🙋 询问 | 除只读操作外,每次工具调用都弹窗请你批准 | 首次使用 / 重要项目 / 想完全掌控 |
| ⚡ 自动(默认) | 低风险自动放行;风险分 ≥60 的敏感操作与所有高危操作需确认 | 日常使用最佳平衡 |
| ✅ 全批准 | 跳过所有审批,完全自主运行 | 沙箱环境批量任务;慎用 |
权限分级
| 等级 | 示例 | 处理 |
|---|---|---|
| safe 安全 | 读文件、列目录、git status | 直接放行 |
| sensitive 敏感 | 写文件、装依赖、git commit | 按审批模式处理 |
| dangerous 高危 | rm -rf、sudo、强制推送 | 必须人工批准 |
rm -rf /、fork bomb、写磁盘设备等灾难命令直接拒绝;
② 路径防护 —— 文件读写限定在项目目录内,../ 越界直接拒绝;
③ Python 沙箱 —— 代码执行仅允许白名单模块,禁止 os / subprocess。事后追责:侧边栏「🛡️ 安全审计」记录每次调用的时间、工具、参数、决策、风险分与原因, 并汇总放行 / 询问 / 拒绝 / 高危次数。
06模型配置详解
支持的提供商(左下角 ⚙ 设置 → 🔑 API Keys)
gpt-4o · platform.openai.com
claude-sonnet · console.anthropic.com
deepseek-chat · 性价比之选
moonshot-v1 · platform.moonshot.cn
qwen-max · dashscope.aliyun.com
glm-4 · open.bigmodel.cn
volcengine.com
ai.google.dev · x.ai
llama3.2 · 无需 Key,本机 ollama serve
api_base
(如 https://api.your-proxy.com/v1)+ 默认模型 + Key,
即可对接任何 OpenAI 兼容 /v1/chat/completions 服务。
Key 只保存在本地 .automind_config.json;也支持环境变量
(OPENAI_API_KEY、DEEPSEEK_API_KEY 等)。省钱与提效:各模式专用模型
设置菜单的「🖥 模型配置」面板可为五种模式分别指定不同模型——
对话用便宜快的 deepseek-chat,编程用强力的 claude-sonnet,
实现成本 / 能力的精准分配。未指定的模式沿用全局默认。
通用设置(左下角 ⚙ 设置 → 通用设置)
| 设置项 | 说明 | 建议 |
|---|---|---|
| 项目目录 | Agent 一切文件操作的根(带可视化目录浏览器) | 为不同项目切换对应目录,准确又安全 |
| Temperature | 0–2,越低越严谨、越高越发散 | 代码 0–0.3;创意 0.7+ |
| 最大输出 Token | 单次回复长度上限 | 默认即可,长文档任务调大 |
07工具面板:工具 / 技能 / MCP / 插件
侧边栏「🔧 工具面板」四个分段,对应 AutoMind 的四类可扩展能力。
🔧 工具 —— Agent 的"手"
| 工具 | 等级 | 功能 |
|---|---|---|
terminal | 敏感 | 执行命令行(装依赖、跑脚本、git) |
file_read | 安全 | 读取文件内容 |
file_write | 敏感 | 创建 / 覆盖文件 |
file_edit | 敏感 | 精确字符串替换编辑(带 diff 与回滚) |
python_sandbox | 敏感 | 沙箱执行 Python 片段(计算 / 数据处理) |
web_fetch | 安全 | 抓网页提取正文与链接 |
browser | 敏感 | Playwright 浏览器自动化 |
screenshot_tool / ocr_tool | 敏感 | 截屏 / 图片文字识别 |
ppt_tool | 敏感 | PowerPoint 生成 / 读取 / 追加 |
git_tool | 敏感 | 结构化 git 操作(含危险门控) |
image_tool / chart_tool | 敏感 | 图像缩放裁剪水印 / 数据图表 |
csv_tool | 敏感 | CSV 与 JSON 读写转换合并 |
clipboard_tool | 敏感 | 读写系统剪贴板 |
audio_tool / video_tool | 安全/敏感 | 音频信息 / 视频信息与抽帧 |
process_tool | 敏感 | 进程列表 / 端口占用 / 结束进程 |
web_fetch 和 browser;只读分析 → 只留 file_read。✨ 技能 —— 预制的"专家流程"
| 内置技能 | 功能 | 典型指令 |
|---|---|---|
project_init | 项目脚手架(目录/pyproject/venv/git) | 「初始化一个新项目」 |
code_generator | 代码生成 / 补全 / 脚手架,带语法校验与自动修复 | 「生成一个爬虫脚本」 |
test_runner | 发现并运行测试、收集失败 | 「跑一下测试」 |
log_analyzer | 日志级别统计 / 错误样本 / 高频模式聚类 | 「分析这个日志文件」 |
doc_generator | 从 Python 源码生成 Markdown API 文档 | 「给 src 生成 API 文档」 |
dep_audit | 依赖审计:未固定版本 / 重复声明 | 「检查依赖健康度」 |
excel_report | 表格数据汇总成 Markdown 报告 | 「把这张表做成周报」 |
web_research | 多来源搜索 + 抓正文,带引用调研报告 | 「调研这个话题」 |
data_insight | 描述性统计 + 相关性,输出关键发现 | 「这组数据有什么规律」 |
doc_batch | 批量合并 / 提取文本 / 重命名 Word、PDF | 「把 PDF 合成一个」 |
article_writer | 公众号 / 小红书 / 新闻稿风格写作 | 「写一篇种草笔记」 |
env_doctor | 环境诊断:依赖 / 端口 / 磁盘体检 | 「为什么跑不起来」 |
导入自定义技能:「📁 加载目录」批量导入 SKILL.md 技能包(YAML 头 + 指令正文,无代码);
「📄 导入 .py」导入继承 AbstractSkill 的 Python 技能(模板见 examples/03-skill-development/);
「⬇️ 一键导入桌面 skills 文件夹」直接吸收技能库。
🔌 MCP —— 连接外部工具生态
MCP(Model Context Protocol)是开放协议,接入后外部服务的工具自动出现在工具列表供
Agent 调用(文件系统、数据库、搜索、地图…)。支持单个添加(stdio 本地命令 / sse URL)
或直接粘贴 Claude Desktop 格式的 {"mcpServers": {...}} 批量导入。需先 pip install mcp。
⭐ 官方适配(一键添加):内置 GitHub、PostgreSQL、MySQL、Slack、飞书、钉钉、
Playwright 浏览器 7 个预设,点「添加」即写入配置并连接;需密钥的服务会提示在系统
环境变量里设置(如 GITHUB_PERSONAL_ACCESS_TOKEN、DATABASE_URL)。
🧩 插件 —— 生命周期钩子扩展
插件在任务开始 / 结束 / 解析后 / 计划后 / 出错等时机自动执行你的逻辑 (记日志、发通知、审计上报),不改动主程序。面板中「加载 / 卸载」即时生效。
内置 4 个插件(随包分发、默认自动加载,面板以「内置 / 自定义」区分):
cost_tracker(Token/耗时入账 CSV)、pii_guard(敏感信息检测告警)、
task_notify(任务完成通知,可选 AUTOMIND_NOTIFY_WEBHOOK)、
hello_hooks(示例模板)。
# 插件目录结构
~/.automind/plugins/task-timer/
├── plugin.json # {"name":"task-timer","version":"1.0.0","description":"…"}
└── hooks.py # def get_hooks() -> AgentHooks
examples/04-plugin-development/。08高级功能
🔄 自主任务闭环(v0.3 新增,默认开启)
工作 / 编程模式任务完成后自动执行"质检流水线",不合格自动返工—— 把"AI 说做完了"变成"验证过真的做完了"。
| 开关(⚙ 设置 → 通用) | 作用 | 何时关闭 |
|---|---|---|
| 🧐 多Agent审查 | 工作模式完成后审阅者角色复核,可调用只读工具核实(MCP 工具共享) | 追求极致速度 / 省 Token |
| ✅ Loop 验收 | 语义验收 + 未过带反馈自动修复(≤2 轮) | 简单任务不需返工 |
| 🧪 TDD 测试 | 编程模式改 .py 即时语法验证;收尾自动跑 pytest | 项目测试极慢时 |
| ⚡ 并行执行 | 计划中互不依赖的步骤 asyncio.gather 并发 | 步骤有隐式资源冲突时 |
| 📦 子任务缓存 | 同任务内相同只读调用结果复用 | 需每次强制重读时 |
.py 后系统立即语法检查,
把 syntax_check: OK / FAILED 注入模型观察——有错它下一步就看到并立刻修复,
形成 编辑 → 验证 → 修复 闭环。另有 code_generate 工具
(语言检测、语法校验 + 自动修复、mode='complete' 代码补全)。任务内容 + 模式(五种均可)+ 间隔(每5分钟 / 每小时 / 每6小时 / 每天)。
后台调度、结果入历史、重启自动恢复。
场景:每天汇总日志错误、每小时抓数据追加 CSV、每 6 小时跑测试。
四个命中率圆环(工具/计划/任务/自我修正 + 综合平均)、上下文使用率发光条、
最近 50 次趋势折线、Token 效率、记忆系统指标。
用途:评估模型效果、监控 Token 花销、发现异常任务。
Agent 生成的 HTML(报告/图表/页面)出现在右栏列表,点击即在弹窗内直接渲染,免去手动找文件。
对话模式上传图片(可多张)配视觉模型看图问答;🎤 语音实时转文字输入(Web Speech API)。
每个浏览器独立会话 ID:团队共用一台服务,聊天记录互不可见、互不清除。
侧边栏「📚 知识库」上传 PDF/Word/MD/TXT → 自动分段 + embedding → 对话时自动检索你的资料作答(可开关)。 社区版 5 文档/10MB;专业版无限文档/200MB/多库/Reranker/引用溯源/定时重嵌入/外部向量后端; 企业版混合检索(向量+词法)/热度统计/检索审计/目录批量导入、总量不限。
对话模式相似问题秒回历史答案(0 Token)。专业版基础缓存(300 条/24h), 企业版高级缓存(2000 条/7 天 + 命中率与节省统计)。「🧭 路由与成本」视图可调阈值/清空。
按任务复杂度(长度/代码特征/多步骤,0~100 打分)自动分级选模型:简单问答走便宜小模型、复杂任务走强模型。 专业版 2 级路由,企业版 N 级 + 💰 成本仪表盘(按模型/日聚合成本 + 缓存节省)。
侧边栏「📈 观测中心」把 Agent 的执行过程画成实时更新的 DAG:任务 → 计划步骤 → 工具调用三层, 六种状态配色(待执行/执行中/成功/失败/回溯/已中断),点节点看耗时与失败原因。 社区版可看当前任务的实时 DAG(只读、仅当前任务); 专业版加实时看板(成功率 / P50·P95 耗时 / 工具热度 / 失败归因)、200 次运行历史回看与 JSON 导出; 企业版历史扩到 2000 次并按会话维度分组。全程本机内存构建,不额外消耗 Token。
社区版每日任务 100 次、工作区 3 个;专业版任务不限、工作区 30 个;企业版全部不限。 顶栏 📅 徽标实时显示当日用量,超限给出友好升级提示(跨天自动清零)。
每条 AI 消息悬浮「⧉ 复制」;每个代码块带语言标签和独立复制按钮。
09命令行与 REPL
不开浏览器也能用。安装后命令行直接可用 automind 命令。
# 单次任务(默认工作模式)
automind "创建一个 requirements.txt 包含 fastapi 和 uvicorn"
# 指定模式 / 模型 / 项目目录
automind --mode react --provider deepseek -p D:\myproj "修复 main.py 的报错"
# 信息查询
automind --version automind --list-tools
automind --list-skills automind --list-providers
Rich REPL(交互式彩色终端)
不带参数运行 automind 进入:
│ AutoMind v1.6.3 │
│ 模式: plan_and_execute · 模型: deepseek/… │
│ 输入任务开始,/help 查看命令 │
└──────────────────────────────────────┘
automind> _
| REPL 命令 | 功能 |
|---|---|
/help | 帮助 |
/mode react · /mode plan_and_execute | 切换执行模式 |
/tools · /skills | 表格列出工具 / 技能 |
/stats | 本次会话任务数与 Token |
/clear · /exit | 清屏 · 退出(带 Token 总摘要) |
| 其他任何输入 | 作为任务执行,结果 Markdown 面板渲染 |
10部署与运维(团队 / 生产)
Docker 部署
docker compose up --build
# 数据(配置/记忆/检查点)持久化在 automind_data 卷
# 镜像特性:非 root 用户、/data 工作卷、自带健康检查
生产加固环境变量(默认全关,按需开启)
| 变量 | 作用 | 建议 |
|---|---|---|
AUTOMIND_AUTH_TOKEN | 所有 API 与 WebSocket 需带 Bearer 令牌 | 暴露公网必开 |
AUTOMIND_CORS_ORIGINS | 收紧跨域来源(逗号分隔) | 配合前端域名 |
AUTOMIND_MAX_CONCURRENT | 并发任务上限(默认 8,超出 429) | 按机器性能调 |
AUTOMIND_RATE_LIMIT | /api/run 每客户端每分钟次数(0=关) | 公网建议 30 |
AUTOMIND_REDACT_SECRETS | 输出中的 API Key / 密码自动打码 | 多人环境建议开 |
AUTOMIND_ALLOWED_ORIGINS | WebSocket Origin 白名单 | 防跨站劫持 |
GET /api/health(免鉴权)返回版本 / 运行任务数 / 并发上限 / 运行时长,供探活与负载均衡。
安装 structlog 输出 JSON 结构化日志,未装自动降级标准格式。服务退出自动释放 MCP / 向量库 / 模型连接池。🗄 数据与存储(v1.1:SQLite)
v1.1 起高频数据从零散 JSON 平面文件收敛到 SQLite(WAL 模式,并发安全、增量写入)。 首次启动自动把旧 JSON 数据一次性导入,旧文件原地保留作备份,升级零感知。
| 数据 | 存储位置 | 说明 |
|---|---|---|
| 任务历史 / 团队任务 / 每日限额 | .automind/automind.db | 滚动上限 200 条历史;限额跨天自动清零 |
| 对话会话(多用户隔离) | .automind/sessions.db | 每会话最近 200 条消息 |
| 知识库(文档/片段/向量/检索日志) | .automind/kb/kb.db | 片段与向量增量落库,检索走内存热路径 |
| 配置 / API Key / 工作区 | .automind_config.json | 保持纯文本 JSON(体量小、可手工编辑) |
.automind/ 目录与
.automind_config.json 即完成全量备份;迁移到新机器原样放回即可。
SQLite 文件可用任意 SQLite 工具(如 sqlite3 CLI、DB Browser)直接查看。11常见问题 FAQ
顶部模型徽标一直是红色「未配置」?
徽标黄色带 ⚠?
任务卡住不动 / 想中断?
为什么它说「文件不存在」?
担心它乱删文件?
换台电脑打开,聊天记录不见了?
.automind/chats/ 下。Token 花得快怎么办?
想让它用我公司内部的工具?
12附录:速查表
五种模式一句话
| 模式 | 引擎 | 一句话 |
|---|---|---|
| 💬 对话 | 直连 LLM | 只聊不动手 |
| ⚙️ 工作 | Plan-and-Execute | 先列计划再逐步干 |
| 💻 编程 | ReAct 循环 | 边看边改边验证 |
| 🤝 协同 | 多智能体编排 | 专家组分工协作 |
| 🔁 循环 | Loop Engineering | 迭代到达标为止 |
常用 API 端点(二次开发)
| 端点 | 方法 | 功能 |
|---|---|---|
/api/health | GET | 健康检查(免鉴权) |
/api/run | POST | 执行任务 {task, interaction, session_id} |
/ws | WebSocket | 流式执行 + 实时事件 + 审批交互 |
/api/status · /api/stats/detail | GET | 状态 · 高级统计 |
/api/skills · /api/mcp · /api/plugins | GET/POST | 三类扩展管理 |
/api/schedule · /api/audit | GET/POST | 定时任务 · 审计日志 |
文件位置
| 内容 | 位置 |
|---|---|
| 配置与 API Keys | 项目目录 .automind_config.json |
| 聊天记录 | .automind/chats/<会话ID>.json |
| 长期记忆(向量库) | .automind/chroma/ |
| 检查点 | .automind/checkpoints/ |
| 插件 | ~/.automind/plugins/ |
| 教程示例 | 仓库 examples/ 目录 |
13更新日志
每次升级带来了什么,按版本倒序。完整记录见仓库 CHANGELOG.md。
- 🧰 每一步不再重发整本工具说明书:以前 Agent 每走一步,都要把全部 31 个 工具的说明重新发给模型一遍(约 6000~8000 token/步)—— 跑二十步,光"介绍自己有 哪些工具"就烧掉十几万 token,而其中绝大多数跟你的任务毫无关系。现在只发跟当前 任务相关的那批,其余留一份"名字 + 一句话"的目录;模型需要哪个,说一声下一步就 补上。能做的事一件没少,账单直接对半砍。
- 🗜「省钱功能」以前在花冤枉钱:用量到 80% 时系统会调用一次 AI 生成摘要来 "压缩上下文",但压的根本不是真正每轮重发的那份内容 —— 摘要的钱花了,请求一点 没变小。现在改为直接折叠早前的工具执行结果,不额外花一分钱,而且随用量 上涨可以反复压。
- 📚 知识库不再每轮重复注入:围绕同一份文档连问五个问题,以前那几段参考 资料就要重复发送五遍(每轮约 500~900 token)。现在同一段只发一次;换了话题检索 到新内容才会补充,被挤出上下文后会自动补发。你的原话也不会再被改写。
- 📡 又一批「加载失败」不再伪装成「没有数据」:工具面板、专家市场、定时 任务、工作区、右侧观测栏、路由与成本、知识库统计,现在都会分别告诉你 正在加载 / 加载失败(可重试,带原因) / 确实一条都没有。 工具面板加载中不再显示「没有匹配的工具」 —— 上一版最误导的一处。
- ✍️ 保存失败不再一声不吭:以前保存设置、启用插件、添加 MCP、删除文档失败 时,界面什么都不说,你以为改好了其实没有。现在会明确弹出失败原因。清空会话时若 服务端没清掉,也会直说而不是谎报「已清空」。
- 💬 聊到 100 多条不再卡:消息列表默认只渲染最近 40 条(可点「载入更早」 逐批展开,展开时你正看的那条不会跑掉),新消息进来不再牵动整个页面重排。
- ⌨️ 长回答尾部不再一个字一个字往外蹦:流式输出改为只处理新长出来的部分, 不再每 50 毫秒把整篇回答重新排版一遍。
- 📈 长任务的执行过程面板不再卡死:单个面板保留最近 300 条执行轨迹并标明 折叠了多少条;完整过程在「任务历史」与「观测中心」里照常可查。
- ⏳ 审批弹窗有倒计时了:以前审批框可以一直挂着,但后台 5 分钟没等到你点就 按「拒绝」处理、任务悄悄失败了。现在弹窗显示剩余时间(最后 1 分钟变红), 超时会明确告诉你"已按拒绝处理",而不是让你对着一个早已失效的框继续等。
- 📡「加载失败」不再伪装成「没有数据」:以前服务没起来、令牌过期、接口报错, 界面统统显示"暂无数据",你根本没法判断出了什么事。现在会分别告诉你 正在加载 / 加载失败(可重试,带具体原因) / 确实一条都没有。
- ⏳ 首屏不再把"正在加载"画成"空":慢一点的机器上,知识库、任务历史、 统计分析会空好几秒,看着像数据丢了。现在有明确的加载骨架屏。
- 🛡 单个面板出错不再整页白屏:以前任何一处渲染异常都会让整个界面变成一片空白。 现在只有那个面板显示错误提示(可重试、可复制诊断信息),侧边栏与正在跑的任务都还在, 可以直接切到别的页面继续用。
- 🧪 自我纠错补上测试:顺带修好两个真 bug —— 自我纠错的公开接口此前 每次调用都会报错;重试的等待时间会超出设定的上限。
- 🙋 「修改后批准」真的能用了:以前审批只有「批准」「拒绝」两个选择 ——
遇到"命令基本对、就是路径写错了",只能拒绝再让模型重来一轮。现在弹窗里多了
✎ 修改参数:逐项改、标出改过哪几项,Agent 就按你改后的参数执行。
命令行下按
M同理,会一项一项问你(回车表示不改)。 - 🌐 浏览器不用再单独装了:以前网页自动化要另外下载约 150MB 的浏览器, 没装就是一大段英文报错,桌面版用户照着提示也做不了。现在会自动改用你电脑上 已有的 Edge 或 Chrome(Win10/11 自带 Edge),零下载即可用。
- 📈 观测中心的字不再画到框外:中文步骤名比英文宽一倍,原来按字数截断, 22 个汉字远超节点宽度,文字糊到隔壁节点上。现在按实际显示宽度截断, 完整内容鼠标悬停可见。
- 🌓 启动不再闪一下黑屏:用浅色主题时,每次打开都会先闪一下近黑的启动画面 再跳成白色。现在启动画面在第一帧就用对配色,深色浅色都不再闪。
- 📋 计划视图重做:以前只有一列灰字。现在有进度概览(目标总数/已完成/ 进行中/失败),每一步能展开看前置条件与预期结果,带工具标签与状态, 还能看到计划被修订过几次。
- 🤝 开源门面补齐:安全策略、行为准则、Issue/PR 模板,README 补上徽章与界面截图。
- 🧩 内置 4 个插件(随包分发、默认自动加载,插件面板区分「内置 / 自定义」):
cost_tracker(Token/耗时入账 CSV)、pii_guard(敏感信息检测告警)、task_notify(任务完成通知,可选 Webhook)、hello_hooks(示例模板)。 - 🛠 内置 11 个工具:
screenshot_tool、ocr_tool、ppt_tool、git_tool、image_tool、csv_tool、clipboard_tool、chart_tool、audio_tool、video_tool、process_tool。全部可选依赖懒加载,缺库时返回可照抄的安装命令。 - ✨ 内置 6 个技能:
excel_report、web_research、data_insight、doc_batch、article_writer、env_doctor。 - 🔌 内置 7 个 MCP 官方适配(一键添加):GitHub、PostgreSQL、MySQL、Slack、 飞书、钉钉、Playwright 浏览器。MCP 面板新增「官方适配」卡片。
- 🖼 浏览器交互可视化:浏览器/截图工具返回的网页截图直接渲染在对话框的执行流程里。
- 🎨 界面美化:观测中心指标卡片化 + DAG 节点悬停提示;通用设置分组化。
- 🎨 各面板视觉打通:工具、技能、MCP、插件、知识库、专家市场、团队协作、 统计分析、任务历史此前各写各的样式,同一个"卡片"在不同页面里边距圆角字号都不一样。 现在统一成一套语汇(页头 / 卡片 / 徽标 / 统计块 / 空态 / 看板),并且空态会说清楚 为什么是空的、下一步该做什么,而不是只写"暂无数据"。
- 🏷 一眼看出能力从哪来:工具面板给每项标注 内置 / MCP / 插件,可按来源筛选与搜索;技能、插件同样区分 "随软件内置"与"你自己导入的"。工具图标不再被长描述挤出卡片。
- 🇨🇳 工具面板讲中文:工具说明原本是写给模型看的英文提示词,界面上排着 31 段英文没人会读。现在内置能力都配了中文名与一句话说明(原始英文标识符附在后面), 模型那一侧一个字没改。
- 🔢 统计数字不再自相矛盾:重启后统计页会同时显示"累计 Token 0"和 "编程模式 108,203 tk" —— 前者读的是重启即清零的内存计数器。现在两个数字出自 同一份历史记录,对不上都不可能。
- 🖥 命令行启动不再直接崩溃:中文版 Windows 的命令行窗口默认用 GBK 编码,
而界面里的方框线、✅ 这类符号它显示不了 —— 此前不是显示成乱码,而是
程序当场退出并甩出一串英文报错。按说明书敲
python -m automind.server或automind的用户, 第一步就会卡在这里。现在程序会自己把命令行切到能显示中文的模式 (退出时自动还原,不影响你在同一个窗口里跑的其它程序)。 - 🔑 只配了一家的 Key 也能直接用:软件出厂默认用 OpenAI 的模型, 但大多数人只填了 DeepSeek 的 Key,于是一打开就提示"模型连接失败", 却不告诉你要去哪儿改。现在会自动认出你填了哪家的 Key 并直接用它, 同时明确告诉你:"未检测到 OpenAI 的 API Key,已检测到 DeepSeek Key, 将使用 deepseek-chat"。你要是自己在设置里指定过某一家,则不会被擅自改掉, 只会提醒你 Key 还没填。
- 🔀 多个标签页同时跑任务不再互相干扰:此前所有并发任务共用同一份运行状态 —— 一个标签页在"对话"、另一个在"循环编程",模式会互相覆盖, 两边的上下文互相串进对方的对话,Token 统计也会被对方清零,而且没有任何提示。 现在每个会话都有自己独立的运行环境(共用的只是工具、技能这些只读部分, 所以几乎不占额外开销)。
- ⚡ 切换模式/模型不再卡 2~3 秒:此前在界面上点一下模式切换, 程序会把整个引擎重建一遍(重新扫描项目、重建记忆库、重新加载全部工具与技能), 而实际变化的只有一个模型名。现在只替换模型本身,点击即时生效(实测由 1.1 秒降到 1 毫秒以内)。
- 🚀 文件浏览与编辑不再拖慢全局:打开目录选择器、预览文件、 保存编辑器内容时的读写磁盘操作,此前会把服务端的主循环整个占住 —— 连正在逐字输出的对话也会一起卡住。现在这些操作都挪到后台线程。
- 📦
automind命令可用:此前照说明书敲automind会提示"不是内部或外部命令"。现在已随包安装,命令行用法与文档一致。 - 🔌 端口被占用会说清楚,不再让你看着旧版本发懵:如果已经有一个 AutoMind(多半是安装好的桌面版)在跑,新启动的那个其实根本没起来 —— 但屏幕上最后一句仍是"打开浏览器访问 http://127.0.0.1:8765"。你照做, 看到的是那个一直在跑的旧版本,于是以为"更新没生效"。现在启动前会先检查端口, 并直接告诉你:"端口 8765 已被占用,占用者 AutoMind v1.5.0(桌面版安装包); 现在用浏览器打开看到的是它,而不是你刚启动的 v1.5.2",并给出换端口的命令。
- 💬 聊天记录不再悄悄丢失:此前保存失败是完全静默的, 你下次打开发现对话没了也无从查起。现在会自动重试,仍失败则在界面上明确告知 (并提示检查磁盘空间与目录权限);不会因此中断正在进行的任务。
- ⏱ 任务卡住会自己停下:模型服务"连上了却不再回话"时,此前任务会 无限期挂着,界面停在"执行中"永远不动。现在单轮超过 5 分钟自动中止并说明原因; 执行期间每几秒刷新一次状态,显示"正在思考 / 正在生成回答 已 N 秒", 让你分得清"在想"和"挂了"。
- 🪙 Token 数实时更新:此前要等整段回答生成完才跳一次,长回答期间一直显示 0, 看起来像没在计费。现在每次模型调用结束就更新。
- 🛡 用量超预算会真正拦住:预算保护此前一直是空转的(代码建好了却从未被调用)。 现在用到 80% 会提醒并自动压缩上下文,用满则停止调用,不会无声无息地一直花钱。
- ⛔ 坏掉的工具不再反复重试:同一个工具连续失败 3 次即停用, 失败原因在对话区标红显示并附上连续失败次数 —— 此前它会一直重试到步数耗尽, 既慢又看不出发生了什么。任务开始前还会自检模型配置与目录权限。
- 🧭 计划出现循环依赖能自动化解:此前检测到循环却不做处理,任务会直接报错中止。
- 📊 办公四件套: Excel(读写表格、增删行、和 CSV 互转)、 Word(读取内容、生成文档、插入表格)、 PDF(提取文字、合并、拆分、旋转)、 邮件(发送邮件、收取和查看收件箱)。 直接说"把这个表格里的数据汇总成一份 Word 报告"就行。
- 🔧 通用五件套:联网搜索、网页/接口请求、 数据库查询、文件检索(按文件名或内容找)、 压缩解压(zip / tar.gz)。
- 🤝 协同三件套:桌面通知(长任务跑完弹窗提醒)、 日历(ICS 日程文件,Windows 上还能直接写进 Outlook)、 群机器人(钉钉 / 企业微信 / 飞书 / Slack)。
- 📦 按需安装,不臃肿:办公功能依赖的库不会随主程序一起装。
桌面版已内置;用 pip 安装的用户,第一次用到时会提示一行安装命令,
照抄即可(
pip install "automind-agent[office]")。 - 🔐 外发动作一律需要你点确认:发邮件、发群消息属于「发出去就收不回」的操作, 默认每次都要经过审批。另外刻意不提供群发功能(收件人上限 20 人)—— 能被 AI 驱动的无限群发就是垃圾邮件工具,专业版同样不会解锁。 邮箱密码只从环境变量读取,不会出现在任何记录里。
- 🛡 联网与解压的安全防护:网络请求默认禁止访问内网地址 (防止 AI 被网页内容诱导去读取你的内网服务或云端凭据); 解压会校验压缩包内的路径,防止文件被释放到目录之外。
- ⭐ 社区版与专业版的分界:分界线划在具体动作上,不是整个工具 —— 社区版能真正把表格读出来、把报告写出去。 进阶动作(Excel 样式美化、Word 模板套打、PDF 加水印与加密、 企业数据库读写)属专业版。
- 🚨 阻止外部网页通过 WebSocket 操纵本机:上一版收紧了跨站访问,但 WebSocket 走的是另一条路,不受那套规则约束 —— 也就是说,你访问的任何网页 仍可能在后台连上本机 AutoMind,让它执行任务、读写文件。现已改为 默认只接受本机页面的连接,外部来源一律拒绝并记录日志。 命令行与 SDK 调用不受影响;只在本机使用无需任何额外设置。
- ✅ 「询问」模式的最后两个漏口:上一版只补了一处,另外两条执行路径
(编程模式的 ReAct 循环、工作模式的计划执行)仍会在没有审批通道或
审批出错时直接放行 —— 需要你点「批准」的操作被悄悄执行了。现已全部改为
问不到人就不做,并在界面上说明原因。
若你希望无人值守运行,请把审批模式设为「自动」或「全批准」—— 这是明确的授权表达,而不是靠配置疏漏放权。 - 🌐 收紧跨站访问(重要):此前的配置会让你浏览的任何网页都能在后台 调用本机 AutoMind 并读取结果 —— 包括让它执行任务。而本地默认又不开鉴权。 现在默认只信任本机页面;需要其它来源请显式配置。
- 📁 目录浏览限定范围:选择项目目录时不再能浏览整块磁盘,只限
主目录、当前项目与已配置的工作区。实测
C:\下可见目录从 22 个收敛到 1 个。 - 🔑 开放到局域网时自动开启鉴权:以
--host 0.0.0.0启动而又没设访问令牌时, 系统会自动生成一个随机令牌并在启动信息里醒目打印(同时保存下来)。 只在本机使用则完全不受影响,无需任何额外操作。 - 🔒 IDE 接入配置接口:该接口会返回明文访问令牌,现在未设令牌时只允许 本机读取,并禁止被缓存。
- 🔒 代码沙箱重写(最高危):此前 Agent 执行的「Python 代码」能跑出沙箱,
读写你机器上的任意文件、甚至执行任意系统命令。已重写为三层防御:
执行前静态检查、受限运行环境、并放到独立子进程里跑。
另外修复了「超时不生效」——死循环代码此前会把程序卡住无法恢复,现在会被真正终止。
说明:沙箱防的是"AI 写出的代码越权",不等于可以放心执行来路不明的代码; 确有此需要请在容器/虚拟机中部署。 - 💉 修复测试技能的命令注入:运行测试时的文件匹配参数由 AI 填写, 此前会被当成系统命令的一部分执行,构造特殊内容可执行任意命令。现在改为 参数化调用(不经过命令行解释器)并做严格字符校验。
- ✅ 修复「询问」模式可能被静默跳过:审批通道出错时(最常见的是你关掉了页面), 系统此前会默认放行,等于「询问」模式悄悄变成了「全批准」。现在一律按 拒绝处理,并在界面上说明原因。命令行审批里「直接回车」也不再等于同意。
- 📁 收紧目录浏览接口:此前任何人都能通过接口列举本机任意目录。 若你把服务开放到局域网又没设访问令牌,等于把磁盘目录结构公开了。现在 未设令牌时只允许本机访问,并禁止浏览系统敏感目录。本机选择项目目录不受影响。
- 🩹 修复长会话把输入框挤出界面:消息一多,对话面板会被内容撑破容器, 消息区不再滚动、输入框被顶到视口之外彻底看不见。实测 80 条消息时面板高度 被撑到 11821 像素(可用高度仅 648)。已修复:同样 80 条消息下消息区 正常滚动、输入框稳定停在底部。
- 🔍 任务历史可搜索、可翻页:新增关键词搜索(任务内容与产出一起匹配, 命中处高亮)、模式筛选与成功/未完成筛选;列表改为分页(每页 20 条), 不再一次性把全部记录铺出来。另外,此前界面只能看到最近 50 条,而系统实际 保留 200 条 —— 剩下的记录够不着,现在都能搜到了。
- ⏱ 执行进度看得见:输入框上方新增一条轻量进度指示 —— 当前阶段 · 第 X / N 步 · 正在做什么 · 已耗时,右侧「查看详情」可直接跳到 观测中心看完整执行过程。解决"长任务跑着跑着,界面看起来像卡住了"。 对话与编程模式没有预先生成的计划,此时不显示编造的百分比, 改用流动条表示"正在进行、总量未知"。
- ✎ 消息编辑与删除:把鼠标移到任意气泡上,右上角会浮出操作条 —— 复制 / 编辑 / 删除。此前发错问题只能"复制原文 → 手动改 → 重发"。 编辑用内联输入框(Enter 发送、 Esc 取消),重发时会自动移除该条及其之后的消息, 因为问题都改了、基于旧问题的回答留着只会让上下文自相矛盾。删除有二次确认, 且只影响本地会话记录,不会回滚已产生的文件改动。
- 🔌 断线时看得见"正在重连":新增顶部横幅,显示重连倒计时与已尝试 次数,并可点「立即重连」跳过等待;顶栏状态徽标区分「⟳ 重连中」与「○ 未连接」; 重连成功会给出提示。此前断线只有一个不起眼的灰色「未连接」, 用户常常是发消息没反应才发现。
- ⚠ 任务执行中断线不再卡死:连接一断,本次执行的结果就送不回来了, 而界面此前会一直停在"执行中"、输入框永久禁用。现在会落一张失败卡片 (带重跑入口)并解锁界面。
- 🩹 「继续此任务」改名,避免误导:经核对,本软件没有真正的断点续传—— 检查点只在任务成功结束后才写,任务失败时并不会留下检查点。所以按钮改为 「▶ 检查现状后接着做」(重发任务并要求模型先核对已完成的部分)与 「↻ 从头重跑」,并注明:两者都会重新执行一次任务,已写出的文件不会被回滚。
- 🔢 修复升级日志里的退出码记错:可见模式重试安装成功时,安装日志却仍记录 为失败码,排查升级问题时会被带偏。现已修正。
- 🎨 界面精修:气泡改用双层阴影、悬停轻微抬起,头像加内描边,滚动条静止时 隐入,输入区聚焦时整条底栏提亮,数字统一等宽字形;并补上全局键盘焦点环, 纯键盘操作时能看清焦点位置。
- 🛠 修复升级后应用不再启动:桌面版是无控制台的 GUI 进程,升级脚本又以
分离方式启动,此前没有显式指定标准输入输出句柄 —— 脚本里的重定向和管道
全部失效,批处理在装之前就退出了,于是"应用退出、再也没回来"。现已修复,
并给脚本加了三重兜底:静默安装失败自动改用可见模式重试(装在
Program Files需要 UAC 提权)、安装前清理残留实例、 无论成败最后都把应用拉起来。安装日志与执行轨迹留在临时目录便于追查。 - ✍ 输入框草稿自动保存:打到一半切模式、切视图、关窗口,内容不再丢失, 重新打开自动回填(按会话与工作区隔离)。语音听写与模板填入的内容一并保护。
- 🎯 打开即聚焦:进入对话区、切换模式、任务跑完后自动把光标交还输入框, 省掉"先点一下输入框"这步;有弹窗时不抢焦点。
- ⧉ 自己发的提问也能复制:此前复制按钮只挂在 AI 回复上。同时改为复制 Markdown 原文(旧实现取气泡可见文本,会把复制按钮自己的图标一起带走), 并在非 HTTPS 环境下自动回退,局域网访问时复制不再失灵。
- 🚑 任务失败有了恢复入口:失败/中断从"一行红字"改为一张卡片 —— 可展开完整报错、▶ 继续此任务(从中断处续跑,不重做已完成部分)、 ↻ 重新执行、⧉ 复制错误,并针对 Key 失效、限流、超时、网络不通、 上下文超长等常见原因给出下一步建议。任务原文随卡片一起留存, 重启应用后依然能续跑。
- 📖 手册新增本章:更新日志现可在手册内直接查阅。
- 🔤 字号调节:85%~130% 无级调节,Ctrl + = / - / 0 可直接调,"标准"档与升级前像素级一致。
- ✨ 消除切换时的黑屏闪烁:对话面板改为常驻挂载、只切显示,DOM 不再重建, 顺带修复切回对话时滚动位置丢失;新增「减少动效」开关。
- ⌨ 完整快捷键系统:新增 19 项全局快捷键,按 ? 查看; 帮助弹窗内容由注册表直接生成,与实际生效的按键同源。
- 🔔 任务完成桌面通知:仅在窗口不可见时提醒,点通知跳回应用, 完成/失败/中断三种终态都会通知。
- 首个三平台同时发布的版本:Windows(代码签名)/ macOS(通用二进制 DMG)/ Linux。
- 修复 PyPI 元数据死链与许可字段。
- 兼容版界面补齐升级提示与检查更新入口。