ObsiKO ObsiKO 帮助文档

AI 代理

一个人写东西很孤单吧?来认识一位会陪你一起读笔记、写笔记、整理笔记的聪明 AI 朋友!

💻🆚📱 这份文档介绍的完整代理(安装 CLI + 登录,从资料搜集、语义搜索到生成思维导图)仅限从 ObsiKO 官网下载的桌面版(Mac、Windows)。不过现在多了只要填入 API 密钥就能用的纯对话模式,所以在 iPhone、iPad、Android、浏览器、Mac App Store 版上也能和 AI 对话、整理笔记!→ 16-8 纯对话模式(移动版、网页版)

🪟 Windows 只要是从 ObsiKO 官网下载的应用程序,就能照这一页使用 — Claude、Codex 代理、连接外部 AI 应用程序 (MCP)、git 都行。唯一的例外:Windows 上看不到 Gemini 代理引擎(请看下面的“引擎”— Gemini 可以填入 API 密钥、改用对话引擎)。Mac App Store 版的 AI 是纯对话(没有 CLI 代理、git、连接外部 AI 应用程序)→ 16-8 纯对话模式(移动版、网页版)

🚀 想直接上手? 下面的应用子页面 (16-1~16-12) 会一步一步教你工作流程、LLM 维基、推荐提示词,一直到纯对话模式!

💳 搞不清楚哪些要付费(额度)、哪些是订阅? 从 ⓒ 标记的意思到申请 API 密钥 → 16-9 AI 收费说明(订阅与额度)

← 回首页:ObsiKO 101

🎬 跟着做:连接 AI — 电脑与手机两条路(韩文页面)


它藏在哪里?🧐

AI 代理对话面板
▲ 在右侧面板和 AI 助手对话,一起整理笔记。(这一页的完整代理仅限桌面版;纯对话模式在网页版、移动版也能用)

随你挑选的 AI 引擎 🧠

安全第一!ObsiKO 的严密保护 🛡️

越用越顺手的功能 ✨

自己检查、自己修正的“循环”🔁(仅限 Claude)

写一次就结束?才不是!现在代理会跑一个聪明的循环,自己检查刚写好的笔记并再次修正。开关在面板的选项 (≡) 按钮 →“循环”类别。

每次循环介入时,对话里会用 🔁 一行字告诉你“跑了什么检查、第几次”。评论者检阅期间,状态栏也会显示“检阅结果中”。

💡 这个循环仅限 Claude 引擎(Gemini、Codex 会自己一路做到完成)。

大工作拆开同时做 — 平行分工 🔀(仅限 Claude)

像“调查 10 个主题并各做成笔记”这种大型工作,一个一个照顺序做会很久。打开选项 (≡) →“多引擎协作”类别里的“平行分工”,代理就会把工作拆成 2~8 个独立的子任务同时进行(一次 3 个),最后再汇总结果。

⚠️ 好几个运行同时跑,Token 可能用掉好几倍。建议只在大量搜集资料、批量整理这种真正的大工作时才开!默认关闭,仅限 Claude 引擎。

用 Canvas 画给它看 — 照着画的做 🗺️

既然能请 AI 画思维导图,反过来应该也行吧? 把文件夹结构或工作计划在 Canvas 上随手画出来,附给代理当参照,再说“照这张 Canvas 的结构帮我创建/整理/进行”。

💡 文件移动只有 Claude 引擎做得到(Gemini、Codex 只能新建)。Canvas 的画法请看 11 思维导图!

还原 AI 改过的东西 — 变更记录 ⏮️(虚拟工作树)

“咦?AI 改的我不喜欢,能不能变回原样?”现在可以了!代理每次创建或修改文件,都会以每次运行为单位保存“变更前/后”,随时都能比较并还原。这是不懂 git 也能用的轻量“虚拟工作树”。

💡 能还原的是文字文件(笔记、Canvas、代码等)。图片、PDF 这类大文件不在比较/还原范围内。

变更前先检阅 — 先在工作副本上做 🧪(桌面版)

“想在 AI 改我的笔记之前,先看看它要改什么”— 现在默认就是这样。AI 面板选项 (≡) 里的“变更前先检阅”(默认打开)打开时,Claude、Codex、Gemini 代理会在笔记的工作副本(应用程序内部的文件夹,只有文字文件)上工作,结束后回答下方会出现检阅卡片。

代理设置都在面板里!⚙️

以前散落在设置窗口里的 AI 代理设置,现在都整齐地集中到面板标题栏的选项 (≡) 按钮这一个地方了。
- 最上面的开关:“自动累积个人化记忆”“把对话原文记录到笔记库”“放宽 Gemini 内容过滤”,还有“允许发送到外部 AI”清单(这四个在纯对话引擎也会出现 — 因为过滤设置会应用到对话、图片生成、朗读、转录发出的所有 Gemini 调用。打开时会跳出注意事项的确认窗口,再确认一次。→ 16-11 记住的事 · 发送许可请看 → 16-10 AI 依据与隐私)
- 接下来的开关(桌面版 CLI 引擎时):“把回答保存为 .md 文件”“变更前先检阅”“代理 Token 优化”“在受保护的笔记库阻挡绕道引擎”“工作完成报告”“把 obsiko 工具连给 Codex”
- “在受保护的笔记库阻挡绕道引擎”(默认关闭):在有 ai: deny 笔记的笔记库里,直接不让 Gemini、Codex 运行(关闭时照样运行,只提醒一次)。用“变更前先检阅”工作时,被挡的笔记根本不在副本里,所以不需要阻挡。→ 16-10 AI 依据与隐私
- “把 obsiko 工具连给 Codex”打开时也会跳出注意事项的确认窗口 — 因为它可能影响到笔记库外面。
- 两个直接运行的按钮:“创建语义索引”(一次建好语义搜索索引)、“保存对话摘要”(把当前的对话摘要成笔记)
- 可收起的类别:“循环”(参考上面)、“多引擎协作”、“git”(自动提交、远程、push)、“语义搜索的嵌入”(后端、模型)
- 多引擎协作 🤝:三个引擎(Claude、Gemini、Codex)互相帮忙 — 打开“问问其他引擎(咨询工具)”,工作中的引擎卡住时就能问其他引擎的意见(用 ask_gemini 这类工具);打开“平行草稿与集成”,其他引擎会先各写一份草稿,再由主引导擎交叉验证并集成。质量会提升,但 Token 也会多用那么多。(“平行分工”开关也在这个类别 — 请看上面的平行分工段落!)
- 再下面:“引擎 API 密钥”输入栏(留空就用登录/订阅)
- Token 用量 📊:每个密钥输入栏下方会累计在这个应用程序里用掉的输入、输出 Token 总数。不只对话,代理的运行(Claude、Gemini、Codex)也会算进去,随时可以用 [重置] 从 0 重新计算。(这不是供应商的账单仪表盘,只是 ObsiKO 里用量的参考。)
- 按各条目名称旁的“?”,说明就会在那个条目正下方展开(再按一次收起)。用鼠标的话移上去就看得到,手机、平板上轻点击就好。📱

各种数据都变成 .md — 网页、视频、文档、图片、数据 📥

代理不只会搜索,还能读各种格式的数据、做成笔记(桌面版)。Claude 全部都能用,Gemini、Codex 也能用大部分的工具(Codex 要打开“把 obsiko 工具连给 Codex”— YouTube、PDF、文档、转录、RSS、表格、文档内容搜索、语义搜索、图谱,还有图片生成、朗读 (TTS) — 请看下面的图片与朗读段落)。不过看图片、扫描 OCR 仅限 Claude。

🌐 网页、视频
- 用网络搜索搜集资料:给它一个主题,就会搜集网络搜索结果(标题、摘要、日期)整理成 .md,像“帮我整理○○的最新消息”(文件名、标题前会自动加上日期 YYYY-MM-DD)。为了稳定,一页一页直接打开来读的方式默认是关闭的,会根据搜索结果来撰写。
- 整理 YouTube:给它视频网址,就会抓字幕(逐字稿)做成 .md。(只限有字幕的视频。装了 yt-dlp 会更稳定 — 没装也能用)
- RSS/新闻订阅:给它订阅网址,就会把最新条目(标题、日期、链接、摘要)整齐地汇总成一份摘要报。

📄 文件、文档(笔记库里的文件,或拖进对话的附件)
- PDF(文字体):“帮我整理这份 PDF”→ 逐页截取文字来摘要、整理。
- PDF(扫描、图片型):就算是文字变成图片的扫描件,也会把页面转成图片,直接看着读 (OCR) 再抄写下来。(需要安装 poppler — 免费:macOS brew install poppler、Windows scoop install poppler。一次最多 8 页,很长的话就像“先做第 1-10 页”这样分段请它做。仅限 Claude 引擎。)
- 图片:扫描文档、手写字、图表、照片里的文字,它会直接看着抄下来或帮你说明(不必另外安装 OCR)。
- Office、电子书:把 Word、PowerPoint、ODT、EPUB、RTF、HTML 等转成 Markdown。(需要安装 pandoc — 免费)
- 语音、视频转录:没有字幕的课程、Podcast、录音、视频都能听写下来。现在是用云端 API(OpenAI、Gemini)转录,所以不装 whisper 也行(本机有装 whisper 的话会优先用它)。视频优先用 Gemini,语音优先用 OpenAI。(不通过代理的话,也能直接在文件总管右键点击 →“语音、视频 → 笔记(转录)”,或用命令面板 →“转录语音、视频(成笔记)” — 所有平台都行。在 iPhone、iPad 上,语音文件会在设备里免费转录,不需要密钥。视频或其他设备则用 OpenAI、Gemini 密钥。)
- 表格数据:把 CSV、TSV、JSON 文件变成整齐的 Markdown 表格。
- 文档内容搜索:不只一般笔记,连 PDF、Word、Excel、Hangul (.hwp/.hwpx)、CSV、JSON、文本文件等文档的正文都会翻找,回答“帮我找有提到○○的文档”。

🔧 查找应用程序用法、属性
- 搜索应用程序用法:像“ObsiKO 怎么导出 PDF?”这样问应用程序的用法时,代理不会用猜的,而是直接搜索这份帮助维基 (ObsiKO 101),根据内容回答。(和找你自己笔记的笔记库搜索是两回事。)
- 用属性找笔记:把前置元数据的属性当成数据库来条件搜索 — “status 是进行中的项目笔记清单”“type: book 而且 rating 4 以上”。可以用文件夹、标签、属性条件 (AND) 筛选,还能排序。问到 .base 表格时,会直接沿用那张表的条件来查找。→ 12 Bases(数据表)

💡 pandoc、yt-dlp、poppler 都是免费工具(转录现在能用云端 API,所以 whisper 是选用的)。就算没装,应用程序也照常运作,只有在你要用那个功能时,才会跳出一行安装说明。
🛡️ 安全为上:文件只读笔记库里的 + 你附上的,网络数据会挡掉私人/内部网络地址,安全地抓取。没有字幕、没有文字时,也会老实告诉你“没有”。

也会画图、也会出声 — AI 图片生成与朗读 🎨🔊

不只会读、会写,现在还能画图、把文字念出来!这两个功能只要有 API 密钥,桌面版、iPhone、iPad、Android、网页版都能用(OpenAI 或 Gemini 密钥 — 设置里的对话 API 密钥)。

🎨 图片生成(文字 → 图片)
- 在对话里说“帮我画○○”,代理就会画好图、保存到笔记库的 assets/ 文件夹,并放进笔记。
- 或是在正文选中描述文字 → 右键点击 →“✨ AI 创建”,选“🎨 制作图片 · OpenAI”或“🎨 制作图片 · Gemini”,就会根据那段文字做出图片,插在选中文字的正下方。
- 用参考图来画(草图 → 完成图) 🖍️:把草图或照片附进对话,说“照这张草图帮我画”,就会保留原图的构图和线条来完成 (image-to-image)。拿 Canvas 上随手画的底稿来上色、完稿时最好用。
- 画人物、角色时,会自动留好空间,不让头顶被切掉。
- ✨ 制作标题标志:右键点击 → ✨ AI 创建 →“制作标题标志” — 以选中的文字(没选就用笔记标题)当文案,挑选 10 种风格(极简、手写、霓虹、复古、3D、水彩、网络小说、游戏、视频、书籍)与背景(单色/透明/插画),再选模型、写补充指示,就会做出漂亮的标题标志放进正文。透明背景仅限 GPT Image 模型(真正的 alpha PNG)。文案(尤其是中文)越短越准确!

AI 图片生成 — 正文右键菜单与插入的图片
▲ 选中描述文字后右键点击 →“✨ AI 创建”▸“🎨 制作图片”。做好的图会刚好放进选中文字的下方。

🔊 朗读 (TTS) — 免费聆听、制作语音文件,两条路

正文的右键菜单里有专属的“🔊 朗读 ▸”群组(没有选中文字时会显示成“🔊 朗读整篇笔记”,念出整篇笔记)。底下有三项 — 设备语音(免费)、OpenAI、Gemini。

① 用设备语音马上听 🆓(不用密钥)
- 右键 ▸“🔊 朗读”▸ 设备语音,或命令面板的“朗读笔记(设备语音)”。用 Mac、Windows、iPhone、Android 内置的声音马上念给你听 — 不用 API 密钥、不用安装、也不花钱。
- 因为这个模式不产生文件,播放栏也会跟着改变:没有跳转(拖动进度),改成显示句子进度(2/13 句),只留播放/暂停、速度、声音、句子醒目提示。暂停后再继续,会从那一句的开头接着念。就算是手机这种窄屏幕,播放栏也永远只有一行 — 空间不够时,会先收起时间、标签这模拟较不重要的东西(免得挡住两行正文)。
- 前后跳一句 ◀◀ ▶▶:播放按钮两侧的按钮会一句一句倒回、跳过(朗读的单位是句子,所以按一次 = 刚好一句,换段落的地方也就是下一句)。停住时按下去也不会突然出声 — 只会移动位置,正文的醒目提示和 2/13 数字会跟着走。没有地方可去时(最前面、最后面),按钮会变淡。
- 挑声音:播放栏的清单只会列出设备上已安装、该语言的声音(Eddy、Grandma 这类英文名字、机器人风格的趣味声音会排除)。播放中换声音,会从那一句开始用新声音接着念,选好的声音也会记住。
- Android 上会显示成 声音 1 · 声音 2 … — 因为 Android 不提供声音名称(只给内部代号),所以由应用程序编号。同一个声音的离线/在线版本会合成一行,只有需要网络的会标上 · 在线。还没下载的声音选了也不会出声,所以不列进清单。编号会记在设备上,之后再下载更多声音,原本用的编号也不会跑掉。
- ? 说明:按播放栏上的 ? — 会出现这个模式不会保存为文件的说明,以及在系统设置下载新声音后,也会直接加进这份清单的小提示。路径只显示你现在用的设备(Mac、iPhone:辅助使用 ▸ 语音内容 ▸ 声音/Android:设置 ▸ 无障碍 ▸ 文字转语音 ▸ 语音数据)。下载后把应用程序关掉再重新打开最保险。
- 刚打开应用程序时,设备有时会比较晚才回报声音清单(尤其是 iPhone)。这段期间只会看到“自动(设备默认)”,其余的准备好就会悄悄补上 — 这时朗读也照样正常。
- 夹在中文里的英文也念得对:很多设备的非英文声音遇到英文单词,会一个字母一个字母拼着念;所以句子里只有英文的片段会交给英文声音接手朗读(自动、不用设置)。接手的英文声音会跟着你选的声音性别 — 选男声,英文也由男声念;选女声就是女声(前提是设备上有该性别的英文声音)。
- 句子醒目提示 🖍️ 也照样有 — 因为是一句一句直接念,反而比 AI 朗读对得更准(用高亮图标开关)。

② 做成语音文件 💳(AI 朗读 — OpenAI、Gemini 密钥)
- 右键 ▸“🔊 朗读”▸ 选 OpenAI 或 Gemini,就会把那段文字做成语音、保存到 assets/,插入 [🔊 听朗读] 链接后马上播放。请代理“念这篇笔记给我听”也是走这条路。Gemini 密钥用免费方案也能用(在额度内 — Gemini 价目表 ↗)。
- 在播放栏可以调整选声音、试听、播放/暂停、跳转、速度 (0.75~2×)。默认声音在设置的“语音设置”块决定,也可以像“用○○的声音念”这样直接指定。
- 长文也能很快开始:会把文字切成好几段,第一段一准备好就开始播放,后面的部分在你听的时候接着做。进度条长度带着 + 一直变长,就表示“后面的段落还在制作中”!
- 朗读句子的醒目提示 🖍️:播放时,编辑器里正在念的句子会有淡淡的高亮跟着走,画面也会一起滚动。可以用播放栏上的高亮图标开关。需要更精准的同步,就打开设置里的“朗读精准highlight同步”(使用 whisper 重新转录 — 需要 OpenAI 密钥,会有额外费用)。

播放不会中断(两条路都一样)— 朗读中切到别的笔记、或去看仪表盘,声音也会继续。这时播放栏会显示 🎧 笔记名称,告诉你现在正在念什么,点击就回到那篇笔记。回到原本的笔记后,句子醒目提示会接着出现;修改原文的话,只有醒目提示会悄悄关掉(播放照常)。

没在听就会自己消失 — 在暂停、念完、或还没选声音的状态下离开那篇笔记,播放栏会自动关闭(免得孤零零地留在别的画面)。待在正在朗读的笔记里时就会保留。

AI 朗读播放栏
▲ 编辑器下方的播放栏 — 选声音、试听、播放/暂停、跳转、速度、句子醒目提示开关,全在一行里。

💡 图片生成、朗读、转录是用多少、就由各供应商 (OpenAI/Gemini) 计费多少的 BYOK(自备密钥)功能。没有密钥时会跳出说明。(例外:用设备语音聆听和 iPhone、iPad 的语音转录都在设备里免费进行。)

更聪明的搜索 — 语义搜索与图谱 🔎🕸️

关键词要一字不差才找得到的时代结束了!代理会用意思找,再顺着链接结构扩大范围。

打开方法(语义搜索需要先准备一次免费的嵌入引擎)

在面板的选项 (≡) 按钮 →“语义搜索的嵌入”类别(桌面版)可以选择后端(自动侦测/Transformers.js/Ollama)与模型名称。(图谱搜索不用另外安装 — 马上就能用!)

在 Mac 上不用密钥 — 设备 AI (Apple Intelligence) 🍎

只要是 macOS 26 以上、打开了 Apple Intelligence 的 Mac,不用 API 密钥也不用登录,就能在 Mac 里使用简短的 AI 功能。文字不会离开 Mac。

不用安装就能用的助手命令 🎁

不用另外安装,一开始就内置好了。在输入框只要打 /,就会跳出各领域的助手!(在繁體中文界面,这些命令会以英文名称显示;像下面这样只打开头几个字也会自动完成。)
- 写作 — /draft /compose /craft /edit /revise /worldbuild /roleplay(化身角色设置笔记里的人物,来一场情境剧对话 — 试着打 /roleplay 角色名称,情境!)
- 读书 — /studynote /summarize /quiz /example /errorlog /lecturenote /studyplan /homework
- 资料搜集、论文 — /gather /excerpt /paper /litreview /factcheck /synthesize(这些助手禁止没有出处的断言,不知道就会说不知道!)
- 给 AI 的文档 — /aidoc /claudemd /skill /command /persona /harness
- 卡片盒笔记法、知识本体 — 用 /permanent /connect /classify /relate /atomize /attribute 等命令把知识结构化!→ 详情:17 知识结构化
- 项目 — /projectsetup(说出类型或主题,像“帮我建一个网络小说连载项目”,就一次建好文件夹、项目 Base 和基本笔记)

命令名称会跟着应用编程语言(韩文、英文、日文)改变,繁體中文界面则显示英文名称;用其他语言的名称打也听得懂。😊

一键创建 LLM 维基 📚

给开发者的 Git 自动集成(选用)🐙

从其他 AI 应用程序使用我的笔记库 — 连接外部 AI 应用程序 (MCP) 🔌

除了 ObsiKO 里的代理,也可以请 Claude Desktop、Cursor、VS Code、Claude Code、Codex CLI 这些其他 AI 应用程序“从我的笔记里找找看”。
- 打开设置 ▸ 连接外部 AI 应用程序,在你用的应用程序卡片上按一次 [连接] 就好。把那个应用程序重新打开,就会看到 ObsiKO 的工具。
- 要开放哪个笔记库由你自己选(最多 3 个)。切换窗口也不会偷偷改掉。
- 只读 — 只能搜索、读取,不能写入或删除。用 ai: deny 藏起来的笔记在这里也一样排除。
- 在从官网下载的桌面版(Mac、Windows)可以用(Mac App Store 版没有)。默认关闭。详情请看 → 23 设置与主题

高级 — 把其他 MCP 服务器接到 ObsiKO 的代理:反过来,也能让 ObsiKO 的 Claude 引擎使用其他 MCP 服务器的工具。在电脑的家目录创建 ~/.obsiko/mcp-clients.json,写成 {"servers": {"名称": {"command": "运行命令", "args": ["…"], "env": {}}}} 的格式,下次运行起就会一起接上那个服务器。放在家目录而不是笔记库,是为了不让别人通过同步的笔记库偷塞命令(名称 obsiko、qmd 不能用)。


🚀 进一步了解用法(子页面)

这些子文档会一步一步更深入地介绍实战工作流程。建议从上往下依次阅读。
- 16-1 基本用法 — 好好使唤它的基本功 + 小诀窍
- 16-2 情境应用示例 — 写作、读书、研究、结构化、转换、思维导图
- 16-3 写作与创作应用 — 6 种分阶段的写作助手
- 16-4 打造 LLM 维基 — 创建知识库 + 像 NotebookLM 一样使用 + 可读取的文件格式
- 16-5 卡片盒笔记法与知识本体 — 把笔记变成相互链接的知识
- 16-6 推荐提示词集 — 复制就能用的提示词
- 16-7 提示词助手 — 用块组提示词 + 创建框架(规则、命令)
- 16-8 纯对话模式(移动版、网页版) — 只靠 API 密钥在 iPhone、网页上用 AI(网络搜索、看图片、整理笔记)📱
- 16-9 AI 收费说明(订阅与额度) — 哪些是订阅、哪些是额度,一直到申请 API 密钥 💳
- 16-10 AI 依据与隐私 — 确认回答的出处([S1]、依据清单)与指定不让 AI 看的笔记 🔍🔒
- 16-11 记住的事 — 让 AI 长久记住你的价值观、判断标准、项目脉络(手动、自动)🧠
- 16-12 写作助手 — 结构检查 + 让思考更深入的提问 + 10 种类型镜头的编辑式批改 ✍️


← 上一章:15-2 例行流程 · 回到首页 · 下一章:16-1 基本用法 →