🔍 OCR 文字识别
快速识别图片中的文字并复制到剪贴板。

入口与触发方式
| 入口 | 说明 |
|---|---|
| 快捷键 Ctrl+O | 可在 设置中心 → 快捷键设置 → 🤖 AI功能快捷键 → 📝 文字识别 (OCR) 里修改,清空即禁用 |
| 工具栏「文字识别」 | 截图编辑窗口工具栏上的按钮 |
| 图片查看器「OCR识别」 | 对当前打开的图片做文字识别,识别中按钮变为「识别中...」 |
触发时的行为:
- 编辑窗口已打开:直接对当前这张图执行文字识别。
- 没有编辑窗口:先进入截图选区,选完区域后立即执行识别,不会先跳到编辑窗口。所以 Ctrl+O 本身就是「截图 → 直接 OCR」的快捷用法。
- 选区里如果另外选了标注工具,则不会执行 AI 动作。
服务优先级
设置中心 → 🤖 AI 服务配置 → AI 服务来源里的三个复选框可以多选,优先级固定为:
| 优先级 | 服务 | 说明 | 默认 |
|---|---|---|---|
| 1 | 仅本地OCR(离线识别,无需联网) | 勾选后文字识别只走本地 OCR(优先级最高) | 开启 |
| 2 | 自定义 AI / 百度 OCR | 使用自己的 API Key,配置自己的大语言模型和特定服务 | 关闭 |
| 3 | Pixwit AI | 云端 AI 服务,功能完整,无需配置 | 开启 |
服务优先级不是「PixWit AI 优先」
只要勾选了「仅本地OCR」,文字识别就优先走本地 OCR,而不是云端。三项都没有启用时会提示「OCR 不可用 / 请勾选「仅本地OCR」或启用云端 AI 服务」。
OCR 结果窗口
OCR 结果窗口没有按钮栏,所有操作都在右键菜单里:
| 菜单项 | 说明 |
|---|---|
| 📋 复制选中 / 📄 复制全部 | 复制选中的文字 / 全部文字 |
| 📋 复制全部文本 | 复制纯文本 |
| 💾 保存图片 | 保存当前图片 |
| 📝 切换到纯文本(可编辑) / 🌐 切换到HTML(保留格式) | 切换文本视图 |
| 📌 窗口置顶 | 切换置顶(默认按设置里的「OCR结果窗口默认置顶」) |
| 📐 排版 | 清理行首行尾空格 / 清理多余空行 / 合并为段落 / 按标点换行 / 中文标点修正 / 删除空格 |
| ↺ 重置布局 | 恢复默认布局 |
| ✕ 隐藏图片 / 📷 显示图片、≡ 隐藏文本面板 / ☰ 显示文本面板 | 在图片区右键可折叠左右两栏 |
窗口快捷键:
| 快捷键 | 功能 |
|---|---|
| Ctrl+C | 复制(随后自动关窗) |
| Ctrl+T | 切换置顶 |
| Esc | 关窗 |
📷 插图占位(图 1)
OCR 结果窗口右键菜单 — 展示结果窗口展开的右键菜单:复制选中/复制全部、排版子项、窗口置顶、重置布局、隐藏图片/隐藏文本面板 补图:图片放到 docs/public/images/ocr-result-menu.webp,然后删除本提示块并打开下一行注释
点图复制
- 直接点击图片上的某一行文字,该行文本会被复制到剪贴板,并出现绿色高亮框与
✅ 已复制。 - 窗口首次打开时会提示一次「💡 点击图上任意一行即可复制该行文本」。
📷 插图占位(图 2)
点图复制高亮 — 展示点击图片中某一行文字后的绿色高亮框与 ✅ 已复制 提示 补图:图片放到 docs/public/images/ocr-click-to-copy.webp,然后删除本提示块并打开下一行注释
识别完成与识别中
- 识别完成后会自动把整段结果写入剪贴板,并提示
✓ 已复制 N 行到剪贴板。 - 识别过程中屏幕原位会显示进度浮层(
正在识别...);按 Esc 或点击浮层即可取消。 - 上一轮没结束就再次触发,会提示「OCR 正在处理中」。
本地 OCR 模型
设置中心 → AI 服务配置 → 本地 OCR 模型提供模型变体下拉、下载 small 按钮,以及显示 tiny / small 安装与生效情况的状态行。
| 选项 | 说明 |
|---|---|
| 自动(推荐) | 已下载 small 时用 small,否则用内置 tiny(默认) |
| tiny(内置,快速) | 随安装包内置,约 6MB |
| small(高精度) | 约 31MB,需点「下载 small」下载一次,之后可离线使用 |
- 模型切换需要重启程序后生效。
- 首次使用本地 OCR 若还没有模型,会提示下载「OCR 模型(约 31MB)」。
📷 插图占位(图 3)
本地 OCR 模型设置 — 展示 AI 服务配置页里的模型变体下拉(自动 / tiny / small)、「下载 small」按钮与 tiny/small 安装状态行 补图:图片放到 docs/public/images/ocr-local-model.webp,然后删除本提示块并打开下一行注释
OCR 设置
设置中心 → AI 服务配置 → OCR 设置:
| 设置项 | 说明 | 默认 |
|---|---|---|
| 不显示窗口,自动复制到剪贴板 | 从截图编辑窗口和图片查看器触发的 OCR 不再弹结果窗口,改为静默复制 | 不勾选 |
| 不显示「OCR 识别完成」托盘提示 | 静默复制完成时不再弹右下角系统通知(识别失败的提示仍会弹);需先勾选上一项 | 不勾选 |
| OCR结果窗口默认置顶 | 新打开的 OCR 结果窗口自动置顶 | 勾选 |
「不显示窗口,自动复制到剪贴板」只影响从编辑窗口 / 图片查看器触发的路径;快捷键直连的 OCR 路径不受该选项影响。静默复制完成时默认会弹一个
OCR 识别完成右下角系统通知,不想要就勾上「不显示「OCR 识别完成」托盘提示」。
当前 OCR 通道
AI 服务配置页下方会实时显示「当前 OCR 通道」,例如 本地OCR(模型:tiny)、自定义 AI / 百度 OCR、Pixwit AI 云服务,可用来确认本次识别实际走的服务。
LaTeX 公式识别
- 入口:快捷键 Ctrl+M、工具栏「提取LaTeX公式」。
- 仅 PixWit AI 支持;未启用时提示「LaTeX公式识别功能需要启用 PixWit AI 服务」。
- 识别由多模态视觉模型完成,提示词要求只输出 LaTeX 源码(不带 Markdown 围栏、不带
$定界符),多个公式每行一个;没有公式时提示「未能识别到公式」。 - 结果复用 OCR 结果窗口显示,标题为
LaTeX公式提取,复制方式与 OCR 相同(识别完成也会自动写入剪贴板)。
二维码 / 条形码识别
- 入口:工具栏「识别二维码/条形码」(没有可配置的快捷键)。
- 识别是即时的,不显示进度浮层。没有识别到内容时提示「未检测到二维码或条形码」。
- 识别到内容后会:在 OCR 结果窗口里显示(多条结果带
[1]、[2]序号)→ 自动把第一条复制到剪贴板 → 关闭截图编辑窗口。
各服务能力对照
| 功能 | 仅本地 OCR | PixWit AI | 自定义服务 |
|---|---|---|---|
| 文字识别 | ✅ | ✅ | ✅(百度 OCR,或自定义 LLM 的多模态能力) |
| 翻译 | 仅作为识别步骤 | ✅ | ✅(需配置自定义 LLM 服务) |
| 表格提取 | ❌ | ✅ | ✅(百度表格识别优先) |
| LaTeX 公式 | ❌ | ✅(唯一支持) | ❌ |
| 智能解读 | 仅作为识别步骤 | ✅ | ✅(需配置自定义 LLM 服务) |
| AI 对话框 | ❌ | ✅ | 需「多模态模型」 |
常见问题
Q:OCR 识别不准 / 无法下载模型?
- 本地 OCR 首次使用需要下载模型;可在 设置中心 → AI 服务配置 → 本地 OCR 模型 里切换
tiny(内置、快)与small(更准),或下载small模型。切换模型后需要重启程序生效。 - 也可以改用 PixWit AI 或百度 OCR 云服务。
Q:识别时报「OCR 不可用」?
- 到 设置中心 → 🤖 AI 服务配置 → AI 服务来源 勾选「仅本地OCR」,或启用云端 AI 服务(自定义 AI / 百度 OCR、Pixwit AI)。
AI 服务配置的入口
AI 服务配置在设置中心里(托盘右键 → 设置中心... → 左侧导航 🤖 AI 服务配置)。程序里有些旧提示文案仍在引导用户去「系统托盘菜单」找 AI 服务配置,那是过时的,请以设置中心为准。