Guide · 使用教程
Superwhisper 私密语音输入教程:从本地模型到跨应用写作工作流
从权限、纯转录基线、本地/云端模型、自定义模式和中英词汇开始配置 Superwhisper,并处理目标应用、历史、删除、备份、CLI/MCP 与故障回退。
这份教程要解决什么
Superwhisper 可以把语音输入带进邮件、聊天、笔记、浏览器、文档和代码编辑器,但“能开始说话”不等于已经建立可靠工作流。语音会经过麦克风、语音模型、可选语言模型、历史与目标应用;每一步都可能改变文本或扩大数据边界。
本教程从最小权限和纯转录基线开始,再逐步加入本地或云端模型、自定义模式、词汇和跨应用插入。目标是让用户知道数据去了哪里,出现问题时能判断是识别、后处理还是应用插入,并能回到已知可用配置。
上线前检查
截至 2026 年 9 月 8 日,官方下载页要求 macOS 13.3 或更高版本、Windows 10 或更高版本、iOS 18 或更高版本。先确认设备系统、可用存储、麦克风质量和公司设备管理政策。macOS 的本地能力最完整;Windows 可使用本地语音模型,但本地语言模型当前只在 macOS 提供。
准备十条非敏感测试句,包含姓名、产品名、数字、日期、邮箱、中英文和一次口头改口。建立一个临时文档接收输出,不要首次就对客户邮件、医疗记录、财务系统或代码仓库直接操作。
记录三个成功标准:原始转录事实错误不超过可接受范围;后处理不会改动数字和否定关系;目标应用插入失败时不会覆盖已有内容。还要明确哪些数据绝不能上云,哪些低敏感内容可以使用云端模型。
第一步:安装与权限
从官方 Download 页面下载安装。首次启动时按系统提示授予麦克风权限;如果要把文字插入其他应用,通常还需要辅助功能或相应输入权限。只授予实现当前测试所必需的范围,不要看到提示就一次性开放所有目录、屏幕和自动化权限。
在系统设置中记下 Superwhisper 已获得的权限。测试完成后逐项撤销再重新授权一次,确认团队知道恢复路径。公司设备如由 MDM 管理,应让 IT 通过批准的配置下发,而不是让员工绕过安全策略。
选择一个不会与 Spotlight、输入法、会议软件或截图工具冲突的快捷键。按键后确认录音状态有清楚反馈,结束后文字只进入临时文档。若没有反应,先检查快捷键冲突和辅助功能权限,再检查模型。
第二步:建立纯转录基线
先使用不调用语言模型后处理的 Voice 模式。它只把语音模型输出成原始文本,最适合判断麦克风、语言和识别模型是否正常。不要一开始就启用邮件润色或复杂提示,因为那会把识别错误与改写错误混在一起。
依次朗读十条测试句,每条保留音频或原始历史到校对完成。标记错误类型:漏词、同音词、数字、标点、语言切换、专名或目标应用插入。若同一专名反复错误,记录到词汇候选;不要为了一个偶发错误立即增加大量规则。
用短句、长段落、安静环境和普通背景噪声分别测试。目标是建立当前设备的基线,不是证明某个厂商准确率。若原始转录已经错误,调整麦克风、语言或语音模型;语言模型无法可靠修复未知事实。
第三步:选择本地或云端语音模型
本地语音模型让音频在设备上转录,适合敏感信息、弱网和希望可预测数据流的场景。代价可能是首次下载、存储、内存和设备性能。云端语音模型更省设备资源,也可能提供不同语言与速度,但音频会通过服务端处理。
决策顺序应从政策开始:音频是否允许离开设备?若不允许,选择本地语音模型;若允许,再用真实语言、口音和设备比较速度与错误。不要因为某个模型被标为“最高准确”就忽略延迟、硬件和隐私。
官方当前列出多种本地模型,并可能随版本变化。购买前在实际设备打开模式设置核对。下载后断网运行测试句,确认没有静默切换到云端;若断网失败,查看模式实际选择,而不是只看应用全局标签。
第四步:决定是否启用语言模型后处理
语言模型可以删除口头填充、整理段落、改变语气和生成结构,但也可能改动数字、否定、专名和承诺。对医疗、财务、法律、采访引语和代码指令,先保留纯转录;对普通消息、邮件和提纲,可在人工复核前启用后处理。
macOS 可以选择本地语言模型,使第二阶段也在设备上运行。Windows 当前没有本地语言模型支持;需要完全避免云端时,应使用 Voice 模式跳过后处理。使用云端语言模型时,记录具体提供商、账户和数据协议。
Superwhisper 表示内置云端 API 使用零数据保留协议且不用于模型训练。若使用 BYOK,数据处理由你与对应提供商的协议决定。BYOK 不是自动更安全:还要检查 API 日志、区域、保留、密钥权限、额度和撤销。
第五步:建立四个明确模式
第一个模式命名为“原样听写”。关闭语言模型,只做转录,不自动补充事实。它是所有问题的诊断基线,也是敏感内容和精确引语的回退路径。
第二个模式命名为“工作消息”。要求删除嗯、啊和重复句,保留事实、数字、否定和原有语气,把内容整理为两到三段,不新增承诺。先用内部低敏感消息验证,再用于外部沟通。
第三个模式命名为“邮件”。明确输出称呼、正文和结尾,语气专业简洁;要求不编造日期、附件、会议或行动项。口述时把收件人关系和目的说清,而不是让模型从当前应用猜测。
第四个模式命名为“长文提纲”。把口述整理成二级标题、要点、待核实事实和下一步,但不生成 Markdown H1。把“事实”和“想法”分开,便于后续查证。每个模式保持单一任务,避免一个巨大提示词同时做摘要、翻译、润色、事实核验和发布。
第六步:配置中英混合词汇
从真实错误建立词汇表。优先加入姓名、品牌、产品、技术缩写、客户项目和常见英文大小写,例如 API、MCP、Directus、Superwhisper。每个词保持标准写法,不要把整段说明放入词汇项。
测试“中文句子中夹英文产品名”“英文句子中夹中文姓名”“缩写后接数字版本”三类组合。词汇命中后仍要检查语言模型是否二次改写大小写。若错误来自后处理提示,修模式;若错误来自原始转录,修词汇或语音模型。
每月清理一次过期客户名和临时项目。官方说明自定义词汇与文本替换存储并处理在本地,但词汇本身也可能包含敏感信息;仍应遵循最小保留,不要把完整账号、病历号或密钥加入。
第七步:测试目标应用
依次测试纯文本框、富文本编辑器、网页表单、聊天工具、邮件编辑器和代码编辑器。每个应用检查短句、长段落、换行、列表、中英文标点、撤销和焦点切换。某些应用可能阻止辅助功能插入或把长文本截断。
常见问题
- Superwhisper 怎样实现完全本地语音输入?
- 在 macOS 模式中同时选择本地语音模型和本地语言模型,或使用无语言模型的 Voice 模式。Windows 可本地转录,但本地语言模型当前只在 macOS 提供。
- 为什么要先测试无 AI 后处理的 Voice 模式?
- 它能隔离语音识别与语言模型改写。若原始文本正确而最终输出错误,应修提示或语言模型;若原始文本已错,应修麦克风、语言、词汇或语音模型。
- 自定义词汇应该放哪些内容?
- 加入高频且反复识别错误的人名、品牌、产品和技术缩写。不要放完整账号、密钥或整段写作规则,并定期删除过期客户与项目名。
- 本地转录后把文字贴到网页还算本地吗?
- 不算完整本地闭环。文本进入 Gmail、Slack、ChatGPT、Notion、CRM 或其他网页后,就受到目标服务的账户、日志、保留和训练政策约束。
- Superwhisper 历史和 FileSync 会同步什么?
- 官方说明转录历史保存在本地;FileSync 同步模式与设置等配置,不包含转录内容或音频。仍需检查设备备份和自己的保留删除策略。
- 使用 Superwhisper CLI 或 MCP 要注意什么?
- 它们可搜索和导出本地历史,会扩大访问范围。应使用最小权限、目的地白名单、预览、人工批准和幂等控制,不让自动化直接发送敏感内容。