在 Mac 上用说话代替打字的中文输入法(type4me)
type4me 是一款 macOS 语音输入法,用 Swift 编写,MIT 许可证,把麦克风里的语音识别成文字并可选经过大模型整理,内置 8 种模式、支持 15 家云端识别服务商。这篇文章讲清云端版与本地版的差别、安装与配置路径、结果落在哪里,以及本地引擎内存占用、模型选择等真实限制,帮你判断它是否适合自己的 Mac。
在 Mac 上把想法变成屏幕上的文字,除了键盘还有一条路:说话。type4me 覆盖这条路上的整串环节,麦克风拾音、语音识别、按需的大模型整理,最后把结果写进当前接收键盘事件的位置。识别引擎与文本处理引擎被拆成两段可替换的部件,前者决定听清到什么程度,后者决定输出长什么样。
type4me 是用 Swift 写的 macOS 语音输入法:输入麦克风语音,输出整理后落到当前光标位置的文字,也能执行常见系统操作,识别可选云端或本地引擎。
它面向每天要打大量中文的 Mac 用户,写消息、写邮件、写文档、写需求和 Issue 的人都在其中。新安装默认给 8 种模式,快速模式只做转写,智能感知把口述整理成更像打出来的句子,翻译模式边说边出目标语言,随便问和 Mac 操作把语音当指令用。官方提供云端版与本地版两个安装包,两者共享配置文件,可以随时替换安装。
五分钟先跑通
系统要求 macOS 14(Sonoma)或更高。仓库地址是 https://github.com/joewongjc/type4me,采用 MIT License,主要语言是 Swift。截至 2026 年 10 月初的仓库数据是 1475 star、177 fork、15 个开放 Issue。
官方只提供 DMG 安装包,README 里没有命令行安装或从源码编译的步骤。两个版本共用一套配置文件,装了哪个都能换成另一个。
https://github.com/joewongjc/type4me/releases/download/v2.10.0/Type4Me-v2.10.0-cloud.dmg
https://github.com/joewongjc/type4me/releases/download/v2.10.0/Type4Me-v2.10.0-local-apple-silicon.dmg
云端版约 10MB,Intel 与 Apple Silicon 都能装,语音识别和大模型都要自己填 API Key。本地版约 700MB,只支持 Apple Silicon,内嵌 SenseVoice 与 Qwen3-ASR 两个本地识别引擎,官方给出的内存占用约 8GB,建议机器有 32GB 以上内存;大模型那一段仍然要配 API Key,或者接本地的 Ollama。
装完是两步引导:欢迎与权限。权限涉及麦克风和辅助功能,后者用于把文字写进其他应用。这一步在「设置 → 系统权限 → 设置引导」里可以重看,中英文切换即时生效。
最短的可用路径是这样:授权完成后,默认快捷键 Fn 对应快速模式,按住说话、松手出字,这个过程不经过大模型,延迟最低,适合先确认识别链路通不通。出字正常之后再去配置服务商。
跑通之后你会得到什么
松开快捷键之后,识别结果会落到录音结束时正在接收键盘事件的位置。终端、自定义渲染编辑器这类对辅助功能支持不完整的窗口也能写进去,这是 v2.8.0 加入的当前键盘焦点输入。
菜单栏有一个控制中心,能看运行状态,切换模式、麦克风、ASR 引擎、LLM 处理引擎与翻译目标语言,也能直接发起录音、打开历史、改口、权限和更新。
首页集中显示输入时长、字数、效率和一个活跃热力图。历史页分成三段视图:听写记录、语音引擎和大模型用量,用量视图里有 Token、预估费用、请求成功率与耗时。
接下来能调的东西有三类:给每个模式绑快捷键、把专有名词加进热词与映射词、按需打开 Intelli Sense 的场景感知。这些都走设置界面,不需要手改配置文件。
主要功能
- 8 种默认模式。快速模式
Fn,纯转写不过 LLM;智能感知Fn + Control或Option + 1;翻译模式Fn + Shift或Option + 2;随便问Fn + Space或Option + 3;Mac 操作Option + 4;语音润色Option + 5;Prompt 优化与代办模式默认未绑定快捷键。所有快捷键都能改。 - 云端与本地两套识别。云端支持 15 家语音识别服务商,覆盖实时与批量识别,可按服务选择模型或区域。本地引擎是 SenseVoice 做流式识别、Qwen3-ASR 做校准。v2.10.0 新增小米 MiMo 文本处理服务、百炼 Qwen-Audio 3.1 流式识别,以及 StepFun 的中国区与全球区选择。
- Intelli Sense。按当前 App、输入控件和有限的上下文润色文字,也可以学习稳定的纠错、表达和列表结构偏好。应用感知、上下文感知、表达习惯学习可以单独开关,默认不会静默学习。
- 随便问。选中屏幕上的文字后按快捷键,用语音提问,选中的内容与问题一起交给模型,答案在独立窗口返回。连续追问会保留上下文,会话保存到历史,可以搜索、恢复、重命名或删除。
- 语音改口。刚打出的文字有错或想换说法,按快捷键说出修改指令,做精准替换或局部微调,支持一键撤销。
- 词汇管理。热词用来校正语音识别引擎,映射词作为兜底或个性化场景,例如把 Web coding 映射成 Vibe Coding,把「我的邮箱地址」映射成具体邮箱。官方另有一个词库管理 Skill,装好后可以直接对 agent 说某个词不要识别错,由它去维护热词与映射词。
- 历史与用量看板。听写记录、语音引擎和大模型用量在同一个历史页里切换,可以看 Token、预估费用、请求成功率与耗时、每日趋势、模型与场景汇总以及逐条请求明细,旧的 LLM 历史会自动估算补全。
- URL Scheme。可以从 Stream Deck、快捷指令、Raycast / Alfred、终端、浏览器或脚本直接控制录音的开始、结束和切换,也能打开设置、管理词库、静默写入热词和片段替换规则。后台调用不抢前台焦点,注入目标无法确认时会把文本保留到剪贴板。
常用参数与配置
快捷键相关:一个模式可以绑定多个全局快捷键,每个快捷键独立设为按住说话或点按开关,冲突处理与模式设置一致。用快捷键结束录音时,可以在外观设置里隐藏紧凑录音条上的停止按钮。
服务商相关:设置页用统一的主从界面管理服务商、配置状态、凭证、连接测试和默认引擎,本地 Ollama 也在其中。翻译模式自动识别口述语言,可选 18 种目标语言,新安装默认是英语,输出语言不符时会自动校验并重试。
模型选择上,README 明确建议不要用思考模式,选轻量模型,作者自己用的是 Seed-2.0-lite,并提到 Minimax M2.7 无法关闭思考,处理时间会非常长。
本地引擎的内存数字也在 README 里:SenseVoice 用于流式识别,约 2GB 内存占用;Qwen3-ASR 做校准,约 8GB。可以只开其中一个,但作者说体验不佳。
热词有一条硬限制:Deepgram 的热词会自动截取前 30 个。备份方面,程序每天为历史、模式、词汇、快捷键和配置创建本地快照,最多保留七份。
成本上作者给过一个参考:他高强度使用说了 5 万字,约 5 小时,对应 5 元人民币;豆包语音注册送 40 小时。这是他自己的使用情况,不代表所有人的账单。
结果在哪里看
最直接的一处是当前光标位置。识别结束、文本处理完成后,结果会粘贴到当时接收键盘事件的地方。
首页与历史页是第二处。首页有输入时长、字数、效率与活跃热力图;历史页里能逐条回看听写记录,也能按语音引擎和大模型分别看用量明细。随便问的会话同样存在历史里。
第三处是备份目录。程序每天生成一份本地快照,可以在设置里查看最新备份,并直接在 Finder 中打开备份文件夹,仓库里没有给出这个文件夹的具体路径。
本地版与云端版的历史、词汇、配置都落在本机,大模型那一段的文本会按你选择的服务商发出。
实际使用中的坑
仓库的 Issue 里有一批很典型的反馈,下面四条都已被标记为已解决,写出来是让你知道这类问题出现过。
- 装完看不到应用:M 系列芯片配 macOS 26.4,装上最新版后菜单栏显示了应用,却打不开设置页。这条讨论最多,16 条评论,状态已解决。
- 英语输入几乎不可用:用户试了三种本地模型,英文输入结果是乱的,问能不能加纯英语模型,8 条评论,已解决。README 里也承认 SenseVoice 中文不错、英文单词十分拉垮。
- ESC 取消后仍在润色:按 ESC 打断录音之后程序还在跑后续处理,用户希望 ESC 直接结束任务、不做 ASR 和 LLM,8 条评论,已解决。
- 云端润色慢:短句约 10 个字要 3 秒才润色完,长句子更久,用户用的是推荐配置里的火山引擎,7 条评论。README 对此的建议同样是不要用思考模式、换轻量模型。
另外还有一类反馈是本地引擎点击启动后 loading 一下又显示未启动,涉及 Qwen3-ASR 与 SenseVoice,也已在后续版本里解决。
选型参考
| 项目 | 适合谁 | 部署方式 | 主要限制 | 什么情况下选它更合适 | 项目地址 |
|---|---|---|---|---|---|
| type4me | 每天要打大量中文、手边是一台 macOS 14 以上 Mac 的人 | 下载 DMG 安装,云端版约 10MB,本地版约 700MB | 只支持 macOS;云端版要自备语音与大模型 API Key;本地版仅 Apple Silicon,约占用 8GB 内存 | 需要在不限应用的任意输入框里说话出字,并且用得上翻译、润色、语音指令这些后续处理 | type4me |
| 雾凇拼音 | 主要靠键盘打字、想提升 Rime 中文词库与候选准确率的用户 | Rime 输入法配置,本次素材没有展开安装步骤 | 走键盘输入路线,不做语音识别,也没有大模型整理和用量看板 | 你只想让键盘输入更准,不希望引入麦克风、API Key 和常驻大内存进程 | 雾凇拼音 |
| claude-code-zh-cn | 想把 Claude Code 命令行界面换成简体中文的开发者 | 仓库没有说明 | 它是 Claude Code 的简体中文汉化,和语音输入不是同一件事 | 你已经在用 Claude Code 并需要中文界面时;选语音输入方案时它替代不了 type4me | taekchef/claude-code-zh-cn |
这三个项目不在同一层。雾凇拼音解决的是键盘输入的候选质量问题,不联网、不需要密钥、也不常驻大内存进程;type4me 解决的是把语音变成可交付文字,代价是要配置服务商,云端版依赖网络,本地版吃内存。如果你的输入以键盘为主、只是嫌候选不准,先看雾凇拼音;只有在多个应用里反复口述长段内容时,type4me 的整理能力才用得出来。第三行只是给中文工具选型的一个参照。
什么情况下别用它
只用 Windows 或 Linux 的话,这个项目帮不上忙,两个安装包都是 macOS 的 DMG。
不想配置任何大模型 API Key,也不打算在本地跑 Ollama,那只能用快速模式那一条链路。本地识别引擎解决的是听清的问题,不解决整理的问题。
Mac 内存吃紧又要用本地识别,这条路走不通。官方给出的占用是约 8GB,建议 32GB 以上。
输入以英文为主也不必选它。本地引擎的英文表现被作者自己点名为拉垮,云端服务商里哪家英语识别更合适,仓库没有给出推荐配置。
对音频和文本外发敏感的场景要谨慎。历史和配置落在本机,但语音识别与大模型处理都可能调用第三方服务,除非全程走本地引擎加本地 Ollama。
焚评:这个项目的量化评分
本项目的选题来自 焚.com(一个按公开公式给 GitHub 项目打分的站)。焚评当前总分 9.5 分(满分 10)。下表是各维度的得分:
| 评分维度 | 得分 |
|---|---|
| 热度动量(权重 25%) | 10.0 / 10 |
| 开发活跃(权重 25%) | 9.2 / 10 |
| 社区响应(权重 15%) | 9.3 / 10 |
| 文档质量(权重 15%) | 8.5 / 10 |
| 发布节奏(权重 10%) | 9.8 / 10 |
| 风险控制(权重 10%) | 10.0 / 10 |
评分口径、权重与计算方式见焚.com 的评分方法页;数据随 GitHub 指标刷新,具体数值以焚.com 当前页面为准。本文正文为诀.com 独立撰写,评分数据由焚.com 授权引用。
内容核验说明
type4me 的收录价值在于把 macOS 语音输入的整条链路摊开讲:云端版与本地版的包体、内存占用、API Key 依赖、结果落点都写在明处,便于对照自己的机器判断能不能用。适合每天大量打中文、愿意配服务商的 Mac 用户。英文识别和本地内存是它自己承认的短板,文中用量与成本参考均来自作者公开披露,诀.com 未独立验证。
star、fork、开放 Issue 数、内存占用、模型建议与「5 万字约 5 元」等数据来自作者 README 与公开披露,诀.com 未独立验证;实际账单和体验随机器、服务商、网络变化,结果不保证复现。文中 Issue 反馈为用户自述,未逐条复测。用户反馈摘要
根据仓库 Issue 来看,提交者集中反馈了几类问题:M 系列 Mac 装完菜单栏有图标却进不去设置、SenseVoice 与 Qwen3-ASR 点启动后仍显示未启动、英文输入几乎不可用、按 ESC 取消后程序仍在润色、云端润色短句约需 3 秒,这些多为已解决。另有提交者反映 1.5.1 版长句内容丢失、local DMG 报损坏、Deepgram 热词只取前 30 个且被内置词占满,并希望支持批量导入热词。还有一条待解决,是征集好用的本地与云端模型。
基于该仓库公开 Issue 整理,只反映提交者报告的现象与诉求,不代表诀.com 立场,也不代表问题已被确认。项目来源与说明
开源项目:joewongjc(joewongjc)
本文由诀.com 编辑基于该项目的公开信息独立撰写,属原创解读,不是对项目文档的翻译或转载;文中提到的功能与参数以官方仓库为准,代码与文档版权归原作者所有。
查看项目仓库