Speech To Markdown:Mac 与 iPhone 版语音转 Markdown 差异详解
Speech To Markdown 是一款本地优先的语音转 Markdown 工具,Mac 版用 Whisper 和 Agent Mode,iOS 版依赖苹果端侧 AI,功能与配置各有不同。
Speech To Markdown 能做什么?
Speech To Markdown 将口述内容直接转化为结构化的 Markdown 笔记,自动添加标题、列表和段落,省去手动排版。它适合快速记录灵感、起草文章、整理日志,或把零散表达转为清晰提纲。Mac 版支持全局语音输入和 Agent Mode,可处理其他应用中的选中文本;iPhone 和 iPad 版则侧重随手录入并生成 Markdown。

- 语音转文字:实时将口述转换为可编辑文本。
- 自动整理 Markdown:根据内容生成标题、段落和列表。
- 修改已有文字:Mac 上通过语音调整选中内容。
- 继续补充内容:在现有笔记后追加新口述。
Speech To Markdown 能替代 Wispr Flow 或 Superwhisper 吗?
目前不能完全替代。Speech To Markdown 更像为技术用户设计的免费方案,无需订阅,但 Mac 版需通过官方脚本安装并编译,Agent Mode 还需自行配置 LLM 服务。若保持本地,可连接 Ollama、LM Studio。相较之下,Wispr Flow 强调跨应用与即用性,Superwhisper 的 Mac 客户端更成熟,支持本地与在线模型。虽不及商业软件,但若你已用 Ollama 等,并愿意折腾配置,可省去订阅费。
本地语音转 Markdown:Mac 与 iOS 版有什么区别?
Mac 与 iOS 版在语音识别、文本整理和安装方式上差异明显:
- Mac 版:使用本地 Whisper 进行语音转写,Agent Mode 依赖 LLM 服务(可本地或远程)。
- iOS 版:采用苹果的 SpeechAnalyzer 和 Foundation Models,完全在端侧处理,无需额外配置。
Mac 版怎么用:全局听写与 Agent Mode
Mac 版提供两种使用方式:
- 全局语音输入:按默认快捷键
⌘⌥]在任何应用中语音转文字,仅依赖 Whisper。 - Agent Mode:需配置兼容 OpenAI API 的 LLM 服务,支持三种模式:
- Format:将口述整理为标题、列表、段落的提纲或草稿。
- Edit:选中文字后语音下达修改指令。
- Append:在文档追加新内容,适合长文档。
使用前需确认三项条件:
- Mac 内存与算力:运行大模型时,内存占用取决于模型大小;8GB 内存更适合小型模型,运行大模型可能卡顿。
- iPhone/iPad 兼容性:需支持 Apple Intelligence 的设备,如 iPhone 15 Pro 及后续机型,或 M 芯片 iPad。
- Mac 安装方式:目前无 DMG,需在终端运行官方脚本,通过 Homebrew 安装依赖并编译,首次启动需下载 Whisper 模型。
Speech To Markdown 的数据会传到云端吗?
需分版本看待:
- Mac 版:语音转写本地完成,但 Agent Mode 会将文本发送至配置的 LLM 地址。若连接本地 Ollama 等,则数据不出本机;若用远程 API,则可能外传。
- iOS 版:完全在设备端处理,不连接外部服务。
适合个人灵感、草稿、日志等场景,但不支持说话人分离、会议录制、批量导入或协作,无法替代 Granola 等专业工具。
Speech To Markdown 没有 LICENSE,可以商用吗?
截至 2026 年 7 月 27 日,GitHub 仓库无 LICENSE 文件,源码公开但不代表允许修改、分发或商用。个人可体验,但若需修改、集成或商用,请先联系开发者。后续如有许可证,以 GitHub 为准。
Speech To Markdown 适合哪些用户?
适合 Mac 内存充足、已用 Ollama 或 LM Studio、愿意配置本地环境且注重数据流的用户。若需即装即用、跨平台或专业会议功能,建议选 Wispr Flow 等商业工具。老款 iPhone 或不支持 Apple Intelligence 的 iPad 无法运行移动版。


