工具
MCP Speak:为 MacOS 上的 AI 智能体加入本地语音与人格
基于 Model Context Protocol 的 MacOS 本地语音服务器,让 AI 智能体调用系统 TTS 并…
2026.07.20 · 周一约 2 分钟阅读
开发者 fellowgeek 在 Hacker News 发布了开源工具 MCP Speak。这是一个运行于 MacOS 的 Model Context Protocol(MCP)服务器,让 AI 智能体直接调用本机系统语音引擎进行实时语音合成,并支持多种风格化人格模板,无需依赖任何外部 TTS API。
工具概述
MCP Speak 主要解决 AI 智能体「开口说话」的本地化问题。与常见的云端 TTS 方案不同,它通过 MCP 协议在客户端与 macOS 自带语音引擎之间建立桥梁,全程在本地完成合成,不发起网络请求、不使用 API Key。
安装与配置
项目托管在 GitHub(fellowgeek/mcp-speak),安装流程简洁:
- 使用
git clone https://github.com/fellowgeek/mcp-speak.git获取代码并进入目录; - 运行
python3 setup.py启动配置向导,向导会自动选择人格、申请语音权限并搭建虚拟环境; - 也可跳过向导,手动在 MCP 客户端的 JSON 配置中写入相应片段完成对接。
预设人格档案
工具内置多套互不相同的人格模板,用来改变智能体说话的语气与措辞,包括:
- Sarcastic Senior(毒舌老手)
- Eager Intern(热忱实习生)
- Existential Emo(存在主义 emo)
- Pun Master(双关语大师)
- Tech Priest(技术教士)
- Agent Smith(《黑客帝国》风)
- Gothic Poet(哥特诗人)
切换人格后,工具会动态生成对应的 AGENTS.md 通信协议说明,并可选地附带基础行为准则。
局限与适用场景
MCP Speak 仅在 MacOS 上可用,且依赖客户端支持 MCP 协议。由于直接调用系统 TTS,语音自然度受限于 macOS 自带引擎。它的目标用户是追求低延迟、不愿意把语音流量送上云、或希望智能体有差异化口头风格的开发者,属于一个轻量级的本地化尝试,并非通用语音方案。
