netease-youdao/EmotiVoice
EmotiVoice 😊: a Multi-Voice and Prompt-Controlled TTS Engine
解决的问题
EmotiVoice 解决了标准文本转语音(TTS)系统中情感表达不足和语音多样性匮乏的问题。它允许用户生成自然流畅的英语和中文语音,且可精确控制情感(如快乐、悲伤或愤怒)和说话人身份。
工作原理
该引擎基于 PromptTTS 的提示控制架构,用户可通过指定说话人和情感/风格提示来引导语音合成。支持超过 2,000 种不同语音,可通过 Web 界面、脚本接口进行批量处理,或通过 OpenAI 兼容 HTTP API 部署。同时支持使用个人数据进行语音克隆。
适用人群
本工具专为需要高质量、富有情感表达的合成语音的应用开发者和创作者设计,也适合希望自定义语音身份或克隆自己声音的用户。
主要亮点
- 情感合成:可生成包含特定情感(如快乐、兴奋、悲伤、愤怒)的语音。
- 海量语音库:可访问超过 2,000 种不同的语音。
- 双语支持:全面支持英语和中文。
- 灵活部署:提供 Docker 镜像、独立 Mac 应用或 OpenAI 兼容 API 三种方式。
- 语音克隆:支持使用个人数据训练模型,实现特定语音的克隆。
相关
- 项目
jeecgboot/jimureportJimuReport 是一个免费、开源的Web平台,用于构建报表、仪表板和大屏可视化。它提供类似Excel的拖拽式设计器,支持30多个数据源,并包含JimuChatBI——一个通过任何OpenAI兼容模型,从自然语言提示生成或编辑可视化内容的对话式AI。
- 项目
trailhq/GraftGraft 是一个开源的 TypeScript/Node.js 工具,利用 tree-sitter 进行结构化解析,并可选地使用 LLM 摘要,构建本地、基于 Markdown 的代码库知识图谱(摘要、关键代码片段、类型化链接)。图谱缓存在 `graft/` 文件夹中,仅在文件变更时刷新,并自动集成到 Claude Code、Cursor、Codex 和 Gemini 等编码代理中。基准测试显示,最多减少 46% 的工具调用、42% 的 token 消耗、60% 的延迟,并在 SWE-bench 上实现 12 点准确率提升。集成通过单个 `graft init` 命令完成,生成代理专用的指令文件;CLI 还提供搜索、可视化和遥测控制功能。项目采用 MIT 许可证,旨在实现更快、更低成本的 AI 辅助开发。
- 项目
TeamWiseFlow/xiaobeixiaobei(小贝)是一款面向中国自媒体运营者的AI驱动个人助理。它基于开源**openclaw**框架构建,让用户通过简单的微信聊天即可在多个平台(微信、小红书、抖音、Twitter等)创建、格式化和发布文章、图片和短视频。它还提供趋势分析、表现监控、24/7 AI客服、市场调研搜索和商业文档生成。安装是一行脚本,下载预构建的tarball;扫描二维码后机器人即可使用。系统运行在Ubuntu/macOS/Windows上,使用阿里云百炼大模型API(或替代方案),并包含自定义反检测浏览器栈(camoufox)以实现可靠自动化。可选付费“VIP俱乐部”提供高级支持和服务。
- 项目