BokeSkill:把小说丢进去,30分钟出一整部广播剧!
当整个AI行业都在卷文生图、文生视频的时候有一个项目选择了一条截然不同的路——它问了一个看似简单却极其硬核的问题如果让AI当编剧、当配音导演、当音效师、当混音师全自动把一本小说变成一部完整的广播剧会怎样项目地址https://github.com/dfytensor/BokeSkill一、为什么这个项目值得你停下来读如果你接触过AI语音合成TTS或AI音频生成你一定对这样的场景习以为常用Fish Speech、ChatTTS克隆一个声音需要录几段干净的参考音频用Stable Audio生成一段音效需要反复调prompt最后还要自己用Audition把配音、音效、BGM一轨一轨拼起来——做一个3分钟的音频片段可能要折腾一整天。但BokeSkill提出了一个颠覆性的问题如果整个流程——从剧本分析、角色声音设计、逐句配音、音效生成、BGM配乐到多轨混音和质量自动评估修复——全部交给AI流水线自动完成会怎样BokeSkill全称Podcast Generator Skill是一套全自动广播剧/有声书生成流水线。你把一篇小说或剧本丢进去它会在约30分钟内输出一部完整的、带角色区分、带音效配乐、带专业混音的广播剧。结果令人震惊7阶段全自动流水线从编剧拆场景到专业混音零人工干预多角色配音每个角色独立音色支持情感控制音效BGM自动生成Stable Audio 3 Medium统一生成配合质量评分自动修复专业级混音四总线(对白/音效/音乐)DSP链LUFS响度归一化质量闭环Qwen2.5-Omni自动评分低分片段触发prompt重写重新生成直到达标这不是在现有TTS工具上做点小修小补——它是从零搭建了一整条AI音频工业流水线。二、核心思想从“手工拼音频”到“全自动工业流水线”2.1 传统AI音频制作在做什么传统做法是工具链割裂的用A工具做TTS配音用B工具生成音效用C工具做BGM最后用D工具手动混音。每个环节都需要人工干预、参数调优、格式转换。BokeSkill的核心洞察是这些环节本质上都是确定性的输入输出映射——输入是文本输出是音频。既然每个环节都可以用AI自动化那为什么不把它们串成一条完整的流水线2.2 BokeSkill的七阶段流水线整个流程分为两个大阶段Agent决策阶段智能编剧音频导演和bridge_final.py执行阶段6个自动化阶段。第一阶段Agent智能决策opencode SKILL.md步骤任务产出Step 1编剧 — 拆场景、设钩子场景结构 开篇钩子设计Step 2音频导演 — 声音设计角色音色描述、SFX/BGM prompt编写第二阶段bridge_final.py全自动执行6阶段用户输入小说/剧本 ↓ Phase 1: Qwen3-TTS VoiceDesign → 角色参考音色voices/*.wav ↓ Phase 2: Qwen3-TTS Base (VoiceClone) → 逐句配音line_*.wav ↓ [可选] ViiTorVoice-NAR → 情感控制配音 ↓ Phase 34: Stable Audio 3 Medium → 音效sfx_*.wav BGMbgm_*.wav Qwen2.5-Omni 质量评估1-10分 低于7分 → 写入 repair_needed.json ↓ Phase 5: Audio-Oscar Mixer DSP → 四总线混音 响度归一化 ↓ 产出: drama_final.wav完整广播剧 audio_manifest.md含评分 repair_needed.json如有低分 ↓ 如有低分Agent修复循环: 读取反馈 → 重写prompt → 重新生成 → 复评2.3 质量闭环自动评分 自动修复这是BokeSkill最精髓的设计——它不是一次性生成就完事了而是一个有质量反馈的闭环系统Qwen2.5-Omni-3B对每个音效/BGM进行1-10分质量评估评分低于7分的片段自动写入repair_needed.jsonAgent读取评分反馈根据Omni的具体评价重写声学prompt删除低分wav文件更新bridge_final.py重新运行生成再次检查repair_needed.json——循环直到全部达标设计原则bridge_final.py不包含任何外部API调用。所有需要智能的决策由agent在脚本外部完成脚本只负责确定性的音频生成/评估/混音。三、技术架构五大外部模型37GB的AI音频引擎BokeSkill整合了5个顶尖的AI音频模型总大小约37GB模型大小用途阶段Qwen3-TTS VoiceDesign4.2 GB根据文字描述生成角色参考音色Phase 1Qwen3-TTS Base (VoiceClone)4.2 GB用参考音色克隆逐句生成配音Phase 2默认ViiTorVoice-NAR~8.5 GB替代引擎原生情感/NVV标签控制CFG权重调强度Phase 2可选Stable Audio 3 Medium9.2 GB统一文本生成音效 背景音乐Phase 34Qwen2.5-Omni-3B11.2 GB音频理解质量评估 低分自动修复触发评估阶段合计~37 GB3.1 VRAM智能管理顺序加载24GB显卡够用所有模型顺序加载/卸载同一时刻最多1-2个模型在显存中Phase 1: VoiceDesign加载(~4GB) → 生成 → 卸载Phase 2 (Qwen3): Base加载(~4GB) → 生成 → 卸载Phase 2 (ViiTorVoice): Encoder(~2.3G) LLM(~2.1G) Decoder(~0.4G) → 生成 → 保持Phase 34: Stable Audio 3 Medium加载(~9GB) → 生成SFXBGM → 卸载Phase 34评估: Omni加载(~11GB) → 评估全部 → [低分修复循环] → 卸载Phase 5: 混音纯CPU无GPU占用最低配置RTX 4090 D 24GB VRAM3.2 两种TTS引擎按需切换BokeSkill支持两套TTS引擎Qwen3-TTS默认语音克隆质量高但推理较慢~5min/句无flash-attn时ViiTorVoice-NAR可选支持原生情感/NVV标签控制推理快6s/句首次加载15s3.3 专业级混音Audio-Oscar DSP链BokeSkill不直接运行Audio-Oscar的完整pipeline而是提取了其最核心的混音能力四总线混音对白/音效/音乐分离处理DSP效果链pedalboard Compressor/Gain/LimiterLUFS响度归一化pyloudnorm确保输出响度专业四、快速上手4.1 硬件要求项目要求当前配置GPUNVIDIA GPU, ≥ 16GB VRAMRTX 4090 D, 24GB VRAMCUDA≥ 12.6CUDA 12.6内存≥ 32GB RAM—磁盘≥ 50GB模型venv产出—4.2 模型下载所有模型均来自HuggingFace完全本地运行无需任何API# Qwen3-TTShttps://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base# ViiTorVoice-NARhttps://huggingface.co/ZzWater/ViiTorVoice-NAR# Stable Audio 3 Mediumhttps://huggingface.co/stabilityai/stable-audio-3-medium# Qwen2.5-Omni-3Bhttps://huggingface.co/Qwen/Qwen2.5-Omni-3B4.3 环境搭建# 1. 创建虚拟环境uv venvF:\voice_design\.venv--python3.12# 2. 安装PyTorch (CUDA 12.6)uv pipinstalltorch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu126# 3. 安装核心依赖uv pipinstalltransformers soundfile librosa scipy numpy pedalboard pyloudnorm# 4. 安装Qwen2.5-Omni依赖uv pipinstallqwen-omni-utils pillow av# 5. 安装stable-audio-toolsuv pipinstalleinops transformers accelerate safetensors alias-free-torch auraloss uv pipinstallstable-audio-tools --no-deps4.4 运行完整流水线cdE:\播客skill\podcast-generatorF:\voice_design\.venv\Scripts\python.exebridge_final.py项目会在output/目录下生成drama_final.wav— 完整广播剧混音后audio_manifest.md— 片段清单含Omni评分line_00_角色名.wav— 逐句配音sfx_00.wav— 音效bgm_00.wav— 背景音乐五、已知限制与未来方向项目团队坦诚地列出了当前版本的局限限制影响变通方案flash-attn无法安装(CUDA 13.1 vs PyTorch cu126)TTS推理慢~5min/句降级CUDA驱动到12.4或等待更新Stable Audio 3 Medium参数体系不同仅需8 stepscfg_scale1.0不要照搬Small版本参数Qwen2.5-Omni-3B是3B小模型评估精度有限偶尔评分偏差可升级到7B版本BGM只铺最长一段多场景音乐切换未实现后续在mixer中按场景分段切换Windowssox未安装librosa部分功能降级不影响核心流程最新进展项目刚刚更新了开篇钩子公式5种模式用于生成20秒注意力钩子。六、总结与思考BokeSkill的价值远不止于“又出了一个AI音频工具”。它真正值得深思的地方在于第一它证明了“AI音频全自动流水线”是可行的。把5个顶尖模型串成一条完整的工业流水线加上质量闭环自动修复——这不是demo而是一个真正能产出成品的系统。第二它展示了“Agent 确定性脚本”的分工范式。opencode agent负责所有需要智能的决策编剧、声音设计、prompt修复bridge_final.py只负责确定性的音频生成/评估/混音。这种分工清晰、可维护、可扩展。第三它完全本地化、零API依赖。所有模型都在本地运行不需要任何云API调用——这对隐私敏感的内容创作场景至关重要。第四它把“质量”纳入了自动化闭环。不是生成完就结束而是用Qwen2.5-Omni自动评分、自动修复直到达标。当然BokeSkill目前还有不少局限TTS推理速度偏慢、BGM切换未实现、评估模型精度有限。但它打开了一扇门如果未来的内容创作不再需要你亲自配音、剪音频、找音效而只需要丢一篇小说进去呢项目地址https://github.com/dfytensor/BokeSkill欢迎star、fork、提issue——一起探索AI音频自动化的另一种可能。

相关新闻

15分钟高效掌握!Windows风扇控制神器FanControl完整指南

15分钟高效掌握!Windows风扇控制神器FanControl完整指南

15分钟高效掌握!Windows风扇控制神器FanControl完整指南 【免费下载链接】FanControl.Releases This is the release repository for Fan Control, a highly customizable fan controlling software for Windows. 项目地址: https://gitcode.com/GitHub_Trending/…

2026/7/27 1:14:39阅读更多 →
如何快速解锁游戏修改器完整功能:简单高效的使用方法

如何快速解锁游戏修改器完整功能:简单高效的使用方法

如何快速解锁游戏修改器完整功能:简单高效的使用方法 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer 你是否厌倦了游戏修改器的各种限制…

2026/7/27 1:14:39阅读更多 →
如何5分钟完成Honey Select 2完整汉化与去码:一站式解决方案终极指南

如何5分钟完成Honey Select 2完整汉化与去码:一站式解决方案终极指南

如何5分钟完成Honey Select 2完整汉化与去码:一站式解决方案终极指南 【免费下载链接】HS2-HF_Patch Automatically translate, uncensor and update HoneySelect2! 项目地址: https://gitcode.com/gh_mirrors/hs/HS2-HF_Patch HS2-HF Patch是专为Honey Sele…

2026/7/27 1:14:39阅读更多 →
生产级Linux与Jenkins治理实战:RockyLinux9全栈部署与运维闭环

生产级Linux与Jenkins治理实战:RockyLinux9全栈部署与运维闭环

开篇:为什么选择RockyLinux9作为生产基座在RHEL生态中,CentOS 7已于2024年6月停服,CentOS 8更是提前谢幕。RockyLinux9作为RHEL 9的1:1二进制兼容发行版,已经成为企业级生产环境的首选替代方案。相比CentOS 7,RockyLin…

2026/7/27 6:09:16阅读更多 →
TMS320C5514命名规则、ZCH封装与热阻参数深度解析

TMS320C5514命名规则、ZCH封装与热阻参数深度解析

1. 从一串字符到一颗芯片:TMS320C5514命名规则的深度拆解当你拿到一颗德州仪器(TI)的DSP芯片,比如TMS320C5514AZCH12,第一眼看到的可能只是一串复杂的字母数字组合。但对于我们这些常年泡在电路板、示波器和代码里的硬…

2026/7/27 6:09:16阅读更多 →
云原生与 AI 驱动下的数据工程新图景——解读 DZone 数据工程趋势报告【附报告下载】

云原生与 AI 驱动下的数据工程新图景——解读 DZone 数据工程趋势报告【附报告下载】

云原生与 AI 驱动下的数据工程新图景——解读 DZone 数据工程趋势报告【附报告下载】 大家好,我是你们的老朋友,一个整天和数据打交道的技术博主。最近,DZone 发布了一份名为《数据工程趋势报告》的深度报告,聚焦了云原生、AI 和…

2026/7/27 6:09:16阅读更多 →
SQL 增删改查:和 dao 层代码怎么对应

SQL 增删改查:和 dao 层代码怎么对应

🥰个人主页:会编程的土豆(欢迎来访) 💎作者简介:后端学习者 ❄️个人专栏:数据结构与算法,数据库,leetcode ✨那些你一个人走过的夜路,终将化作照亮未来的光 …

2026/7/27 6:09:16阅读更多 →
AI模型推理延迟优化:从剪枝量化到硬件加速

AI模型推理延迟优化:从剪枝量化到硬件加速

1. AI模型推理延迟的现状与挑战在当前的AI应用场景中,推理延迟已经成为制约系统性能的关键瓶颈。以我过去参与的智能客服项目为例,当响应时间超过300ms时,用户满意度就会显著下降。特别是在实时性要求高的场景,如自动驾驶的物体识…

2026/7/27 6:09:16阅读更多 →
整理infrared热点(二)

整理infrared热点(二)

#long-distance-relationship #突然很确信我们有些地方有点像蜘蛛侠与格温 三、具有尺度和位置敏感性的红外小目标检测Infrared Small Target Detection with Scale and Location Sensitivity 插曲 去了解一下特征融合-发现是深度学习里的 【极致中配】Stanford CS231N 计算…

2026/7/27 6:07:16阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/27 1:14:34阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/27 1:14:52阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/27 1:14:56阅读更多 →
SPI实战指南:从时钟模式到寄存器配置,解决嵌入式通信难题

SPI实战指南:从时钟模式到寄存器配置,解决嵌入式通信难题

1. 项目概述:从寄存器手册到实战指南 如果你手头有一份类似德州仪器(TI)TMS320x240xA系列DSP的SPI模块技术手册,看着里面密密麻麻的寄存器位定义、时序图和公式,是不是感觉头大?这份资料虽然权威&#xff0…

2026/7/27 0:00:24阅读更多 →
【JAVA毕设源码分享】基于springboot的水果购物管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

【JAVA毕设源码分享】基于springboot的水果购物管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/27 0:00:24阅读更多 →
2007-2023年各市区县生态文明建设示范区DID

2007-2023年各市区县生态文明建设示范区DID

数据简介 自改革开放以来,我国依赖高投入、高资源消耗和高污染等传统发展模式实现了经济短期内的快速增长, 然而这也导致了严重的生态环境危机。因此,国家有力于推动企业高质量经济发展,协同生态保护的方针,从而从201…

2026/7/27 0:00:24阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/25 23:03:25阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/26 19:05:21阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/26 19:05:21阅读更多 →