Skip to content

Case: 长时间会议录音免费转文字并自动标注说话人 (meeting-audio-diarization)#14

Open
fogdragon wants to merge 1 commit into
AlephAITech:mainfrom
fogdragon:main
Open

Case: 长时间会议录音免费转文字并自动标注说话人 (meeting-audio-diarization)#14
fogdragon wants to merge 1 commit into
AlephAITech:mainfrom
fogdragon:main

Conversation

@fogdragon

Copy link
Copy Markdown

Case 基本信息

  • Case 标题:用 WorkBuddy 实现长时间会议录音免费转文字并自动标注说话人
  • 使用场景:会议记录、访谈转录、播客字幕生成——需要将长时间录音转为文字并区分不同说话人
  • 目标读者:需要处理会议纪要、访谈录音的开发者、记者、产品经理、内容团队
  • 使用的 Skills:Bash(内置)——执行 Python 脚本、管理 conda 环境
  • 是否需要外部账号或 API:需要 Hugging Face 账号 + Token(pyannote 模型授权)
  • 是否涉及文件修改或对外发布:否,全本地处理

为什么值得收录

长时间会议录音转文字是一个通用需求,现有工具要么付费(录音笔+服务费),要么无法区分说话人。本案例展示了如何用 WorkBuddy 全程协调完成——从 API 方案到全本地方案的技术决策链路、6 个典型踩坑的解决过程、以及「AI 生成脚本 + 手动执行」的实用工作模式。

相比普通提示词,本案例提供了:

  1. 完整的双方案对比(MiMo API → pyannote + Whisper 本地)
  2. 说话人分离的工程难题(分片、重叠窗口、标签一致性)及解法
  3. M1 Mac 上的环境兼容性排错清单(audioop、torchcodec、内存)
  4. 可复用的脚本执行模式和任务指令模板

完整性检查

  • 已搜索社区案例集和蓝皮书,确认场景或任务没有重复
  • 如果与已有案例相近,已在 PR 中说明新增的 Skill、方法或交付差异
  • 已描述真实使用场景(107 分钟会议录音)
  • 已列出使用的 Skills 及其用途
  • 已写明可复现的操作步骤(5 个阶段,每步有具体命令)
  • 已展示 WorkBuddy 中的实际效果(交付物:分片脚本、说话人分离脚本、Whisper 转录脚本 + 输出格式示例)
  • 已提供明确的验收标准(说话人数量正确、转录完整、标注一致)
  • 已说明失败情况、限制或安全边界(6 个踩坑 + 完整安全与限制章节)
  • 已删除密钥、个人信息和敏感数据(Token 已用 hf_xxxxx 脱敏)
  • 图片和其他素材拥有公开使用权限(原始文章为作者本人发布)
  • 本 PR 只提交一个 Case

结果证明

原始文章为微信公众号原创文章,作者本人(fogdragon/Huangyong)。文章中包含了完整的命令行执行输出结果(说话人分离统计、转录输出格式样例)。本案例中的代码片段、命令行输出均来自真实执行过程。

编辑授权

  • 同意维护者在不改变事实的前提下调整标题、结构和文字
  • 同意案例在保留署名的前提下被进一步整理进蓝皮书正文

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant