我让 WorkBuddy 听完一段长视频,最后交回了一份飞书文档
一段 1 小时 46 分钟、没有字幕的 YouTube 视频,WorkBuddy 从本地转写开始,在原讲义拿不到后重新整理成九大板块的飞书文档。

之后,我会陆续写自己怎么把 Agent 接进飞书,怎么让 WorkBuddy 跑任务,也会写我用 Trae、Codex、豆包等做过什么。
前面几篇,我写得最多的是自己的知识库。
从会议 PPT 做 OCR,到清理重复和过期资料;从给 AI 的规则做减法,到切片、分类切片,再到计算复杂度和成本。
一路折腾下来,文档、网页和图片怎么进入知识库,我慢慢摸出了一条路。
但我很快发现,还有一大块知识一直被挡在门外:视频。
课程、访谈和直播回放,人可以点开慢慢看,知识库却不能直接搜索里面的声音。
所以这次看起来是在写 WorkBuddy,其实仍然是在继续解决知识库的问题:
视频里的内容,能不能也变成可以搜索、整理和随时调用的资料?
这次摆在我面前的,是一段 1 小时 46 分钟的 YouTube 视频。
没有字幕,讲的是海外社媒营销策略。
我想要的也不只是一段“视频总结”,而是一份能搜索、能修改、可以继续放进飞书使用的文档。
于是,我把任务交给了 WorkBuddy,给到它的,仅仅是视频链接。
它忙了将近四个小时,中间卡了两次,最后真的交回来了一份文档。
第一步不是总结,而是先把视频听懂
没有字幕,WorkBuddy 只能先下载视频音频,再调用本地 Whisper 做语音识别。
Whisper 可以理解成一个 AI 听写员:把声音重新变成带时间点的文字。
我这次用的是本地小模型,在本地电脑的 CPU 上运行。好处是不需要把整段音频交给在线接口,代价是慢。
单是转写,就跑了大约 96 分钟。
而且第一次还没跑起来。
系统显示模型已经下载,真正使用时却发现关键文件是 0 字节。
像快递显示“已签收”,打开箱子,里面是空的。
WorkBuddy 重新检查缓存,把完整模型放回正确位置,才继续转写。
最后,它输出了 TXT、SRT 和 VTT 三种文件,共 2355 个带时间点的文字片段。
视频终于可以“读”了。
但新的问题也来了:
2355 段逐字稿,并不等于一份能看的文档。

我本来想找讲义,结果没找到
视频里提到过配套资料。
如果能找到原讲义,章节、标题和模板都会清楚很多。
WorkBuddy 检查了视频画面、音频、简介和评论,都没有发现公开的飞书文档链接。视频里还明确提到,原版属于内部资料,不对外分享。
到这里,“找到讲义并复制到我的飞书”这条路已经走不通了。
没有公开链接,也没有文档权限,就不能假装已经拿到,更不能绕过去抓内部资料。
于是任务换了一个方向:
不复制原文档,只根据公开视频的逐字稿,重新整理一份自己的学习文档。
这不是原讲义的复刻版,而是一次重新理解和重建。

从 2355 段字幕,重新拼出九个板块
讲师在开头提到,整场分享会围绕九个方面展开。
WorkBuddy 顺着这个线索,把零散的时间片重新归类,整理出九个主体板块:
- 公司目标规划;
- 竞争对手调研;
- 用户话题洞察;
- 社媒策略制定;
- 资源与预算规划;
- 执行;
- 数据监控;
- 持续优化;
- 风险管控。
每个板块下面又继续拆分。
比如“社媒策略制定”里,包含目标与 KPI、平台选择、账号包装、内容组合、素材获取和运营节奏。
最后,它还补出了帖子管理表、回复模板库、竞品调研框架、活动复盘、OKR 和年度营销日历六组附录模板,并把这些内容写进新的飞书文档。
这份文档当然不可能和讲师未公开的原稿完全一致,逐字稿里的专有名词和识别错误也需要人工检查。
但它已经完成了最重要的变化:
原本只能从头播放的视频,变成了一份可以搜索、跳读和继续编辑的资料。

以后再找“竞品调研”或“风险管控”,不用重新拖一遍进度条。
视频进入知识库,不能只做转写
就像图片进入知识库前,需要先用 OCR 把图里的字变成文字;音视频进入知识库,也要先经过语音转写。
但“转成文字”还不够。
如果没有来源、时间点和结构,几千段逐字稿依然很难调用。所以,我现在会把视频沉淀成知识分为三层:
1. 转写
把声音变成带时间点的文字,解决“能不能读”。
2. 恢复结构
从逐字稿里找回主题、章节、案例和上下级关系,解决“能不能看懂”。
3. 形成文档
把内容放进飞书或其他长期使用的工具,解决“以后还能不能用”。
如果只停在第一层,只是把一条视频进度条换成一条更长的文字进度条。
这套逻辑不只适合我。
以后大家看到真正有用的视频,也不一定只能点进“稍后再看”,然后再也没有打开。
可以把原链接和时间点保留下来,先转写,再整理成章节、方法或模板,最后放进飞书、笔记工具或自己的知识库。下一次需要时,先搜索自己的资料,再回到原视频核对。
这样,视频才从“我好像看过”,变成了可以即拿即用的知识。
如果要把课程、会议或长视频交给 Agent,我会先说清楚:
- 要逐字稿,还是只要摘要;
- 是否保留时间点,方便回到原视频核对;
- 是否需要恢复章节结构;
- 最终结果要进入哪个长期使用的工具;
- 哪些专有名词和结论必须人工复核。
这次 WorkBuddy 真正帮我做了什么?
它没有替我拿到那份未公开的讲义,也没有一键无损复刻原文档。
它做的是:听完 1 小时 46 分钟的视频,解决转写故障,再把 2355 段零散文字整理成一份有九个板块的飞书文档。
这次任务让我觉得有价值的,不只是它最后交出了什么。
还有一件事:原来的路走不通以后,它没有越过边界,而是换了一条可以继续完成任务的路。
接下来,我还会继续记录自己怎么把飞书、WorkBuddy、Trae、Codex 和其他 Agent 用进真实工作。
没有“一键完成”也没关系。
很多真正能复用的方法,本来就藏在那些报错和返工里。