← 返回文章
作者 ··约 6 分钟阅读·AI 用进真实工作

我让 WorkBuddy 听完一段长视频,最后交回了一份飞书文档

一段 1 小时 46 分钟、没有字幕的 YouTube 视频,WorkBuddy 从本地转写开始,在原讲义拿不到后重新整理成九大板块的飞书文档。

我让 WorkBuddy 听完一段长视频,最后交回了一份飞书文档

哈喽,我是阿梦。这个公众号,我会持续记录自己怎么把 AI 用进真实的工作,成功的、失败的、返工的,都是我的来时路~

去微信公众号「是哆啦 AI 梦」看看 →

之后,我会陆续写自己怎么把 Agent 接进飞书,怎么让 WorkBuddy 跑任务,也会写我用 Trae、Codex、豆包等做过什么。

前面几篇,我写得最多的是自己的知识库。

从会议 PPT 做 OCR,到清理重复和过期资料;从给 AI 的规则做减法,到切片、分类切片,再到计算复杂度和成本

一路折腾下来,文档、网页和图片怎么进入知识库,我慢慢摸出了一条路。

但我很快发现,还有一大块知识一直被挡在门外:视频。

课程、访谈和直播回放,人可以点开慢慢看,知识库却不能直接搜索里面的声音。

所以这次看起来是在写 WorkBuddy,其实仍然是在继续解决知识库的问题:

视频里的内容,能不能也变成可以搜索、整理和随时调用的资料?

这次摆在我面前的,是一段 1 小时 46 分钟的 YouTube 视频。

没有字幕,讲的是海外社媒营销策略。

我想要的也不只是一段“视频总结”,而是一份能搜索、能修改、可以继续放进飞书使用的文档。

于是,我把任务交给了 WorkBuddy,给到它的,仅仅是视频链接。

它忙了将近四个小时,中间卡了两次,最后真的交回来了一份文档。

第一步不是总结,而是先把视频听懂

没有字幕,WorkBuddy 只能先下载视频音频,再调用本地 Whisper 做语音识别。

Whisper 可以理解成一个 AI 听写员:把声音重新变成带时间点的文字。

我这次用的是本地小模型,在本地电脑的 CPU 上运行。好处是不需要把整段音频交给在线接口,代价是慢。

单是转写,就跑了大约 96 分钟。

而且第一次还没跑起来。

系统显示模型已经下载,真正使用时却发现关键文件是 0 字节。

像快递显示“已签收”,打开箱子,里面是空的。

WorkBuddy 重新检查缓存,把完整模型放回正确位置,才继续转写。

最后,它输出了 TXT、SRT 和 VTT 三种文件,共 2355 个带时间点的文字片段。

视频终于可以“读”了。

但新的问题也来了:

2355 段逐字稿,并不等于一份能看的文档。

从长视频、提取音频、2355 段文字到飞书文档的处理流程

我本来想找讲义,结果没找到

视频里提到过配套资料。

如果能找到原讲义,章节、标题和模板都会清楚很多。

WorkBuddy 检查了视频画面、音频、简介和评论,都没有发现公开的飞书文档链接。视频里还明确提到,原版属于内部资料,不对外分享。

到这里,“找到讲义并复制到我的飞书”这条路已经走不通了。

没有公开链接,也没有文档权限,就不能假装已经拿到,更不能绕过去抓内部资料。

于是任务换了一个方向:

不复制原文档,只根据公开视频的逐字稿,重新整理一份自己的学习文档。

这不是原讲义的复刻版,而是一次重新理解和重建。

原讲义拿不到后,改为根据公开内容重新整理

从 2355 段字幕,重新拼出九个板块

讲师在开头提到,整场分享会围绕九个方面展开。

WorkBuddy 顺着这个线索,把零散的时间片重新归类,整理出九个主体板块:

  1. 公司目标规划;
  2. 竞争对手调研;
  3. 用户话题洞察;
  4. 社媒策略制定;
  5. 资源与预算规划;
  6. 执行;
  7. 数据监控;
  8. 持续优化;
  9. 风险管控。

每个板块下面又继续拆分。

比如“社媒策略制定”里,包含目标与 KPI、平台选择、账号包装、内容组合、素材获取和运营节奏。

最后,它还补出了帖子管理表、回复模板库、竞品调研框架、活动复盘、OKR 和年度营销日历六组附录模板,并把这些内容写进新的飞书文档。

这份文档当然不可能和讲师未公开的原稿完全一致,逐字稿里的专有名词和识别错误也需要人工检查。

但它已经完成了最重要的变化:

原本只能从头播放的视频,变成了一份可以搜索、跳读和继续编辑的资料。

2355 段逐字稿被重新整理成九个内容板块

以后再找“竞品调研”或“风险管控”,不用重新拖一遍进度条。

视频进入知识库,不能只做转写

就像图片进入知识库前,需要先用 OCR 把图里的字变成文字;音视频进入知识库,也要先经过语音转写。

但“转成文字”还不够。

如果没有来源、时间点和结构,几千段逐字稿依然很难调用。所以,我现在会把视频沉淀成知识分为三层:

1. 转写

把声音变成带时间点的文字,解决“能不能读”。

2. 恢复结构

从逐字稿里找回主题、章节、案例和上下级关系,解决“能不能看懂”。

3. 形成文档

把内容放进飞书或其他长期使用的工具,解决“以后还能不能用”。

如果只停在第一层,只是把一条视频进度条换成一条更长的文字进度条。

这套逻辑不只适合我。

以后大家看到真正有用的视频,也不一定只能点进“稍后再看”,然后再也没有打开。

可以把原链接和时间点保留下来,先转写,再整理成章节、方法或模板,最后放进飞书、笔记工具或自己的知识库。下一次需要时,先搜索自己的资料,再回到原视频核对。

这样,视频才从“我好像看过”,变成了可以即拿即用的知识。

如果要把课程、会议或长视频交给 Agent,我会先说清楚:

  • 要逐字稿,还是只要摘要;
  • 是否保留时间点,方便回到原视频核对;
  • 是否需要恢复章节结构;
  • 最终结果要进入哪个长期使用的工具;
  • 哪些专有名词和结论必须人工复核。

这次 WorkBuddy 真正帮我做了什么?

它没有替我拿到那份未公开的讲义,也没有一键无损复刻原文档。

它做的是:听完 1 小时 46 分钟的视频,解决转写故障,再把 2355 段零散文字整理成一份有九个板块的飞书文档。

这次任务让我觉得有价值的,不只是它最后交出了什么。

还有一件事:原来的路走不通以后,它没有越过边界,而是换了一条可以继续完成任务的路。

接下来,我还会继续记录自己怎么把飞书、WorkBuddy、Trae、Codex 和其他 Agent 用进真实工作。

没有“一键完成”也没关系。

很多真正能复用的方法,本来就藏在那些报错和返工里。