我不准备训练一个总结模型。现阶段更想做好的是:总结能省时间,遇到疑问还能回到原文核对。
要解决什么
把长音视频变成少量要点,同时让每个要点知道自己依据哪几段字幕。模型返回一段流畅文字,还不等于这个功能可靠。
有哪些方案
全文一次发送最简单,但受模型输入长度和成本影响;纯提取原句方便核对,但表达可能松散;分段再合并适合长内容,却可能丢失跨段关系。
我先选短文本直接总结、长文本分段后合并,两条路都输出同样的结构。先用实际模型的 tokenizer 和上下文限制确定预算,不拍脑袋按字符数估计所有模型。
怎样一步步实现
输入固定为转写 revision 和带 ID 的段落。先做一个纯分段器:不超过输入预算,留出指令和输出空间;尽量在段落边界切分,相邻块可有少量重叠。超长单段再细分,但保留来源关系。
局部总结返回要点及来源 segment_id,合并阶段只能沿用或组合已存在的来源。最终结构先保留标题、要点列表和每条要点的来源 ID。页面通过这些 ID 找到播放时间。
程序检查结构、长度、引用是否属于当前 revision,以及是否超出该分块范围。引用存在只能证明位置有效,不能证明观点正确。数字、否定和结论是否忠于原文,仍要抽样人工评估。
每个分块按输入摘要、模型、提示词版本保存结果。某块失败只重试那一块;所有块准备好再合并。转写已经完成就可阅读,总结失败不回滚转写。
先定义一个总结处理接口,用假结果测试编排;再接一个真实 API 或本地推理适配器。远程实现处理超时、限流和有限重试,本地实现接受第 06 篇的执行槽位约束。两种实现都记录模型版本、耗时和可取得的 token 使用量。
原文只作为数据,不给模型执行它包含的指令或访问外部工具的权限。输出按结构校验后再展示。
怎么验收
选五段长度、话题不同的真实材料,手工写下重要事实。对结果记录要点覆盖、错误事实、重复要点和引用是否支持结论。暂时不要把某个自动评分当成唯一质量标准。
再制造一次分块失败,确认恢复时没有重复计算已经完成的块。最后点开每条引用,检查能否回放对应字幕。
先交付这五份对照结果。调用了哪个模型只是配置,处理长内容和核对结果的过程才是这个功能的工程内容。
目录 · 下一篇:观察任务耗时