直播实时字幕这活儿,观众看到的是画面下方那条不停滚动的白字,看不到的是导播间角落里有个人正盯着屏幕、手指悬在回车键上,随时准备把"甲流"改成"假流"、把"耦合"从"藕合"里捞出来。我把去年秋天跟的一场行业峰会完整记了下来——从早上七点四十到晚上六点二十,中间那些手忙脚乱的瞬间,比任何技术白皮书都更能说明直播实时字幕到底是怎么打出来的。
记录人是小林,摄行科技字幕组的二年级选手。以下时间都是她当天记在手机备忘录里的,我只做了顺序整理。
07:40 到场,先去抢一根线
会场是华东某产业园的多功能报告厅,能坐四百二十人。小林进场第一件事不是开电脑,是去找音响师老周要一路"干净的"音频输出。她的原话是:"直接从调音台总输出拉,别给我那种已经进了混响器的。"
这是很多人不理解的一点。字幕识别引擎吃的是音频,不是画面。音频里只要混进了会场返送的回声,识别准确率就会往下掉一大截。当天他们实测过:直接从调音台辅助输出拿到的干声,识别率是九成一左右;从返送音箱旁边随便架一支话筒拾取的环境声,识别率只有六成七。差了二十多个百分点,后面校对的人就要多打两倍的字。摄行科技的现场任务卡里,「先要一路干声」这条被排在字幕组所有动作的最前面,比开机还靠前。
关于调音台上那几路输出到底该怎么分配,我们之前写过直播调音台的增益结构入门,里面讲的辅助输出逻辑在这里完全适用。
09:00 术语库是前一天晚上熬出来的
八点五十,小林把提前做好的术语库导进识别引擎。这份表格有三百四十七条,是她前一晚照着主办方给的议程、演讲人PPT和往届会刊一条条抠出来的。
术语库里都是些什么?公司名("熵基""澜起"这类识别引擎大概率会写错的)、产品型号、专有名词、演讲人姓名和头衔。还有一类特别容易被忽略:主办方的自造词。这场会里有个词叫"链主企业",引擎第一次识别成了"连主企业",进了术语库之后就再没错过。
这一步是拉开专业和业余差距最大的地方。没有术语库的直播实时字幕,观众看两分钟就会开始截图发朋友圈嘲笑;有术语库的,基本能做到不出戏。摄行科技接过条数最多的一次是八百四十多条,那场是芯片行业的技术峰会,光是型号命名规则就整理了两页。
10:20 引擎的准确率,和宣传口径不是一回事
上午第一场主论坛开讲,小林的屏幕上跳出实时识别结果。她当场记了个数:前二十分钟共识别一万一千两百多字,她手动修改了两百八十六处,其中真正影响理解的错误是四十一处,剩下的是标点、断句和口头禅删除。
算下来实质性错误率大约百分之零点三七。听着很低,但换算成观众体感就是:平均每四十秒会看到一处让人皱眉的错字。所以人工校对这一岗,在任何一个正经的直播实时字幕方案里都不能省。摄行科技对外报价时会明确写清"AI识别+人工校对双轨",就是因为只写"AI字幕"很容易让客户误以为不需要配人。
11:05 第一次真正的兜底
十一点零五分,一位演讲人开始念一段英文原文。识别引擎在中英文混说的场景下直接乱了——它把英文按拼音硬拆成汉字,屏幕上出现一串谁也看不懂的东西。
小林的处理是:立刻按下暂存键让字幕停在上一句,同时用预设好的快捷短语打出"(演讲人引用英文原文)"六个字顶上去,等对方切回中文再恢复。全程大概八秒钟。
这种活儿没法靠算法解决,只能靠人的判断。所以我们在设备清单之外,还会给每场活动准备一份"异常话术卡",上面写好十几种突发情况对应的兜底文案,字幕员按序号敲就行。
13:30 反常识:字幕延时要故意加,不是越快越好
下午的技术分论坛上,我问小林为什么字幕比人说话慢了大概两秒。她说这是故意设的。
原因有两个。第一个是识别引擎需要一小段上下文才能判断分句和多音字,缓冲越短,改错的机会越少。第二个更现实:留出这两秒,校对的人才来得及把明显的错字改掉再推上屏。如果把延时压到五百毫秒,字幕确实跟得紧,但错字会原封不动地送到观众眼前。
这和整场直播的延迟设计要匹配。如果主视频走的是低延迟链路而字幕缓冲两秒,画面和字幕就会对不上。关于这套时序怎么统一,会议直播的声画同步难题那篇里讲得比较细。行业里对字幕与音视频对齐的时间码规范,可以参考电影电视工程师学会SMPTE公布的相关标准文档。
15:00 为什么必须两个人轮岗
下午三点,小林换班,同组的老陈接手。一个人连续盯字幕的极限大约是九十分钟,超过之后漏改率会明显上升。
这不是矫情。他们组内部做过统计:连续工作第一个小时的漏改率是百分之四点二,第三个小时能涨到百分之十一点八。所以但凡是全天六小时以上的会,摄行科技的直播实时字幕都按两人配置报价,中间四十五分钟轮换一次。客户看报价单时如果问"为什么字幕要两个人",答案就在这组数字里。
18:20 收工,那笔钱到底买了什么
当天字幕这一项的费用,落在四位数中段。拆开看:识别引擎的授权和算力占三成不到,剩下七成是两个人的工时、前一晚做术语库的准备时间,以及一套备用笔记本和音频接口。
客户常常觉得"不就是个AI自动出字幕吗"。但从上面这份日志能看出来,真正决定成片质量的,是那些不写在设备清单上的东西:一路干净的音频、一份熬夜整理的术语库、一张异常话术卡,和两个愿意连续盯屏幕的人。想看别的岗位在现场怎么配合,直播彩排到底在彩排什么里有完整的人员动线。
几个高频问题
字幕能做成双语吗? 能,但翻译轨要单独配人或配翻译引擎,成本大约翻一倍,且延时会再加一到两秒。
回放里的字幕要重新做吗? 建议重做。实时字幕为了赶时效会牺牲一部分精度,回放剪辑时用离线识别重跑一遍,准确率能到九成八以上,具体做法见直播回放剪辑的黄金三分钟法则。
能不能不要字幕? 涉及公开传播的会议内容,字幕不只是体验问题,也关系到信息可及性,相关行业要求可查阅国家广播电视总局公开的规范文件。
需要报个价?
如果你手上正好有一场会要做直播实时字幕,把议程、时长、是否中英混说这三个信息发过来,摄行科技可以在半个工作日内给出人员配置建议和明细报价。术语库整理这项我们默认包含在服务里,不另外收费——毕竟那是决定字幕能不能看的关键一步。
#摄行科技