“听懂”起初只帮我把对方的话变成字幕。面试时我才发现,看到中文解释只是过了第一关:轮到我说话,仍要在几秒内拿出一条得体、属实、我真的念得出来的日语。如果把模型生成的一句漂亮话放在屏幕上,却不知道它回答的是哪个问题,甚至对方根本没在问我,这个功能反而会添乱。这就是我做「助答」的原因。
我用一场约 625 秒的真实日语面试复盘它。那场的记录里,实际有人说话的时间约 321 秒,其中 46 秒没出译文,约占说话时间的 14%;助答触发 50 次、发出 42 次请求、完成 36 轮。请求发出到快速稿上屏的中位数是 1.13 秒,到正式答案上屏是 1.99 秒。数字看起来还行,现场却暴露了三个更根本的问题:它有时替噪声和语气词认真作答;我照着它念完一句后,它又把我的声音当成对方的新问题;点“接着说下去”时,新句子会盖掉我刚念过的那句。生成速度不是助答可用性的全部,问题归属和屏幕稳定性同样重要。
问题一:把噪声和我的回答当成对方提问#
最早的逻辑把“最后一行字幕”当问题来源。真实对话里,最后一行可能是“嗯”、一个识别错的外语词,也可能是我刚照着建议念出的答案。那场面试里有 17 次建议建在这类噪声和语气词上。模型越努力,错误就越像一份认真写好的答案。
我先在本地拦明显不值得回答的行:太短的附和、脚本明显不对、同一句已经回答过。然后把“要回答哪一句”改成最后一条来自对方的发言,不让我的上一句抢走问题。若同一支麦克风同时收我和对方,本机无法从声道判断身份;9 月 26 日又加了一道文字与上下文判断:是不是对方、对方是否在等我回答、问题是否清楚。判断不出来时保留字幕,交给我从那一行手动点“助答”,不把不确定性伪装成肯定。
这个判断不是声纹识别,也不是保证不会误判。尤其在现场共用麦克风时,它会增加一次判断的耗时;前面的 1.13 / 1.99 秒是 9 月 18 日那场旧链路的统计,不能拿来声称 9 月 26 日新门槛仍一样快。我需要下一场真实会话重新量“判掉了多少错答、漏掉了多少该答的问题、回答晚了多少”。
问题二:续说时不能盖掉已经念出的回答#
对方停顿后,快速稿先试着给我一条能接住场面的话;句子闭合后,正式答案再结合完整问题和面试资料给出更稳妥的说法。两条请求各走自己的车道,不能让慢的正式答案挡住快稿。资料为空则不让助答悄悄开场:没有简历或职位背景,模型很容易替我编经历。答案也要短、带中文解释;日语需要时给假名,才有机会真的念出口。
我曾把“再想一个”“举个例子”“说短一点”“更客气”理解成对当前答案的替换。现场才发现这是错的:我可能已经把第一句说出去了,后一句正是接着它说。系统若把前一句从屏幕拿走,我连自己在续哪句都看不见。现在一次提问对应一串可回翻的回答,新的只追加;每条回答带着自己的问题、语言、类型,随会话存下来。过去把这些事实存成全局状态,翻旧答案时,所有回答会一起顶上最新问题,这是“演示只有一条答案”时看不出来的错误。
问题三:新问题到了,屏幕还停在上一题#
我复盘截图时发现,上一问的答案仍最亮,新问题只是很小地标着“正在想”;窗口收窄后,要念的句子和“接着说”的按钮还会被挤到视野外。内容再好,面试中我没有空替界面做阅读理解。所以新问题一来,先把它放到最上面,旧答案退暗;当前轮里最该念的句子最大、最亮。宽屏左边放要念的话,右边放扩展按钮和要点;窄屏退回单列。屏幕不自动滚动,避免我念到一半,文字自己跑走。
此外,系统猜错说话人时,我需要能从字幕旁边直接把一段标成“我说的”“对方说的”或“不自动助答”,也能手动指定“就答这句”。这比把判断做成看不见的黑箱更重要:它允许我在下一秒纠正系统,而不是回到设置页寻找某个总开关。助答是四个模式里唯一可能替我组织发言的一个,所以我尤其不愿意让它在没有把握时擅自发言。
效果与下一轮验收#
这场 625 秒面试给我的不是“助答已经可用”的结论,而是一组能重测的基线:50 次触发里有 17 次由噪声和语气词引起;42 次请求中 36 次完成;快稿和正式答案在旧链路上的中位上屏时间分别是 1.13 秒和 1.99 秒。修完判断与界面后,下一场要用同样口径看四项:错答触发少了多少、真正的问题漏掉多少、首句是否变慢、我是否需要频繁手动纠正。如果只是减少触发,却把该答的问题也挡了,就不能算改善。
两路收音如果都听到同一句外放音频,不只屏幕可能出现两个版本,实时计费秒数也可能接近会话时长的两倍。助答再调用快速稿、正式答案、必要的判断和精修,每一步都可能花钱。我把用量按任务车道记下来,结束后能看到钱大概花在哪;这仍是按当前价格表估算,不是实际扣款。它让我知道哪些误触发不仅打断面试,也白白发出一次请求。
到今天,这个模块仍在迭代。真实面试里的旧数据证明了旧设计的问题,自动测试证明部分状态与回放路径已修;9 月 26 日新加的现场说话人判断和手动覆盖,还需要下一场真实使用来量误判、延迟和操作负担。我不会把“有一个会写答案的模型”说成“面试能放心交给它”。我做助答,是希望自己从听懂走到会说;再往后做陪练,是希望最终不需要屏幕替我说。
证据出处:2026-09-18 约 625 秒面试的去内容统计与 docs/ASSIST.md;9 月 20 日 PR #31(答案序列与落盘)、9 月 25 日 PR #38(面板与新问题)、9 月 26 日 PR #40(现场单麦克风判断与手动控制)。文中只用时长和汇总指标,不公开面试录音、逐字稿、姓名或导入的资料。