点击右屏任意短句可精准回放原声
当前样本: 加载中...
首字流式延迟 (TTFT · Interim) ⚡ 0ms 热池命中
0.23 s
扣除录音前静音真实开口起算 (Vertex Global Live)
Smart Mode 终稿延迟 (TTFF · Final) 比 Chirp 3 快 70%
0.39 s
自动去口水词 um/呃 + 自动消解口误改口 + 85语种混说
手机端二次切分压缩比 (Slide 15 方案A) ✂️ 词级时间戳切分
1232字 ➔ ≤52字
说话人分离 (spk:0/1) + 两档停顿/标点切分,不丢字不改标签
Vertex AI 复合意图与声学雷达 Slide 12 生态协同
Single-Pass
同步输出声学情绪/童声画像 + 智屏搜片/AiMe机器人控制 JSON
📱 方案 A · 手机端效果实测对比:同一段话,手机上的两种样子 支持点击右屏任意句子精准回放音频
左屏:原始单段返回(或传 language_codes 触发 1232 字单段崩塌,需连续滚动 10 屏,无时间锚点);右屏:开启 Vertex AI diarization=True, word_timestamp=True + Slide 13 三十行二次切分算法。
小屏字数上限 (MAXC): 55
长停顿切分 (GAP_HARD): 1.35 s
9:41 5G 100%
会议转写 · 原始返回 ❌ 处理前 · 单段长文
1 段长文挤在一起 · 无句级时间戳 · 需连续滚动多屏
加载中...
9:41 5G 100%
会议转写 · 词级时间戳二次切分 ✅ 处理后 · 每句独立成行
每句 ≤55 字 · 前置 [MM:SS] Speaker 标签 · 点击任意行即刻回放
👀 小屏上的核心差别 (Slide 15 要点)
  • 左侧痛点(原始单段返回)
    模型默认按说话人轮次(Turn)返回,轮次内部不按句号切分。若一人长篇独白或传语言提示触发合并,会出现 1232 字单段长文,手机上需连续滚动 10 屏,中途无任何时间锚点。
  • 右侧破局(方案 A · 客户端二次切分)
    通过 Vertex AI Global 开启 diarization=Trueword_timestamp=True,利用每个词的精确 start/end offset 在本地执行 30 行切分代码。
  • ✂️ 三条黄金切分规则 (Slide 13)
    两档停顿:停顿 ≥1.35s 无条件断开;0.55~1.35s 停顿遇标点或满 18 字断开。
    句末标点:遇 。!? 且满 8 字立即随句断开。
    字数兜底:满 55 字回退至最近逗号处断开。
  • 🎯 客户业务价值
    纯本地零成本、确定性:不额外消耗 LLM Token,0ms 完成重排;不改标签、不丢字;每句自带精确时间戳,完美支撑涂鸦 AI Note 等移动端产品的点击单句回放逐句引用进会议纪要
📋 全链路毫秒级可观测日志 [CDP]