点击右屏任意短句可精准回放原声
当前样本: 加载中...
首字流式延迟 (TTFT · Interim)
⚡ 0ms 热池命中
0.23 s
扣除录音前静音真实开口起算 (Vertex Global Live)
Smart Mode 终稿延迟 (TTFF · Final)
比 Chirp 3 快 70%
0.39 s
自动去口水词 um/呃 + 自动消解口误改口 + 85语种混说
手机端二次切分压缩比 (Slide 15 方案A)
✂️ 词级时间戳切分
1232字 ➔ ≤52字
说话人分离 (spk:0/1) + 两档停顿/标点切分,不丢字不改标签
Vertex AI 复合意图与声学雷达
Slide 12 生态协同
Single-Pass
同步输出声学情绪/童声画像 + 智屏搜片/AiMe机器人控制 JSON
📱 方案 A · 手机端效果实测对比:同一段话,手机上的两种样子
支持点击右屏任意句子精准回放音频
左屏:原始单段返回(或传 language_codes 触发 1232 字单段崩塌,需连续滚动 10 屏,无时间锚点);右屏:开启 Vertex AI
diarization=True, word_timestamp=True + Slide 13 三十行二次切分算法。
会议转写 · 原始返回
❌ 处理前 · 单段长文
1 段长文挤在一起 · 无句级时间戳 · 需连续滚动多屏
加载中...
会议转写 · 词级时间戳二次切分
✅ 处理后 · 每句独立成行
每句 ≤55 字 · 前置 [MM:SS] Speaker 标签 · 点击任意行即刻回放
⚡ Gemini 3.5 Transcribe Live · 实时流式双遍字幕
Vertex AI Global WebSocket
1st-Pass 实时滚动中间态字幕 (Interim Input Transcription · 边说边出字):
等待语音输入或点击上方「立即运行实测」...
2nd-Pass Smart Mode 终稿 (Final Transcription · 自动去口水词 um/呃 + 自动修正口误 + 多语种混说):
等待终稿生成...
✨ Smart Mode 智能清洗与跨语言识别亮点:
运行后自动展示口水词剔除与中英粤正字化对比。
🐢 传统级联流水线反面教材 (Legacy STT + NLP 模拟)
耗时 ~3450 ms
传统单语/双语 STT 识别文本 (同音错字与废词保留):
--
下游传统 NLU 槽位解析结果:
--
🧠 转录之外:Vertex AI 原生多模态声学副语言雷达
Slide 12 · 声学特征不丢失
传统 STT 将声音强行坍缩为扁平文字,丢弃了哭腔、叹气与年龄特征。Vertex AI 原生音频理解直接感知声学副语言信号:
情绪状态感知 (Primary Emotion)
--
说话人声纹画像 (Speaker Profile)
--
副语言声学事件 (Paralinguistic Cues)
--
声场抗噪鲁棒性 (Noise Robustness)
SNR +24dB · 强鲁棒
🚀 Speech-to-Intent · 智屏复合搜索 & AiMe 机器人硬件联动载荷
SMART_HARDWARE_AGENT
🎯 语义推理锁定目标媒资 / 纪要实体 (Fuzzy Plot & Code-Switch Resolved)
等待推理...
--
--
⚡ 单次推理同步触发的硬件 API / Tool Calls 指令队列:
💬 结合声学情绪与人设生成的拟人化高粘性回复 (Empathetic Voice Reply):
--
📊 谷歌云语音识别代际跃迁对比矩阵 (Slide 18 / 19 / 20 核心总结)
Artificial Analysis 流式 STT 榜第一梯队 · 4.0% WER
| 评估维度 / 能力 | Chirp 2 (傳統 USM) | Chirp 3 (Preview / 部分区域下线) | 🌟 Gemini 3.5 Transcribe & Live (LLM 原生) |
|---|---|---|---|
| 底层架构与准确率 | 传统声学+语言模型级联 | 生成式降噪 + 独立解码器 | LLM 原生 Transformer (音频 Token 直通) · 4.0% WER (低于行业均值 25%) |
| 流式延迟 (Latency) | ~1.2s 到 Final | 默认 5s 窗口 (比上一代慢) | ⚡ 0.40s 到 Final (亚秒级流式,比 Chirp 3 快约 70%) |
| 同句混语 (Code-Switch) | ⚠️ 弱 (需按单语种路由) | 动态检测,但同句粤英/中英易错字 | ✅ 85+ 语言自动检测 · 同句中英/粤语/粤英混说零差错 |
| Smart Mode 智能清洗 | ❌ 原始听写,保留全部 um/呃 | ⚠️ 仅 Preview 有限支持 | ✅ 原生 Smart Mode:自动去口水词 um/呃 + 自动修正口误重来 |
| 说话人分离 + 词级时间戳 | 流式不支持;Batch 仅基础支持 | 开启时间戳严重影响准确率与耗时 | ✅ 最多 8 人说话人分离 + 词级时间戳 (完美支撑手机端 60 字二次切分) |
| 自定义词汇表 (Vocabulary) | 短语适配 (Phrase adaptation) | 最多 5,000 短语 | ✅ 自定义词汇表偏置 (最高 1,000 专有词条免训练即时生效) |
| 区域可用性与稳定性 | GA | 🚨 europe-west2 / asia-northeast1 下线报错 Permission denied | ✅ Vertex AI Global 全球统一端点 + 10分钟超长 WebSocket 会话 |
| 计费模式 (Pricing) | 按分钟计费 (bash.016/分) | 标准 bash.016/分 · 动态 Batch bash.003/分 | 💰 按音频 Token 计费 (~25 tokens/秒):Live /千分钟,Batch /千分钟 |