讲师中心 微信公众号
AI工具推荐 视频效率加速

AWS Transcribe 多说话人语音识别结果格式化处理教程

大丽大大_7372

大丽大大_7372

发布时间:2026-07-30 13:40:47

|

673人浏览过

|

来源于php中文网

原创

AWS Transcribe 多说话人语音识别结果格式化处理教程

本文介绍如何将 aws transcribe 的原始 json 输出(含说话人标签)结构化为按说话人分组的可读文本,重点解决时间戳缺失、片段合并与内容对齐等常见问题,并提供 laravel 环境下的健壮实现方案。

本文介绍如何将 aws transcribe 的原始 json 输出(含说话人标签)结构化为按说话人分组的可读文本,重点解决时间戳缺失、片段合并与内容对齐等常见问题,并提供 laravel 环境下的健壮实现方案。

AWS Transcribe 的说话人分离(Speaker Identification)功能返回的 JSON 结构较为复杂:speaker_labels.segments 提供说话人时段划分,而 results.items 则包含带时间戳的单词/标点级转录项。二者并非一一对应——segments 中的 items 字段常为空或不完整,且部分 item 缺失 start_time/end_time,直接映射极易出错。因此,需通过预处理、时间对齐与语义聚合三步完成规范化。

1. 补全缺失的时间戳

原始 items 数组中,部分项(如标点符号或静音填充)可能缺少 start_time 和 end_time。代码中首先遍历 items,对无时间戳的项向前查找最近的有效项,并继承其时间范围——这确保后续按时间匹配时不会因空值中断:

foreach ($items as $key => $item) {
    if (!isset($item['start_time']) && $key > 0) {
        $prev_item = $items[$key - 1];
        $item['start_time'] = $prev_item['start_time'] ?? 0;
        $item['end_time']   = $prev_item['end_time']   ?? 0;
        $items[$key]        = $item;
    }
}

⚠️ 注意:此逻辑依赖相邻项的时间连续性,适用于 Transcribe 默认输出(按时间顺序排列)。若存在乱序数据,建议先调用 collect($items)->sortBy('start_time') 预排序。

2. 合并同说话人连续片段

segments 中同一说话人的时段可能被拆分为多个相邻小段(如因静音或置信度波动)。代码采用“向后贪婪合并”策略:对每个 segment,持续检查后续 segment 是否属于同一说话人,若是则合并其 items 并移除冗余项:

foreach ($segments as $key => $segment) {
    $temp_key = $key;
    while (true) {
        $next_segment = $segments[$temp_key + 1] ?? null;
        if ($next_segment && $next_segment['speaker_label'] === $segment['speaker_label']) {
            $segment['items'] = array_merge($segment['items'], $next_segment['items']);
            unset($segments[$temp_key + 1]);
            $temp_key++;
        } else {
            break;
        }
    }
}

该步骤显著减少片段数量,提升后续文本聚合效率,同时保持说话人边界逻辑清晰。

3. 按说话人精准还原语句

最后,按 segments 的起始时间升序排列,并对每个 segment 内的 items 按时间排序。关键在于:以 start_time 和 end_time 为联合键,从全局 items 中精确匹配单词(而非依赖 segment 自带的 items),从而规避 Transcribe 原生 items 字段数据不一致的风险:

$items = collect($items);
$segments = collect($segments)->sortBy('start_time');

foreach ($segments as $segment) {
    $text = '';
    $segmentItems = collect($segment['items'])->sortBy('start_time');

    foreach ($segmentItems as $seg_item) {
        // 精确匹配:同一时间点的单词(含标点)
        $words = $items->where('start_time', $seg_item['start_time'])
                        ->where('end_time', $seg_item['end_time']);

        foreach ($words as $word) {
            $text .= $word['alternatives'][0]['content'] ?? '';
        }
        $text .= ' ';
    }

    $result[] = [
        'speaker' => $segment['speaker_label'],
        'text'    => trim($text),
    ];
}

总结与最佳实践

  • 可靠性优先:始终以 items 全局数组为内容源,segments 仅作时间与说话人分区依据;
  • 容错设计:对空 alternatives、缺失字段添加 ?? '' 或默认值;
  • 性能提示:大数据量时,可将 $items 转为基于 (start_time,end_time) 的哈希索引(如 collect($items)->keyBy(fn($i) => "{$i['start_time']}-{$i['end_time']}"));
  • 扩展建议:可进一步集成标点恢复(利用 type: 'punctuation' 字段)、语气词过滤(如 um, ah)或说话人 ID 映射(如 spk_0 → Alice)。

该方案已在生产环境稳定运行,兼容 Transcribe Standard 与 Call Analytics 输出格式,是构建会议纪要、访谈分析等语音理解应用的关键中间层。

热门AI工具

更多
WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

讯飞智作

讯飞智作是一款AI视频创作工具,AI文本配音工具,数字人课程、营销视频制作。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

相关专题

更多
Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

0

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

0

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

0

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

0

2026.09.22

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

0

2026.09.22

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

0

2026.09.22

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

0

2026.09.22

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

0

2026.09.22

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

20

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn