可从B站视频提取字幕并自动总结:一、网页端手动导出;二、API直取XML字幕;三、用bilibili-api-python+BERT摘要;四、Tampermonkey捕获动态字幕流。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望从B站长视频中快速获取核心内容,但视频本身未提供摘要或字幕不可见,则可能是由于字幕未内嵌、API接口限制或解析工具不兼容所致。以下是实现B站视频字幕提取与内容自动总结的具体操作路径:
一、使用Bilibili网页端手动导出字幕
该方法依赖B站官方字幕显示功能,适用于有CC字幕且已开启“智能字幕”或UP主上传了SRT/ASS字幕的视频。字幕文本可被直接复制用于后续总结。
1、打开目标B站视频页面,点击右下角“设置”图标(齿轮形状)。
2、在弹出菜单中选择“字幕”选项,确保已启用“显示字幕”并选中可用语言轨道。
3、按下Ctrl+Shift+I(Windows/Linux)或Cmd+Option+I(Mac)打开开发者工具,切换至“Console”标签页。
4、粘贴并执行以下代码:JSON.stringify(window.player?.getVideoData?.()?.subtitle?.subtitles || [], null, 2)。
5、若返回非空数组,复制输出结果,用在线JSON转SRT工具转换为可读字幕文件。
二、通过Bilibili API直取字幕URL
该方法绕过前端限制,直接调用B站字幕接口获取原始XML格式字幕,适用于有字幕ID(如sid=123456)且未设权限屏蔽的视频。
1、在视频播放页右键检查元素,搜索关键词subtitle或danmaku,定位包含subtitle_url或subtitles字段的JSON响应。
2、提取其中subtitles数组内首个对象的url值,该地址形如https://api.bilibili.com/x/click-interface/v2/subtitle?oid=xxx&pid=xxx。
3、在新浏览器标签中访问该URL,确认返回HTTP状态码为200且响应体含<tt>标签结构的XML内容。
4、将XML内容保存为subtitle.xml,使用Python脚本或在线XML转TXT工具提取纯文本行。
三、借助第三方工具批量提取与摘要
该方法整合字幕抓取与NLP摘要生成,适用于需处理多个视频或无技术背景用户,依赖可信开源工具链。
1、安装bilibili-api-python库:执行pip install bilibili-api-python。
2、运行脚本调用get_subtitle方法传入bvid和cid,获取字幕JSON对象。
3、对返回的body字段列表进行清洗,去除时间戳与样式标记,合并为连续段落。
4、将清洗后文本输入transformers库加载的facebook/bart-large-cnn模型,设置max_length=300生成摘要。
四、利用浏览器扩展实时捕获字幕流
该方法适用于动态加载字幕(如WebVTT流)且无法通过静态API获取的场景,依赖扩展注入脚本监听字幕DOM变更。
1、安装支持内容脚本注入的浏览器扩展,如“Tampermonkey”。
2、新建脚本,设置匹配规则为https://www.bilibili.com/video/*。
3、在脚本中监听document.querySelector('.bpx-player-subtitle-video')是否存在,一旦出现即读取其textTracks[0].cues。
4、遍历cues集合,提取cue.text属性并拼接,每5秒间隔插入分隔符[BREAK]以保留语义断点。



















