首页 导航 文章 关于

AI视频分段工具

智能识别视频内容,按主题自动分段,让长视频整理效率提升 10 倍

免费下载

下载前请先阅读使用说明,需配置通义千问 API Key

界面预览

AI视频分段工具主界面

简洁直观的 Web 操作界面

核心功能

语音识别

使用 Whisper 模型将视频音频转换为带时间戳的文本

主题分析

调用通义千问 API 分析内容结构,识别主题切换点

智能分段

按语义完整位置分段,确保每个片段内容连贯

内容摘要

为每个片段生成主题、内容摘要和重点备注

字幕生成

生成独立的 SRT 字幕文件,可导入剪映

技术流程

1

语音识别

使用 Whisper 模型将视频中的语音转换为带时间戳的文本字幕

Whisper
2

主题分析

调用通义千问 API,分析字幕内容识别主题切换点和自然分段位置

通义千问 API
3

视频裁剪

按分段点使用 FFmpeg 精确裁剪视频,生成独立片段

FFmpeg
4

字幕提取

从原始字幕中提取对应时间轴的字幕片段,保持同步

SRT 字幕

输出文件

segment_01.mp4

视频片段文件

segment_01.srt

同步字幕文件

SEGMENTS.md

分段说明文档

segments_data.json

JSON 格式数据

*_timeline.xml

FCP/达芬奇时间线

适用场景

✅ 课程视频整理
✅ 直播回放剪辑
✅ 采访视频处理
✅ 会议录像整理
✅ 知识付费内容制作

常见问题

怎么把一节 2 小时的网课视频按知识点自动切分成小段?
用 AI 视频分段工具。它先用 Whisper 把视频语音转成带时间戳的字幕,再调用通义千问分析字幕内容,识别主题切换点,在语义完整位置自动切分。每段会生成独立的 mp4 片段、srt 字幕、内容摘要,2 小时视频约需 20-40 分钟处理完。
AI 视频分段和手动按时间切分有什么区别?
手动切分按固定时长(如每 5 分钟一段),切点可能在句子中间,破坏内容连贯性。AI 分段是按语义切,识别「这里讲完一个知识点了」才切,每段内容完整、主题清晰,还附带摘要。对知识付费、课程剪辑场景,AI 分段完胜手动。
这个工具为什么要配置通义千问 API Key?收费吗?
主题分析依赖通义千问大模型理解字幕内容,所以需要 API Key。可以访问 通义千问控制台 获取,新用户有免费额度(足够处理几十小时视频),超出后按量计费,1 小时视频分析成本约 0.1-0.3 元。Whisper 语音识别在本地运行,不消耗 API。
分段后的视频怎么导入剪映或 PR?
工具会同时输出三种文件:①独立 mp4 片段(直接拖进任何剪辑软件);②srt 字幕文件(剪映直接导入字幕轨道);③FCP XML 时间线(PR/达芬奇/FCP 可导入完整时间线结构)。剪映用户建议用前两种。
1 小时的直播回放,AI 分段需要多久?
用 Whisper base 模型,1 小时视频约需 10-20 分钟。如果有 NVIDIA 显卡(CUDA 加速),可缩短到 5-8 分钟。处理时间主要花在语音识别,主题分析是秒级返回。
分段的切点准不准?会不会把一句话从中间切断?
工具在识别主题切换点后,会回溯到最近的「语义停顿位置」(句号、问号、较长沉默)才切,不会从句子中间断开。准确率约 85-92%,少数情况下需要手动微调切点。处理完会生成 SEGMENTS.md 文档,可以一眼看到每段主题,方便核对。
这个工具能在 Mac 上用吗?
目前只支持 Windows 10/11。Mac 用户需要手动安装 Python 3 和依赖(Whisper、FFmpeg、OpenCV),技术门槛较高。建议 Mac 用户先用网页版 Whisper 服务转字幕,再手动分段。

系统要求

Windows 10 / 11
5GB 可用空间(模型)
8GB 内存推荐
网络连接(API调用)