把老师录制的论文修改意见视频(或腾讯会议录像)上传后,自动完成: 语音转字幕 → AI 提炼修改意见 → 导出 Word/Markdown → 可继续追问
桌面软件(Windows):本地 Whisper 语音识别(隐私安全、免费离线)+ DeepSeek V4 AI 总结, 支持通用视频总结与学习笔记模式,处理记录自动留存,可打包为独立 exe 分发。
- 导入 mp4 / mkv / mov / webm 等视频,或 mp3 / wav 等录音;支持多选批量处理(串行队列,可停止)
- 本地 Whisper 语音识别(免费、离线、隐私安全),带时间戳字幕
- 三种识别模型可选(设置页含体积与适用场景说明),切换后点「重新识别」即可用新模型重新转写
- 不兼容编码的视频(如腾讯会议 VP9/AV1)自动转码为可播放格式,无需手动处理
- 字幕与视频播放器同步:播放高亮当前句(深色底白字)、点击字幕跳转、双击修正错字
- 三种总结模式(设置页切换,卡片与导出自动跟随):
- 论文修改意见:提炼标题 / 优先级 / 时间段 / 问题 / 修改建议
- 通用视频总结:核心要点 + 行动项
- 学习笔记:概念 / 结论 / 考点延伸
- AI(DeepSeek V4)把字幕提炼成结构化内容,每条含 标题 / 优先级 / 视频时间段 / 内容 / 延伸
- 导出三类文件:
- 字幕 (.txt):逐行
[mm:ss] 内容 - 总结 (.md / .docx):按优先级排序,文件末尾含「追问记录」章节
- 字幕 (.txt):逐行
- 对话式追问:继续问"第三条意见具体指哪部分?"等,追问内容随总结一并导出
- 「处理记录」页:每次处理的视频自动保存完整快照(字幕/意见/追问),可随时载入回顾;右键删除记录(可连带删除音频文件);「数据管理」可清理音频提取文件与识别模型,由你决定保留哪些数据
- Windows 10/11,Python 3.12+(已在 3.14 验证)
- 首次使用某模型时自动下载(small≈460MB / medium≈1.5GB / large-v3≈3GB)
- 下载源自动选择:本机缓存 → HuggingFace 镜像(hf-mirror)→ 魔搭 ModelScope(国内稳定),模型存于
work/models/
- 下载源自动选择:本机缓存 → HuggingFace 镜像(hf-mirror)→ 魔搭 ModelScope(国内稳定),模型存于
- AI 总结需 DeepSeek API Key(https://platform.deepseek.com 注册,总结一次视频约几分钱)
# 1. 创建虚拟环境并安装依赖
python -m venv .venv
.\.venv\Scripts\pip install -r requirements.txt
# 2. 启动
.\.venv\Scripts\python main.py启动后点击工具栏「设置」,填入 DeepSeek API Key(仅保存在本机 settings.json)。
.\.venv\Scripts\pip install pyinstaller
.\.venv\Scripts\python -m PyInstaller --name "视频总结助手" --windowed --noconfirm --clean `
--collect-all imageio_ffmpeg --collect-all faster_whisper --collect-all ctranslate2 `
--collect-all av --collect-all tokenizers main.py产物在 dist/视频总结助手/,双击 视频总结助手.exe 即可运行(首次约 450MB)。
打包后数据(模型缓存、记录、配置)保存在 exe 同目录下的 work/、records.json、settings.json。
打包自检(验证 ffmpeg/模型/转写链路正常):
视频总结助手.exe --selftest 某段测试音频.wav
正常输出 SELFTEST OK: 识别 N 条字幕...。
- 点击「导入视频/录音」,选择老师录制的视频(或腾讯会议录像导出文件);可多选批量处理
- 等待自动提取音频并转写字幕(状态栏显示进度,批量时自动逐个处理)
- 「字幕浏览」页可播放视频、对照字幕,双击字幕可修正识别错误
- 切到「AI 总结」页,点击「生成总结」;可继续在下方追问
- 工具栏「导出 ▾」菜单:导出字幕 (.txt) 或总结 (.md / .docx,含追问记录)
- 识别效果不理想:在「设置」切换识别模型,点「重新识别」重跑
- 转写太慢:默认 small 模型。在「设置」中可换 medium(更准但更慢);视频较长时建议拆分。
- 模型下载失败/卡住:程序会自动尝试 hf-mirror 与魔搭 ModelScope 两个下载源;若仍失败请检查网络,稍后重试。
- 视频播放黑屏/无声:腾讯会议部分录像用 VP9/AV1 编码,导入后会自动转码(首次约多等几分钟,提示在状态栏),之后播放正常。
- 识别中文不准:确认「设置 → 识别语言」为 zh;嘈杂录音建议先用腾讯会议/软件自带的音频降噪。
- AI 总结失败:检查 API Key、余额;DeepSeek 需账户有余额。
- 总结模型选择:V4 Flash(便宜,推荐)与 V4 Pro(分析更深、价格更高)在「设置」中切换。
- 总结模式:论文修改意见 / 通用视频总结 / 学习笔记在「设置」中切换,导出与卡片展示自动适应。
main.py # 入口
app/
├── models.py # 数据模型(字幕段/修改意见/任务)
├── config.py # 配置读写(settings.json)
├── workers.py # 后台线程(转写/总结/追问)
├── services/
│ ├── audio_extract.py # ffmpeg 提取音频
│ ├── asr.py # faster-whisper 本地转写
│ ├── model_download.py # 模型下载(本地/HF镜像/魔搭多源 fallback)
│ ├── playback.py # 播放编码检测 + 自动转码
│ ├── summarizer.py # DeepSeek 总结(三种模式)+ 追问
│ ├── exporter.py # 字幕/总结导出(txt/Markdown/Word)
│ └── record_store.py # 处理记录存取(records.json)
└── ui/
├── main_window.py # 主窗口
├── transcript_view.py # 字幕同步浏览/编辑
├── summary_view.py # 意见卡片 + 追问
├── records_view.py # 处理记录 + 数据管理
└── settings_dialog.py # 设置页
- 语音识别完全在本地进行,视频/音频不会上传到任何服务器
- DeepSeek API Key 仅保存在本机
settings.json,仅用于调用总结接口;字幕文本会发送给 DeepSeek 用于生成总结(请在设置页阅读提示) - 处理记录(字幕/总结快照)只保存在本机
records.json
本项目采用 Apache License 2.0。欢迎提交 Issue 与 PR。
- 通用视频总结模式(换提示词预设即可支持任意视频内容总结)
- 批量处理多段视频
- 打包为独立 exe(PyInstaller)