Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

5 Commits
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

视频内容总结助手(Video Summary Helper)

License

把老师录制的论文修改意见视频(或腾讯会议录像)上传后,自动完成: 语音转字幕 → AI 提炼修改意见 → 导出 Word/Markdown → 可继续追问

桌面软件(Windows):本地 Whisper 语音识别(隐私安全、免费离线)+ DeepSeek V4 AI 总结, 支持通用视频总结与学习笔记模式,处理记录自动留存,可打包为独立 exe 分发。

功能

  • 导入 mp4 / mkv / mov / webm 等视频,或 mp3 / wav 等录音;支持多选批量处理(串行队列,可停止)
  • 本地 Whisper 语音识别(免费、离线、隐私安全),带时间戳字幕
  • 三种识别模型可选(设置页含体积与适用场景说明),切换后点「重新识别」即可用新模型重新转写
  • 不兼容编码的视频(如腾讯会议 VP9/AV1)自动转码为可播放格式,无需手动处理
  • 字幕与视频播放器同步:播放高亮当前句(深色底白字)、点击字幕跳转、双击修正错字
  • 三种总结模式(设置页切换,卡片与导出自动跟随):
    • 论文修改意见:提炼标题 / 优先级 / 时间段 / 问题 / 修改建议
    • 通用视频总结:核心要点 + 行动项
    • 学习笔记:概念 / 结论 / 考点延伸
  • AI(DeepSeek V4)把字幕提炼成结构化内容,每条含 标题 / 优先级 / 视频时间段 / 内容 / 延伸
  • 导出三类文件:
    • 字幕 (.txt):逐行 [mm:ss] 内容
    • 总结 (.md / .docx):按优先级排序,文件末尾含「追问记录」章节
  • 对话式追问:继续问"第三条意见具体指哪部分?"等,追问内容随总结一并导出
  • 「处理记录」页:每次处理的视频自动保存完整快照(字幕/意见/追问),可随时载入回顾;右键删除记录(可连带删除音频文件);「数据管理」可清理音频提取文件与识别模型,由你决定保留哪些数据

运行环境

  • Windows 10/11,Python 3.12+(已在 3.14 验证)
  • 首次使用某模型时自动下载(small≈460MB / medium≈1.5GB / large-v3≈3GB)
    • 下载源自动选择:本机缓存 → HuggingFace 镜像(hf-mirror)→ 魔搭 ModelScope(国内稳定),模型存于 work/models/
  • AI 总结需 DeepSeek API Key(https://platform.deepseek.com 注册,总结一次视频约几分钱)

快速开始

# 1. 创建虚拟环境并安装依赖
python -m venv .venv
.\.venv\Scripts\pip install -r requirements.txt

# 2. 启动
.\.venv\Scripts\python main.py

启动后点击工具栏「设置」,填入 DeepSeek API Key(仅保存在本机 settings.json)。

打包为独立应用(无需 Python 环境)

.\.venv\Scripts\pip install pyinstaller
.\.venv\Scripts\python -m PyInstaller --name "视频总结助手" --windowed --noconfirm --clean `
  --collect-all imageio_ffmpeg --collect-all faster_whisper --collect-all ctranslate2 `
  --collect-all av --collect-all tokenizers main.py

产物在 dist/视频总结助手/,双击 视频总结助手.exe 即可运行(首次约 450MB)。 打包后数据(模型缓存、记录、配置)保存在 exe 同目录下的 work/records.jsonsettings.json

打包自检(验证 ffmpeg/模型/转写链路正常):

视频总结助手.exe --selftest 某段测试音频.wav

正常输出 SELFTEST OK: 识别 N 条字幕...

使用流程

  1. 点击「导入视频/录音」,选择老师录制的视频(或腾讯会议录像导出文件);可多选批量处理
  2. 等待自动提取音频并转写字幕(状态栏显示进度,批量时自动逐个处理)
  3. 「字幕浏览」页可播放视频、对照字幕,双击字幕可修正识别错误
  4. 切到「AI 总结」页,点击「生成总结」;可继续在下方追问
  5. 工具栏「导出 ▾」菜单:导出字幕 (.txt) 或总结 (.md / .docx,含追问记录)
  6. 识别效果不理想:在「设置」切换识别模型,点「重新识别」重跑

常见问题

  • 转写太慢:默认 small 模型。在「设置」中可换 medium(更准但更慢);视频较长时建议拆分。
  • 模型下载失败/卡住:程序会自动尝试 hf-mirror 与魔搭 ModelScope 两个下载源;若仍失败请检查网络,稍后重试。
  • 视频播放黑屏/无声:腾讯会议部分录像用 VP9/AV1 编码,导入后会自动转码(首次约多等几分钟,提示在状态栏),之后播放正常。
  • 识别中文不准:确认「设置 → 识别语言」为 zh;嘈杂录音建议先用腾讯会议/软件自带的音频降噪。
  • AI 总结失败:检查 API Key、余额;DeepSeek 需账户有余额。
  • 总结模型选择:V4 Flash(便宜,推荐)与 V4 Pro(分析更深、价格更高)在「设置」中切换。
  • 总结模式:论文修改意见 / 通用视频总结 / 学习笔记在「设置」中切换,导出与卡片展示自动适应。

项目结构

main.py                      # 入口
app/
├── models.py                # 数据模型(字幕段/修改意见/任务)
├── config.py                # 配置读写(settings.json)
├── workers.py               # 后台线程(转写/总结/追问)
├── services/
│   ├── audio_extract.py     # ffmpeg 提取音频
│   ├── asr.py               # faster-whisper 本地转写
│   ├── model_download.py    # 模型下载(本地/HF镜像/魔搭多源 fallback)
│   ├── playback.py          # 播放编码检测 + 自动转码
│   ├── summarizer.py        # DeepSeek 总结(三种模式)+ 追问
│   ├── exporter.py          # 字幕/总结导出(txt/Markdown/Word)
│   └── record_store.py      # 处理记录存取(records.json)
└── ui/
    ├── main_window.py       # 主窗口
    ├── transcript_view.py   # 字幕同步浏览/编辑
    ├── summary_view.py      # 意见卡片 + 追问
    ├── records_view.py      # 处理记录 + 数据管理
    └── settings_dialog.py   # 设置页

隐私说明

  • 语音识别完全在本地进行,视频/音频不会上传到任何服务器
  • DeepSeek API Key 仅保存在本机 settings.json,仅用于调用总结接口;字幕文本会发送给 DeepSeek 用于生成总结(请在设置页阅读提示)
  • 处理记录(字幕/总结快照)只保存在本机 records.json

开源协议

本项目采用 Apache License 2.0。欢迎提交 Issue 与 PR。

扩展方向

  • 通用视频总结模式(换提示词预设即可支持任意视频内容总结)
  • 批量处理多段视频
  • 打包为独立 exe(PyInstaller)

About

桌面软件:视频/录音 → 本地Whisper转字幕 → DeepSeek AI提炼修改意见/通用总结/学习笔记 → 导出Word/Markdown,支持批量处理与历史记录(Windows)

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages