← 返回媒体管线

语音转写

上传音视频,AI 转文字 + 三视角总结
数据去向 本地存储 需上传 详情

本地存储:文件只经服务器中转给站长本机,不在服务器落盘留存;文稿与总结结果只存在你自己的浏览器里 —— 只存在本浏览器,清缓存或换电脑会丢,请定期备份。

需上传:上传的音视频会发到服务器,由站长本机的语音识别(FunASR)做转写,识别过程全程在站长本机完成;生成 AI 总结时会把文字稿发给 DeepSeek 提炼

正在检测本地识别引擎…

🎙️ 上传音视频

支持 WAV / MP3 / M4A / FLAC 等音频,以及 MP4 / MOV / MKV 等视频(自动提取音轨);单个文件最大 500MB。

点击选择文件,或拖拽到这里
音频 / 视频均可,最大 500MB
📄
准备中…
使用说明
选好音频/视频后点「开始转写」,页面上实时出带时间戳的文稿;中文识别用本地 SenseVoice 模型。
转写完成可编辑文稿修正同音错别字,勾选视角生成总结,或一键导出 Word / SRT / TXT。
识别过程在站长本机的显卡上跑,站长机器不在线或人多时要排队,页面上有实时进度。
数据说明
你上传的文件只经服务器中转给站长本机做识别,服务器不落盘存储,处理完不留副本; 语音识别在站长本机完成,不发给任何第三方;AI 总结会把转写后的文字稿发给 DeepSeek(api.deepseek.com)提炼。
转写文稿与总结结果只存在你自己的浏览器里(清空浏览器数据才会没)。

语音转写怎么用

  1. 上传音视频(mp3/wav/mp4/mov 等,最大 500MB),可选「区分发言人」
  2. 点「开始转写」,本地 AI 实时出带时间戳的文稿
  3. 勾选视角(逻辑梳理/会议纪要/要点速记)生成总结,或导出 Word/SRT/TXT

常见问题

转写准不准?

中文识别质量很好,可当逐字稿用;可选发言人分离。个别专有名词/同音字可能出错,文稿可直接编辑后导出。

要等多久?

取决于音频时长和站长机器当前是否空闲。转写走站长本机的显卡,人多时要排队,页面上有实时进度。

上传的文件会留在你们服务器上吗?

不会。文件只经服务器中转给站长本机做识别,服务器不落盘存储;识别完返回给你后不留副本。

支持哪些格式?

常见音视频格式都支持(mp3/wav/m4a/aac/flac/ogg/mp4/mov/mkv/avi 等),单个文件最大 500MB。

🏠