← 返回媒体管线

语音转写

上传音视频,AI 转文字 + 三视角总结
数据去向 本地存储 需上传 详情

本地存储:文件只在服务器内存里过一遍、不落盘留存;文稿与总结结果只存在你自己的浏览器里 —— 只存在本浏览器,清缓存或换电脑会丢,请定期备份。

需上传:上传的音视频会发到服务器,一般由服务器交给硅基流动(SiliconFlow)的语音识别转写;勾选「区分发言人」或文件超过 25MB 时改由站长本机识别;生成 AI 总结时会把文字稿发给 DeepSeek 提炼

正在检测识别引擎…

🎙️ 上传音视频

支持 WAV / MP3 / M4A / FLAC 等音频,以及 MP4 / MOV / MKV 等视频(自动提取音轨);单个文件最大 500MB。

点击选择文件,或拖拽到这里
音频 / 视频均可,最大 500MB
📄
准备中…
使用说明
选好音频/视频后点「开始转写」,页面上出带时间戳的文稿;中文识别用 SenseVoice 模型。
转写完成可编辑文稿修正同音错别字,勾选视角生成总结,或一键导出 Word / SRT / TXT。
25MB 以内的文件直接在云端识别,几十秒出稿,时间点按字数估算(做精确字幕请勾「区分发言人」走站长本机); 勾「区分发言人」或文件更大时要用站长本机的显卡,站长机器不在线时暂不可用。
数据说明
你上传的文件只在服务器内存里过一遍,服务器不落盘存储,处理完不留副本; 语音识别一般交给 硅基流动(api.siliconflow.cn),勾「区分发言人」或文件超过 25MB 时改由站长本机识别;AI 总结会把转写后的文字稿发给 DeepSeek(api.deepseek.com)提炼。
转写文稿与总结结果只存在你自己的浏览器里(清空浏览器数据才会没)。

语音转写怎么用

  1. 上传音视频(mp3/wav/mp4/mov 等,25MB 以内直接云端识别),可选「区分发言人」
  2. 点「开始转写」,几十秒出带时间戳的文稿
  3. 勾选视角(逻辑梳理/会议纪要/要点速记)生成总结,或导出 Word/SRT/TXT

常见问题

转写准不准?

中文识别质量很好,可当逐字稿用;可选发言人分离。个别专有名词/同音字可能出错,文稿可直接编辑后导出。

要等多久?

25MB 以内的文件直接在云端识别,一般几十秒出稿;勾「区分发言人」或文件更大时要用站长本机的显卡,站长机器不在线时暂不可用。

上传的文件会留在你们服务器上吗?

不会。文件只在服务器内存里过一遍,交给语音识别服务(硅基流动;区分发言人时是站长本机)处理,服务器不落盘存储,识别完返回给你后不留副本。

支持哪些格式?

常见音视频格式都支持(mp3/wav/m4a/aac/flac/ogg/mp4/mov/mkv/avi 等),单个文件最大 500MB。

🏠