gpt-transcribe
面向已录完的文件与批量任务:会议、播客、客服录音。异步转写,也可边处理边吐字。
- 文件转录新推荐起点,接班 whisper-1
- 真实世界录音词错误率 8.98%,whisper-1 为 15.21%
- 在口音、短句、数字与专业术语上更稳
- 真实录音 WER
- 8.98%
GPT Transcribe 把会议、电话和直播转成干净文本。已录文件用 gpt-transcribe,实时音频用 gpt-live-transcribe,并可附带场景描述、关键词与多语言提示。
GPT Transcribe
转写预览

客户来电咨询高级套餐与账号 AC-42。确认了账单周期,通话中混入西班牙语,并预约周四下午 3 点回访。
在线生成器
上传录音走 gpt-transcribe,或开麦做实时字幕。可选填场景提示、关键词与语言提示,提升专业名词与多语言准确率。
拖拽音频到这里,或点击上传
mp3 / mp4 / m4a / wav / webm · 最大 25MB · gpt-transcribe
新模型把上下文做成一等能力:描述场景、列出术语、提示混说语言。关键词只是提示,音频里没说就不会硬塞进稿子。
文字稿
可编辑结果,就绪后复制
使用方法
上传或录音,可选补充场景、关键词与语言,运行转写,再复制并轻度编辑文稿。
文件模式处理已录好的音频;实时模式打开麦克风并显示临时字幕。
描述场景、列出术语、提示语言。不需要的字段可留空。
文件任务使用 gpt-transcribe。实时会话先流式出字,再定稿为更干净的文字。
在线编辑结果,一键复制;若关键术语遗漏,加强关键词后重跑。
两个模型,分工明确
OpenAI 把转录拆成两个推荐入口。判断标准只有一条:音频还在不在产生。
面向已录完的文件与批量任务:会议、播客、客服录音。异步转写,也可边处理边吐字。
面向低延迟实时转写(WebSocket / WebRTC):字幕、通话、仍在说的音频流。
清晰流程
上传或说话,补上模型真正会用的上下文,再复制草稿轻度校对——而不是整场重听。
01已录完的文件走 gpt-transcribe;需要边说边出字则开麦克风。
02可选场景描述、关键词表、语言列表——新模型在训练里学会了用这些信息。
03检查文稿、复制到笔记或文档;若专业词仍有误,加强关键词再跑一次。
真正升级的地方
关键不只是更低 WER。新模型学会使用场景描述、关键词与多语言提示;同样的提示喂给老模型,几乎不动甚至退步。
+3.6 / +6.1
给上下文后语义准确率提升(文件 / 实时)
57+
演示中提及的语言覆盖(请用你的语种实测)
告诉模型这是客服电话、问诊还是产品演示,人名、订单号与行业说法更稳。
传入产品名、药名、缩写。只有音频里真说了才会进稿,不会硬塞。
可传多种语言码(如 en + zh-cn)。中途换语言无需手动切换。
对口音、短句、数字、专业术语与嘈杂背景更稳。
真实场景
从归档录音到实时字幕——按音频是否仍在产生选择模型。
用 gpt-transcribe 批量转长录音,轻改草稿即可,不必整场回听。
把账号与套餐名做成关键词,电话音质下订单号与产品词更稳。
通话、课堂、活动需要边说边出字时,走 gpt-live-transcribe。
口述备忘与多语言备忘录,可用语言提示处理混说。
常见问题
关于 gpt-transcribe、gpt-live-transcribe 与在线生成器的实用解答。