gpt-transcribe
面向已录完的文件与批量任务:会议、播客、客服录音。异步转写,也可边处理边吐字。
- 文件转录新推荐起点,接班 whisper-1
- 真实世界录音词错误率 8.98%,whisper-1 为 15.21%
- 在口音、短句、数字与专业术语上更稳
- 真实录音 WER
- 8.98%
使用方法
上传或录音,可选补充场景、关键词与语言,运行转写,再复制并轻度编辑文稿。
文件模式处理已录好的音频;实时模式打开麦克风并显示临时字幕。
描述场景、列出术语、提示语言。不需要的字段可留空。
文件任务使用 gpt-transcribe。实时会话先流式出字,再定稿为更干净的文字。
在线编辑结果,一键复制;若关键术语遗漏,加强关键词后重跑。
两个模型,分工明确
OpenAI 把转录拆成两个推荐入口。判断标准只有一条:音频还在不在产生。
面向已录完的文件与批量任务:会议、播客、客服录音。异步转写,也可边处理边吐字。
面向低延迟实时转写(WebSocket / WebRTC):字幕、通话、仍在说的音频流。
清晰流程
上传或说话,补上模型真正会用的上下文,再复制草稿轻度校对——而不是整场重听。
01已录完的文件走 gpt-transcribe;需要边说边出字则开麦克风。
02可选场景描述、关键词表、语言列表——新模型在训练里学会了用这些信息。
03检查文稿、复制到笔记或文档;若专业词仍有误,加强关键词再跑一次。
真正升级的地方
关键不只是更低 WER。新模型学会使用场景描述、关键词与多语言提示;同样的提示喂给老模型,几乎不动甚至退步。
+3.6 / +6.1
给上下文后语义准确率提升(文件 / 实时)
57+
演示中提及的语言覆盖(请用你的语种实测)
告诉模型这是客服电话、问诊还是产品演示,人名、订单号与行业说法更稳。
传入产品名、药名、缩写。只有音频里真说了才会进稿,不会硬塞。
可传多种语言码(如 en + zh-cn)。中途换语言无需手动切换。
对口音、短句、数字、专业术语与嘈杂背景更稳。
真实场景
从归档录音到实时字幕——按音频是否仍在产生选择模型。
用 gpt-transcribe 批量转长录音,轻改草稿即可,不必整场回听。
把账号与套餐名做成关键词,电话音质下订单号与产品词更稳。
通话、课堂、活动需要边说边出字时,走 gpt-live-transcribe。
口述备忘与多语言备忘录,可用语言提示处理混说。
恭喜!你已解锁专属优惠价
50% OFF
定价
订阅更划算,也可按需购买积分。积分用于在线生成器,在同一账户内共享。
无需订阅,小额积分包适合先试用。
适合偶尔做内容项目的灵活积分包。
适合不订阅但需要较高用量的一次性积分包。
常见问题
关于 gpt-transcribe、gpt-live-transcribe 与在线生成器的实用解答。