App Pro 功能
AI 字幕翻译
为视频生成翻译字幕,播放时与画面同步显示。视频有字幕轨道时直接翻译字幕;没有字幕时,先对音频进行语音识别,再翻译。生成的字幕保存在视频所在的文件夹中,其他设备打开同一个视频时直接加载。
适用范围
哪些应用可以使用
iPhone、iPad、Mac、Apple TV、Apple Vision Pro、Windows、Android 手机与电视,以及 Meta Quest 上的 CloudDrive2 应用都可以使用。AI 字幕翻译属于 App Pro,一次购买,登录同一个 CloudDrive 账号的所有设备都可以使用。
AI 翻译的结果可能不完全准确,质量取决于所用的模型。
语音识别和翻译由两种方式完成:你的设备自带的模型,或你自己配置的外部 API。CloudDrive2 不运营任何语音识别或翻译服务器,也不代你调用这类服务。使用外部 API 时,需要你自己向服务商申请 API 密钥,费用和数据处理由该服务商负责。
翻译来源
翻译字幕,或识别音频
在「翻译来源」中选择。翻译字幕轨道比识别音频快,也更准确。
自动(优先字幕)
默认选项。视频有字幕轨道时翻译字幕,没有时识别音频。
字幕轨道
直接翻译视频中已有的字幕,例如外语字幕。蓝光的 PGS 图形字幕是图片,会先经过文字识别(OCR)转成文本再翻译。
音频轨道
对视频的对白进行语音识别,再把识别出的文字翻译成目标语言。5.1 与 7.1 音轨可以只识别对白声道,减少音乐和音效的干扰。
「源语言」是视频中所说的语言,「目标语言」是要生成的字幕语言。两者在设置里有默认值,也可以为每个视频单独选择。选择具体的源语言,识别更准确。
模型
各平台的语音识别与翻译
语音识别和翻译是两个独立的步骤,可以分别选择在设备端运行,或使用远程 API。设备端模型免费,音频和字幕文本不离开设备。
| 平台 | 语音识别 | 翻译 |
|---|---|---|
| iPhone 与 iPad | 设备端(Apple,需要 iOS / iPadOS 26),或远程 API | 设备端(Apple,需要 iOS 18),或远程 API |
| Mac | 设备端(Apple,需要 macOS 26),或远程 API | 设备端(Apple,需要 macOS 15),或远程 API |
| Apple Vision Pro | 设备端(Apple,需要 visionOS 26),或远程 API | 设备端(Apple 智能,需要 visionOS 26),或远程 API |
| Apple TV | 设备端(Apple,需要 tvOS 26),或远程 API | 仅远程 API |
| Windows | 设备端(Whisper,模型下载到本机),或远程 API | 远程 API。译为英语时可以直接由 Whisper 在本机完成 |
| Android 手机、平板与电视 | 设备端(Whisper,支持 GPU 加速),或远程 API | 设备端(ML Kit),或远程 API |
| Meta Quest | 设备端(Whisper),或远程 API | 建议使用远程 API |
Whisper 模型
Windows、Android 与 Quest 上的设备端语音识别使用 Whisper 模型,有 Tiny、Base、Small、Medium、Turbo 几档:模型越大,运行越慢,占用的存储空间越多。各档的准确度见下方的对比。第一次使用时在设置中下载。
Android 上的「GPU 加速」设为「自动」时,应用会在本机分别测试 GPU 和 CPU 的速度,使用较快的一个。
Apple 设备端模型
iPhone、iPad、Mac 与 Vision Pro 使用系统自带的语音识别和翻译模型。第一次使用某种语言时,需要下载对应的语言模型,下载进度显示在设置向导中。
Apple TV 没有设备端翻译模型。可以在 Apple TV 上配置远程 API,或者先在 iPhone、iPad 或 Mac 上生成字幕,见保存与复用。
语音识别准确度对比
下表是一次实测的结果:10 分钟日语电影片段(小津安二郎《东京物语》,有对白也有配乐),把识别结果与人工校对的日语台词逐字比较。「错字率」越低越准确;「识别出的台词」是人工校对的台词中被识别出来的比例;「字幕时间偏差」是字幕出现时间与实际说话时间之差的中位数。
| 语音识别 | 运行位置 | 错字率 | 识别出的台词 | 字幕时间偏差 | 费用 |
|---|---|---|---|---|---|
| 通义千问 qwen-audio-3.0-asr-flash | 远程 API | 12.2% | 100% | 0.22 秒 | 0.00022 元/秒,约 0.79 元/小时(北京);0.00026 元/秒,约 0.94 元/小时(新加坡) |
| 通义千问 qwen-audio-3.1-asr-flash | 远程 API | 12.3% | 94% | 0.20 秒 | 按 token 计费:输入 0.8 元、输出 2.7 元/百万 token(北京);输入 1.094 元、输出 3.427 元/百万 token(新加坡) |
| Apple 设备端 | iPhone、iPad、Mac 等 | 13.9% | 92% | 1.20 秒 | 免费 |
| 通义 fun-asr-flash | 远程 API | 18.4% | — | — | 0.00022 元/秒,约 0.79 元/小时(北京);0.00026 元/秒,约 0.94 元/小时(新加坡) |
| 通义千问 qwen3-asr-flash | 远程 API | 24.6%,音乐段有重复输出 | — | — | 0.00022 元/秒,约 0.79 元/小时(北京);0.00026 元/秒,约 0.94 元/小时(新加坡) |
| Whisper Turbo | 设备端 | 24.5% | — | — | 免费 |
| Whisper Small | 设备端 | 32.8% | — | — | 免费 |
| Whisper Medium | 设备端 | 35.0%,有重复输出 | — | — | 免费 |
| Whisper Base | 设备端 | 43.4% | — | — | 免费 |
| Whisper Tiny | 设备端 | 71.7%,有重复输出 | — | — | 免费 |
这是一部电影、一种语言的测试结果,其他影片和语言的结果会有差异。「—」表示该项没有测量。
费用是阿里云百炼 2026 年 9 月 24 日公布的价格,按发送给服务的音频时长计费(包括无对白的音乐段),每小时的费用由每秒单价换算。北京地域开通后 90 天内有 10 小时免费额度(qwen-audio-3.1-asr-flash 为 100 万 token)。价格可能调整,以阿里云百炼模型价格页面为准。翻译步骤另外计费:这次测试用 qwen3.8-flash 翻译,每小时影片约 0.05 元。设备端模型在你的设备上运行,不产生服务费用。
远程 API 只测试了通义千问的几个模型,其他远程服务没有测试,它们的结果可能更好,也可能更差。这张表只用于比较设备端模型和远程 API 的差别,不表示我们推荐通义千问作为远程 API。
qwen-audio-3.0-asr-flash、qwen-audio-3.1-asr-flash 和 fun-asr-flash 将在以后的版本中提供,当前版本还不能使用。
在 Windows、Android 与 Quest 上,能及时运行的较小模型(Tiny、Base、Small)经常听错对白,尤其是有背景音乐时和英语以外的语言,还可能在音乐段重复同一句话,或生成不存在的台词。Turbo 模型更准确,但在大多数手机和电视盒子上速度太慢,跟不上播放,在电脑上需要性能足够的显卡才能跟上。Medium 同样很慢,在上面的测试中准确度也没有超过 Small。
如需准确的字幕,建议使用远程语音识别接口,或在 iPhone、iPad、Mac 上用 Apple 设备端识别生成字幕并保存到视频旁,再在其他设备上观看。
远程 API
使用远程 API
在设置的「实时翻译」中,语音识别和翻译分别设置服务、接口地址、模型和 API 密钥,两者可以使用不同的服务商。应用内置了下列服务的预设:选择一个预设,接口地址和默认模型会自动填好,只需再填 API 密钥。接口地址和模型也可以直接输入,不必从列表中选择。
内置的翻译服务
翻译使用兼容 OpenAI 的对话接口(chat completions)。每个服务的第一个模型是默认选项。
| 翻译服务 | 预设模型 |
|---|---|
| OpenAI | gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-sol、gpt-4o-mini |
| DeepSeek | deepseek-v4-flash、deepseek-v4-pro |
| Google Gemini | gemini-3.7-flash、gemini-3.5-flash-lite、gemini-3.6-flash、gemini-2.5-flash |
| xAI(Grok) | grok-4.6、grok-4.5 |
| Groq | openai/gpt-oss-20b、openai/gpt-oss-120b、qwen/qwen3.6-27b |
| OpenRouter | google/gemini-3.7-flash、deepseek/deepseek-v4-flash、z-ai/glm-5.3-flash、qwen/qwen3.8-flash |
| Mistral | mistral-small-latest、mistral-medium-latest、mistral-large-latest |
| 硅基流动(SiliconFlow) | deepseek-ai/DeepSeek-V4-Flash、Qwen/Qwen3.5-35B-A3B、deepseek-ai/DeepSeek-V4-Pro |
| Anthropic(Claude) | claude-haiku-4-5、claude-sonnet-5、claude-opus-5 |
| 通义千问(国际 / 中国) | qwen3.8-flash、qwen-flash、qwen-plus、qwen3.8-max |
| 智谱(BigModel) | glm-4.7-flash、glm-5.3-flash、glm-4.7-flashx、glm-5.3 |
| Ollama(本机) | qwen3.8、gemma3、glm-5.3-flash、llama3.2 |
| LM Studio(本机) | local-model |
| MTranServer(自建) | 自建的翻译服务器,不需要选择模型,填写服务器地址和令牌(令牌可选) |
内置的语音识别服务
语音识别使用兼容 OpenAI 的音频转写接口。
| 语音识别服务 | 预设模型 |
|---|---|
| OpenAI Whisper | whisper-1、gpt-transcribe、gpt-4o-transcribe、gpt-4o-mini-transcribe |
| Groq | whisper-large-v3-turbo、whisper-large-v3 |
| Speaches(自建) | Systran/faster-whisper-base、deepdml/faster-whisper-large-v3-turbo-ct2、Systran/faster-whisper-large-v3、Systran/faster-whisper-small、Systran/faster-whisper-tiny |
| 通义千问 Qwen3-ASR(国际 / 中国) | qwen3-asr-flash |
| 智谱(BigModel) | glm-asr-2512 |
Whisper 系列模型(例如 whisper-1、whisper-large-v3-turbo)会返回每一句话的时间,字幕与语音对齐得更准。其他语音识别模型按整段返回文字,每条字幕的时间精度较低。
使用自己的接口
- 翻译:任何兼容 OpenAI 对话接口的服务都可以使用。在「翻译接口」中填写完整地址,例如
https://api.example.com/v1/chat/completions,在「翻译模型」中填写服务商文档中的模型名称。 - 语音识别:把「语音识别服务」设为「自定义」,填写兼容 OpenAI 音频转写的完整地址,例如
https://api.example.com/v1/audio/transcriptions,以及模型名称。 - MTranServer:把「翻译服务」设为 MTranServer,填写「MTranServer 地址」和「MTranServer 令牌」。
- 通义千问:国际版与中国版的接口地址不同,按 API 密钥所属的区域选择。
- Ollama 与 LM Studio:预设地址是
localhost,只在运行这两个程序的电脑上可用。在手机、电视或其他设备上使用时,把localhost改成这台电脑的局域网 IP 地址。 - Speaches:预设不带地址,填写你自己的服务器地址;在局域网内使用时,API 密钥可以留空。
填好之后,用「测试语音识别」和「测试翻译」确认接口可用。字幕的句子短、请求频繁,列表中靠前的轻量模型速度快、费用低,通常比大型推理模型更合适。
API 密钥只保存在本设备上。使用远程服务产生的费用由对应的服务商收取,与 CloudDrive2 无关。预设的服务和模型会随应用更新调整,以应用内显示的为准。
使用
在播放器里开始翻译
先在设置的「实时翻译」中打开「AI 实时字幕」,然后播放视频。
-
打开字幕菜单
在播放器的字幕菜单里找到「AI 翻译」一栏,选择「启用」。
-
按向导设置
向导分三步:选择源语言和目标语言(需要时下载语言模型),选择翻译来源,选择输出格式。完成后选择「开始」。
-
边播放边生成
字幕从当前播放位置开始生成,进度显示为「翻译中」加百分比;整部视频完成后显示「已就绪」。拖动进度条后,应用会先生成新位置的字幕。
自动开始
- 为无字幕的视频自动启用:打开没有字幕轨道的视频时,按设置中的默认值自动开始翻译。
- 在播放列表中继续:在播放列表中,用同样的设置继续翻译后面的每一个视频,直到你关闭为止。
输出
SRT 还是 ASS
在设置向导的第三步「输出格式」中为当前视频选择,或在设置的「实时翻译」中通过「输出格式」设置默认值。
SRT
纯文本字幕,只包含译文。几乎所有播放器和电视都能读取,适合同时在其他播放器中使用这份字幕。
ASS(带样式)
带字体、字号和颜色的字幕。只有 ASS 格式可以打开「双语(显示原文)」,同时显示译文和原文。
双语(显示原文)
选择 ASS 后,在向导中勾选「双语(显示原文)」,或在设置中打开「双语(显示原文)」。每条字幕显示两行:上面一行是译文,白色、较大、加粗;下面一行是原文,黄色、较小。原文来自所选的翻译来源:翻译字幕轨道时是原字幕的文字,识别音频时是语音识别的结果。适合学习外语,或核对翻译是否准确。
其他显示设置
| 设置 | 作用 |
|---|---|
| 自动换行长字幕 / 每行最多字符数 | 把过长的字幕行拆成多行 |
| 字幕延迟 | 把 AI 字幕整体推后显示,负值则提前。字幕比人声略早出现时,调大这个值。设备端和远程语音识别各有一个值 |
保存到视频旁的字幕文件名为「视频文件名.目标语言代码.ai.srt」或「.ai.ass」,例如 电影.zh-Hans.ai.ass。
保存
保存与复用
打开「将字幕保存到视频旁」后,生成的字幕文件写入视频所在的云盘文件夹,文件名与视频相同。
在其他设备上加载
字幕保存在视频旁边之后,任何设备上的 CloudDrive2 打开这个视频,都会把它作为外挂字幕加载,不需要重新生成。其他播放器也可以读取这个字幕文件。
例如:在 Mac 上用设备端模型生成字幕,再在 Apple TV 上观看同一个视频。
中断后继续
生成过程中退出播放,已翻译的部分保存在本设备的字幕缓存中,下次打开从中断处继续。翻译服务无响应时,已翻译的部分同样保留,可以重试。
字幕菜单中的「重新生成」会清除这个视频的缓存并从头翻译;「删除翻译」会停止并删除它的翻译。设置中的「字幕缓存」可以清除本设备上的全部缓存,已保存到视频旁的字幕不受影响。
Emby / Jellyfin
在媒体客户端中使用
通过应用内置的 Emby / Jellyfin 客户端播放服务器上的视频时,同样可以使用 AI 字幕翻译,操作与播放云盘文件相同:在播放器的字幕菜单中启用「AI 翻译」。生成完成后,字幕的保存位置取决于服务器类型。
| 服务器 | 生成的字幕保存到哪里 |
|---|---|
| Jellyfin | 上传到 Jellyfin 服务器,作为这个视频的外挂字幕。之后在任何 Jellyfin 客户端中播放这个视频,都可以选择这条字幕 |
| Emby | Emby 不提供上传字幕的接口。如果这台服务器开启了「直连串流」并配置了「路径映射」,字幕会写入视频所在的云盘文件夹。如果 Emby 服务器上安装了 CloudDrive2 伴侣插件,翻译完成后应用会立即通知 Emby 刷新这个视频,新字幕马上可以选择;没有安装插件时,Emby 在下次扫描媒体库后显示这条字幕 |
| 未配置路径映射 | 字幕只保存在本设备的字幕缓存中,在本设备上再次播放时直接使用 |
上传到 Jellyfin 服务器目前在 iPhone、iPad、Mac、Apple TV、Vision Pro 与 Android 上提供。Windows 上,开启直连串流的视频,字幕写入视频所在的云盘文件夹;其余情况下只保存在本设备。
批量
为整个文件夹生成字幕
在文件夹或视频的菜单中选择「生成 AI 字幕」。字幕在后台逐个生成,不需要播放视频,生成后保存在各个视频旁边。
- 包含子文件夹:同时处理子文件夹中的视频。
- 跳过已有字幕的视频:视频已内嵌文本字幕,或旁边已有同名的 .srt / .ass 文件时跳过。
- 包含光盘镜像(蓝光 / DVD ISO):同时处理文件夹中的 .iso 文件。
- 低优先级(后台):放慢生成速度,减少 CPU 和网络占用。
任务列在传输页面的「AI 字幕」中,可以暂停、继续、重试或全部取消。
后两个选项目前在 iPhone、iPad 与 Mac 上提供。
隐私
数据发送到哪里
语音识别和翻译都在设备端运行时,音频和字幕文本不会离开你的设备。
使用远程 API 时,音频片段或字幕文本会发送到你配置的服务,由该服务按它自己的隐私政策处理。我们不接收也不代理这些数据。详见隐私政策。
FAQ
常见问题
需要购买什么
AI 字幕翻译属于 App Pro。App Pro 绑定 CloudDrive 账号,一次购买,在所有平台上登录同一个账号都可以使用。价格见会员页。使用远程 API 产生的费用由对应的服务商另行收取。
字幕比人声早出现或晚出现
在设置的「实时翻译」中调整「字幕延迟」。字幕比人声早,调大这个值;比人声晚,调小或设为负值。设备端和远程语音识别各有一个值。
字幕还是原来的语言,没有翻译
当前设备没有可用的设备端翻译模型,也没有配置有效的远程接口和密钥时,字幕会以原来的语言显示。Apple TV 和 Windows 上需要配置远程翻译 API;在 iPhone、iPad 或 Mac 上,检查系统版本是否满足上表的要求,以及语言模型是否已经下载。
Whisper 模型下载很慢或中断
应用会依次尝试多个下载源,其中包括面向中国大陆的镜像。下载中断后再次下载,会从已下载的位置继续;下载完成后会校验文件,校验不通过时重新下载。
翻译速度跟不上播放
识别音频比翻译字幕慢得多。视频有字幕轨道时,把翻译来源设为「自动(优先字幕)」或「字幕轨道」。识别音频时,可以换用较小的 Whisper 模型、在 Android 上打开 GPU 加速,或改用远程语音识别服务。也可以先用批量生成在后台生成字幕,之后再观看。
Apple TV 上怎样使用设备端模型
Apple TV 没有设备端翻译模型。在 iPhone、iPad 或 Mac 上为这个视频生成字幕,并打开「将字幕保存到视频旁」,Apple TV 打开同一个视频时会直接加载这个字幕。