App Pro 功能

AI 字幕翻译

为视频生成翻译字幕,播放时与画面同步显示。视频有字幕轨道时直接翻译字幕;没有字幕时,先对音频进行语音识别,再翻译。生成的字幕保存在视频所在的文件夹中,其他设备打开同一个视频时直接加载。

适用范围

哪些应用可以使用

iPhone、iPad、Mac、Apple TV、Apple Vision Pro、Windows、Android 手机与电视,以及 Meta Quest 上的 CloudDrive2 应用都可以使用。AI 字幕翻译属于 App Pro,一次购买,登录同一个 CloudDrive 账号的所有设备都可以使用。

AI 翻译的结果可能不完全准确,质量取决于所用的模型。

CloudDrive2 不提供语音识别或翻译服务

语音识别和翻译由两种方式完成:你的设备自带的模型,或你自己配置的外部 API。CloudDrive2 不运营任何语音识别或翻译服务器,也不代你调用这类服务。使用外部 API 时,需要你自己向服务商申请 API 密钥,费用和数据处理由该服务商负责。

翻译来源

翻译字幕,或识别音频

在「翻译来源」中选择。翻译字幕轨道比识别音频快,也更准确。

  • 自动(优先字幕)

    默认选项。视频有字幕轨道时翻译字幕,没有时识别音频。

  • 字幕轨道

    直接翻译视频中已有的字幕,例如外语字幕。蓝光的 PGS 图形字幕是图片,会先经过文字识别(OCR)转成文本再翻译。

  • 音频轨道

    对视频的对白进行语音识别,再把识别出的文字翻译成目标语言。5.1 与 7.1 音轨可以只识别对白声道,减少音乐和音效的干扰。

「源语言」是视频中所说的语言,「目标语言」是要生成的字幕语言。两者在设置里有默认值,也可以为每个视频单独选择。选择具体的源语言,识别更准确。

模型

各平台的语音识别与翻译

语音识别和翻译是两个独立的步骤,可以分别选择在设备端运行,或使用远程 API。设备端模型免费,音频和字幕文本不离开设备。

平台语音识别翻译
iPhone 与 iPad设备端(Apple,需要 iOS / iPadOS 26),或远程 API设备端(Apple,需要 iOS 18),或远程 API
Mac设备端(Apple,需要 macOS 26),或远程 API设备端(Apple,需要 macOS 15),或远程 API
Apple Vision Pro设备端(Apple,需要 visionOS 26),或远程 API设备端(Apple 智能,需要 visionOS 26),或远程 API
Apple TV设备端(Apple,需要 tvOS 26),或远程 API仅远程 API
Windows设备端(Whisper,模型下载到本机),或远程 API远程 API。译为英语时可以直接由 Whisper 在本机完成
Android 手机、平板与电视设备端(Whisper,支持 GPU 加速),或远程 API设备端(ML Kit),或远程 API
Meta Quest设备端(Whisper),或远程 API建议使用远程 API

Whisper 模型

Windows、Android 与 Quest 上的设备端语音识别使用 Whisper 模型,有 Tiny、Base、Small、Medium、Turbo 几档:模型越大,运行越慢,占用的存储空间越多。各档的准确度见下方的对比。第一次使用时在设置中下载。

Android 上的「GPU 加速」设为「自动」时,应用会在本机分别测试 GPU 和 CPU 的速度,使用较快的一个。

Apple 设备端模型

iPhone、iPad、Mac 与 Vision Pro 使用系统自带的语音识别和翻译模型。第一次使用某种语言时,需要下载对应的语言模型,下载进度显示在设置向导中。

Apple TV 没有设备端翻译模型。可以在 Apple TV 上配置远程 API,或者先在 iPhone、iPad 或 Mac 上生成字幕,见保存与复用

语音识别准确度对比

下表是一次实测的结果:10 分钟日语电影片段(小津安二郎《东京物语》,有对白也有配乐),把识别结果与人工校对的日语台词逐字比较。「错字率」越低越准确;「识别出的台词」是人工校对的台词中被识别出来的比例;「字幕时间偏差」是字幕出现时间与实际说话时间之差的中位数。

语音识别运行位置错字率识别出的台词字幕时间偏差费用
通义千问 qwen-audio-3.0-asr-flash远程 API12.2%100%0.22 秒0.00022 元/秒,约 0.79 元/小时(北京);0.00026 元/秒,约 0.94 元/小时(新加坡)
通义千问 qwen-audio-3.1-asr-flash远程 API12.3%94%0.20 秒按 token 计费:输入 0.8 元、输出 2.7 元/百万 token(北京);输入 1.094 元、输出 3.427 元/百万 token(新加坡)
Apple 设备端iPhone、iPad、Mac 等13.9%92%1.20 秒免费
通义 fun-asr-flash远程 API18.4%0.00022 元/秒,约 0.79 元/小时(北京);0.00026 元/秒,约 0.94 元/小时(新加坡)
通义千问 qwen3-asr-flash远程 API24.6%,音乐段有重复输出0.00022 元/秒,约 0.79 元/小时(北京);0.00026 元/秒,约 0.94 元/小时(新加坡)
Whisper Turbo设备端24.5%免费
Whisper Small设备端32.8%免费
Whisper Medium设备端35.0%,有重复输出免费
Whisper Base设备端43.4%免费
Whisper Tiny设备端71.7%,有重复输出免费

这是一部电影、一种语言的测试结果,其他影片和语言的结果会有差异。「—」表示该项没有测量。

费用是阿里云百炼 2026 年 9 月 24 日公布的价格,按发送给服务的音频时长计费(包括无对白的音乐段),每小时的费用由每秒单价换算。北京地域开通后 90 天内有 10 小时免费额度(qwen-audio-3.1-asr-flash 为 100 万 token)。价格可能调整,以阿里云百炼模型价格页面为准。翻译步骤另外计费:这次测试用 qwen3.8-flash 翻译,每小时影片约 0.05 元。设备端模型在你的设备上运行,不产生服务费用。

远程 API 只测试了通义千问的几个模型,其他远程服务没有测试,它们的结果可能更好,也可能更差。这张表只用于比较设备端模型和远程 API 的差别,不表示我们推荐通义千问作为远程 API。

qwen-audio-3.0-asr-flash、qwen-audio-3.1-asr-flash 和 fun-asr-flash 将在以后的版本中提供,当前版本还不能使用。

关于 Whisper 设备端识别

在 Windows、Android 与 Quest 上,能及时运行的较小模型(Tiny、Base、Small)经常听错对白,尤其是有背景音乐时和英语以外的语言,还可能在音乐段重复同一句话,或生成不存在的台词。Turbo 模型更准确,但在大多数手机和电视盒子上速度太慢,跟不上播放,在电脑上需要性能足够的显卡才能跟上。Medium 同样很慢,在上面的测试中准确度也没有超过 Small。

如需准确的字幕,建议使用远程语音识别接口,或在 iPhone、iPad、Mac 上用 Apple 设备端识别生成字幕并保存到视频旁,再在其他设备上观看。

远程 API

使用远程 API

在设置的「实时翻译」中,语音识别和翻译分别设置服务、接口地址、模型和 API 密钥,两者可以使用不同的服务商。应用内置了下列服务的预设:选择一个预设,接口地址和默认模型会自动填好,只需再填 API 密钥。接口地址和模型也可以直接输入,不必从列表中选择。

内置的翻译服务

翻译使用兼容 OpenAI 的对话接口(chat completions)。每个服务的第一个模型是默认选项。

翻译服务预设模型
OpenAIgpt-5.6-lunagpt-5.6-terragpt-5.6-solgpt-4o-mini
DeepSeekdeepseek-v4-flashdeepseek-v4-pro
Google Geminigemini-3.7-flashgemini-3.5-flash-litegemini-3.6-flashgemini-2.5-flash
xAI(Grok)grok-4.6grok-4.5
Groqopenai/gpt-oss-20bopenai/gpt-oss-120bqwen/qwen3.6-27b
OpenRoutergoogle/gemini-3.7-flashdeepseek/deepseek-v4-flashz-ai/glm-5.3-flashqwen/qwen3.8-flash
Mistralmistral-small-latestmistral-medium-latestmistral-large-latest
硅基流动(SiliconFlow)deepseek-ai/DeepSeek-V4-FlashQwen/Qwen3.5-35B-A3Bdeepseek-ai/DeepSeek-V4-Pro
Anthropic(Claude)claude-haiku-4-5claude-sonnet-5claude-opus-5
通义千问(国际 / 中国)qwen3.8-flashqwen-flashqwen-plusqwen3.8-max
智谱(BigModel)glm-4.7-flashglm-5.3-flashglm-4.7-flashxglm-5.3
Ollama(本机)qwen3.8gemma3glm-5.3-flashllama3.2
LM Studio(本机)local-model
MTranServer(自建)自建的翻译服务器,不需要选择模型,填写服务器地址和令牌(令牌可选)

内置的语音识别服务

语音识别使用兼容 OpenAI 的音频转写接口。

语音识别服务预设模型
OpenAI Whisperwhisper-1gpt-transcribegpt-4o-transcribegpt-4o-mini-transcribe
Groqwhisper-large-v3-turbowhisper-large-v3
Speaches(自建)Systran/faster-whisper-basedeepdml/faster-whisper-large-v3-turbo-ct2Systran/faster-whisper-large-v3Systran/faster-whisper-smallSystran/faster-whisper-tiny
通义千问 Qwen3-ASR(国际 / 中国)qwen3-asr-flash
智谱(BigModel)glm-asr-2512

Whisper 系列模型(例如 whisper-1whisper-large-v3-turbo)会返回每一句话的时间,字幕与语音对齐得更准。其他语音识别模型按整段返回文字,每条字幕的时间精度较低。

使用自己的接口

  • 翻译:任何兼容 OpenAI 对话接口的服务都可以使用。在「翻译接口」中填写完整地址,例如 https://api.example.com/v1/chat/completions,在「翻译模型」中填写服务商文档中的模型名称。
  • 语音识别:把「语音识别服务」设为「自定义」,填写兼容 OpenAI 音频转写的完整地址,例如 https://api.example.com/v1/audio/transcriptions,以及模型名称。
  • MTranServer:把「翻译服务」设为 MTranServer,填写「MTranServer 地址」和「MTranServer 令牌」。
  • 通义千问:国际版与中国版的接口地址不同,按 API 密钥所属的区域选择。
  • Ollama 与 LM Studio:预设地址是 localhost,只在运行这两个程序的电脑上可用。在手机、电视或其他设备上使用时,把 localhost 改成这台电脑的局域网 IP 地址。
  • Speaches:预设不带地址,填写你自己的服务器地址;在局域网内使用时,API 密钥可以留空。

填好之后,用「测试语音识别」和「测试翻译」确认接口可用。字幕的句子短、请求频繁,列表中靠前的轻量模型速度快、费用低,通常比大型推理模型更合适。

API 密钥只保存在本设备上。使用远程服务产生的费用由对应的服务商收取,与 CloudDrive2 无关。预设的服务和模型会随应用更新调整,以应用内显示的为准。

使用

在播放器里开始翻译

先在设置的「实时翻译」中打开「AI 实时字幕」,然后播放视频。

  1. 打开字幕菜单

    在播放器的字幕菜单里找到「AI 翻译」一栏,选择「启用」。

  2. 按向导设置

    向导分三步:选择源语言和目标语言(需要时下载语言模型),选择翻译来源,选择输出格式。完成后选择「开始」。

  3. 边播放边生成

    字幕从当前播放位置开始生成,进度显示为「翻译中」加百分比;整部视频完成后显示「已就绪」。拖动进度条后,应用会先生成新位置的字幕。

自动开始

  • 为无字幕的视频自动启用:打开没有字幕轨道的视频时,按设置中的默认值自动开始翻译。
  • 在播放列表中继续:在播放列表中,用同样的设置继续翻译后面的每一个视频,直到你关闭为止。

输出

SRT 还是 ASS

在设置向导的第三步「输出格式」中为当前视频选择,或在设置的「实时翻译」中通过「输出格式」设置默认值。

  • SRT

    纯文本字幕,只包含译文。几乎所有播放器和电视都能读取,适合同时在其他播放器中使用这份字幕。

  • ASS(带样式)

    带字体、字号和颜色的字幕。只有 ASS 格式可以打开「双语(显示原文)」,同时显示译文和原文。

双语(显示原文)

选择 ASS 后,在向导中勾选「双语(显示原文)」,或在设置中打开「双语(显示原文)」。每条字幕显示两行:上面一行是译文,白色、较大、加粗;下面一行是原文,黄色、较小。原文来自所选的翻译来源:翻译字幕轨道时是原字幕的文字,识别音频时是语音识别的结果。适合学习外语,或核对翻译是否准确。

其他显示设置

设置作用
自动换行长字幕 / 每行最多字符数把过长的字幕行拆成多行
字幕延迟把 AI 字幕整体推后显示,负值则提前。字幕比人声略早出现时,调大这个值。设备端和远程语音识别各有一个值

保存到视频旁的字幕文件名为「视频文件名.目标语言代码.ai.srt」或「.ai.ass」,例如 电影.zh-Hans.ai.ass

保存

保存与复用

打开「将字幕保存到视频旁」后,生成的字幕文件写入视频所在的云盘文件夹,文件名与视频相同。

在其他设备上加载

字幕保存在视频旁边之后,任何设备上的 CloudDrive2 打开这个视频,都会把它作为外挂字幕加载,不需要重新生成。其他播放器也可以读取这个字幕文件。

例如:在 Mac 上用设备端模型生成字幕,再在 Apple TV 上观看同一个视频。

中断后继续

生成过程中退出播放,已翻译的部分保存在本设备的字幕缓存中,下次打开从中断处继续。翻译服务无响应时,已翻译的部分同样保留,可以重试。

字幕菜单中的「重新生成」会清除这个视频的缓存并从头翻译;「删除翻译」会停止并删除它的翻译。设置中的「字幕缓存」可以清除本设备上的全部缓存,已保存到视频旁的字幕不受影响。

Emby / Jellyfin

在媒体客户端中使用

通过应用内置的 Emby / Jellyfin 客户端播放服务器上的视频时,同样可以使用 AI 字幕翻译,操作与播放云盘文件相同:在播放器的字幕菜单中启用「AI 翻译」。生成完成后,字幕的保存位置取决于服务器类型。

服务器生成的字幕保存到哪里
Jellyfin上传到 Jellyfin 服务器,作为这个视频的外挂字幕。之后在任何 Jellyfin 客户端中播放这个视频,都可以选择这条字幕
EmbyEmby 不提供上传字幕的接口。如果这台服务器开启了「直连串流」并配置了「路径映射」,字幕会写入视频所在的云盘文件夹。如果 Emby 服务器上安装了 CloudDrive2 伴侣插件,翻译完成后应用会立即通知 Emby 刷新这个视频,新字幕马上可以选择;没有安装插件时,Emby 在下次扫描媒体库后显示这条字幕
未配置路径映射字幕只保存在本设备的字幕缓存中,在本设备上再次播放时直接使用

上传到 Jellyfin 服务器目前在 iPhone、iPad、Mac、Apple TV、Vision Pro 与 Android 上提供。Windows 上,开启直连串流的视频,字幕写入视频所在的云盘文件夹;其余情况下只保存在本设备。

批量

为整个文件夹生成字幕

在文件夹或视频的菜单中选择「生成 AI 字幕」。字幕在后台逐个生成,不需要播放视频,生成后保存在各个视频旁边。

  • 包含子文件夹:同时处理子文件夹中的视频。
  • 跳过已有字幕的视频:视频已内嵌文本字幕,或旁边已有同名的 .srt / .ass 文件时跳过。
  • 包含光盘镜像(蓝光 / DVD ISO):同时处理文件夹中的 .iso 文件。
  • 低优先级(后台):放慢生成速度,减少 CPU 和网络占用。

任务列在传输页面的「AI 字幕」中,可以暂停、继续、重试或全部取消。

后两个选项目前在 iPhone、iPad 与 Mac 上提供。

隐私

数据发送到哪里

语音识别和翻译都在设备端运行时,音频和字幕文本不会离开你的设备。

使用远程 API 时,音频片段或字幕文本会发送到你配置的服务,由该服务按它自己的隐私政策处理。我们不接收也不代理这些数据。详见隐私政策

FAQ

常见问题

需要购买什么

AI 字幕翻译属于 App Pro。App Pro 绑定 CloudDrive 账号,一次购买,在所有平台上登录同一个账号都可以使用。价格见会员页。使用远程 API 产生的费用由对应的服务商另行收取。

字幕比人声早出现或晚出现

在设置的「实时翻译」中调整「字幕延迟」。字幕比人声早,调大这个值;比人声晚,调小或设为负值。设备端和远程语音识别各有一个值。

字幕还是原来的语言,没有翻译

当前设备没有可用的设备端翻译模型,也没有配置有效的远程接口和密钥时,字幕会以原来的语言显示。Apple TV 和 Windows 上需要配置远程翻译 API;在 iPhone、iPad 或 Mac 上,检查系统版本是否满足上表的要求,以及语言模型是否已经下载。

Whisper 模型下载很慢或中断

应用会依次尝试多个下载源,其中包括面向中国大陆的镜像。下载中断后再次下载,会从已下载的位置继续;下载完成后会校验文件,校验不通过时重新下载。

翻译速度跟不上播放

识别音频比翻译字幕慢得多。视频有字幕轨道时,把翻译来源设为「自动(优先字幕)」或「字幕轨道」。识别音频时,可以换用较小的 Whisper 模型、在 Android 上打开 GPU 加速,或改用远程语音识别服务。也可以先用批量生成在后台生成字幕,之后再观看。

Apple TV 上怎样使用设备端模型

Apple TV 没有设备端翻译模型。在 iPhone、iPad 或 Mac 上为这个视频生成字幕,并打开「将字幕保存到视频旁」,Apple TV 打开同一个视频时会直接加载这个字幕。

反馈问题

发现问题请在 GitHub issues 提交,便于记录和跟踪;也可以在 Telegram 交流群反馈,或发送邮件。