资源与技术文档:
使用条款:条款
作者:Google Translate
输入和输出的概要说明及简要定义。
TranslateGemma 是 Google 推出的一系列轻量级、最先进的开放式翻译模型,基于 Gemma 3 系列模型构建。
TranslateGemma 模型旨在处理 55 种语言的翻译任务。其相对较小的模型尺寸使其能够部署在资源有限的环境中,如笔记本电脑、台式机或您自己的云基础设施,从而普及最先进的翻译模型,助力为所有人促进创新。
输入:
输出:
TranslateGemma 旨在与特定的聊天模板配合使用,该模板支持直接翻译文本输入,或从图像输入中提取文本并进行翻译。此聊天模板已通过 Hugging Face transformers 的聊天模板系统实现,并且与 Gemma tokenizer 和 Gemma 3 processor 提供的 apply_chat_template() 函数兼容。与其他模型的聊天模板相比,显著差异包括:
TranslateGemma 仅支持用户(User)和助手(Assistant)角色。
TranslateGemma 的用户角色有严格规定:
content 属性必须以列表形式提供,且列表中恰好包含一个条目。
content 列表条目必须提供:
content 列表条目应提供以下其中一项:
"source_lang_code" 和 "target_lang_code" 属性值可以采用以下两种形式之一:
en;或en_US 或 en-GB,类似于 Unicode 通用区域设置数据仓库格式。如果 "source_lang_code" 和 "target_lang_code" 属性值不受模型支持,则在应用模板时会引发错误。
此外,TranslateGemma 可能对其他提示技术有良好响应,以支持超出所提供聊天模板的用例,例如自动翻译后编辑。由于这些用例未得到官方支持,因此应使用 Gemma 3 技术报告 中指定的特殊控制 token 和结构手动构建它们,并直接发送给 tokenizer 或 processor,而不是使用 apply_chat_template() 函数。TranslateGemma 团队希望了解您使用替代提示的经验,如有任何问题和反馈,请联系我们。
from transformers import pipeline
import torch
pipe = pipeline(
"image-text-to-text",
model="google/translategemma-4b-it",
device="cuda",
dtype=torch.bfloat16
)
# ---- Text Translation ----
messages = [
{
"role": "user",
"content": [
{
"type": "text",
"source_lang_code": "cs",
"target_lang_code": "de-DE",
"text": "V nejhorším případě i k prasknutí čočky.",
}
],
}
]
output = pipe(text=messages, max_new_tokens=200)
print(output[0]["generated_text"][-1]["content"])
# ---- Text Extraction and Translation ----
messages = [
{
"role": "user",
"content": [
{
"type": "image",
"source_lang_code": "cs",
"target_lang_code": "de-DE",
"url": "https://c7.alamy.com/comp/2YAX36N/traffic-signs-in-czech-republic-pedestrian-zone-2YAX36N.jpg",
},
],
}
]
output = pipe(text=messages, max_new_tokens=200)
print(output[0]["generated_text"][-1]["content"])
import torch
from transformers import AutoModelForImageTextToText, AutoProcessor
model_id = "google/translategemma-4b-it"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(model_id, device_map="auto")
# ---- Text Translation ----
messages = [
{
"role": "user",
"content": [
{
"type": "text",
"source_lang_code": "cs",
"target_lang_code": "de-DE",
"text": "V nejhorším případě i k prasknutí čočky.",
}
],
}
]
inputs = processor.apply_chat_template(
messages, tokenize=True, add_generation_prompt=True, return_dict=True, return_tensors="pt"
).to(model.device, dtype=torch.bfloat16)
input_len = len(inputs['input_ids'][0])
with torch.inference_mode():
generation = model.generate(**inputs, do_sample=False)
generation = generation[0][input_len:]
decoded = processor.decode(generation, skip_special_tokens=True)
print(decoded)
# ---- Text Extraction and Translation ----
messages = [
{
"role": "user",
"content": [
{
"type": "image",
"source_lang_code": "cs",
"target_lang_code": "de-DE",
"url": "https://c7.alamy.com/comp/2YAX36N/traffic-signs-in-czech-republic-pedestrian-zone-2YAX36N.jpg",
},
],
}
]
inputs = processor.apply_chat_template(
messages, tokenize=True, add_generation_prompt=True, return_dict=True, return_tensors="pt"
).to(model.device, dtype=torch.bfloat16)
with torch.inference_mode():
generation = model.generate(**inputs, do_sample=False)
generation = generation[0][input_len:]
decoded = processor.decode(generation, skip_special_tokens=True)
print(decoded)
@article{gemmatranslate2026,
title={{TranslateGemma Technical Report}},
url={https://arxiv.org/pdf/2601.09012},
publisher={Google DeepMind},
author={{Google Translate Research Team} and
Finkelstein, Mara and
Caswell, Isaac and
Domhan, Tobias and
Peter, Jan-Thorsten and
Juraska, Juraj and
Riley, Parker and
Deutsch, Daniel and
Dilanni, Cole and
Cherry, Colin and
Briakou, Eleftheria and
Nielsen, Elizabeth and
Luo, Jiaming and
Agrawal, Sweta and
Xu, Wenda and
Kats, Erin and
Jaskiewicz, Stephane and
Freitag, Markus and
Vilar, David
},
year={2026}
}用于模型训练的数据以及数据的处理方式。
这些模型是在原始 Gemma 3 检查点的基础上,使用来自多种来源的平行数据进行微调的。TranslateGemma 模型在监督微调(SFT)阶段使用了 43 亿个 tokens,在强化学习阶段使用了 1020 万个 tokens。其关键组成部分包括:
关于模型内部结构的详细信息。
TranslateGemma 的训练使用了 Tensor Processing Unit (TPU) 硬件(TPUv4p、TPUv5p 和 TPUv5e)。TPU 是专为机器学习中常见的矩阵运算而设计的,在该领域具有多项优势:
训练使用了 JAX 和 ML Pathways。JAX 使研究人员能够利用最新一代的硬件(包括 TPU),更快、更高效地训练大型模型。ML Pathways 是 Google 为构建能够跨多个任务进行泛化的人工智能系统所做的最新努力。这特别适用于基础模型,包括此类大型语言模型。 正如 Gemini 系列模型论文 中所述,JAX 和 ML Pathways 协同工作:“Jax 和 Pathways 的‘单一控制器’编程模型允许单个 Python 进程协调整个训练运行,极大地简化了开发工作流程。”
模型评估指标与结果。
为全面评估文本生成的各个方面,我们在大量不同数据集和指标上对这些模型进行了评估。
| 4B | 12B | 27B | |
|---|---|---|---|
| WMT24++(55种语言) | |||
| MetricX ↓ | 5.32 | 3.60 | 3.09 |
| Comet ↑ | 81.6 | 83.5 | 84.4 |
| WMT25(10种语言) | |||
| MQM ↓ | N/A | 7.94 | 5.86 |
| Vistra(4种语言)* | |||
| MetricX ↓ | 2.57 | 2.08 | 1.57 |
伦理与安全评估方法及结果。
我们的评估方法包括结构化评估和针对相关内容政策的内部红队测试。红队测试由多个不同团队执行,每个团队都有不同的目标和人工评估指标。这些模型针对多个与伦理和安全相关的类别进行了评估,包括:
在所有安全测试领域,我们观察到与之前的Gemma模型相比,儿童安全、内容安全和代表性伤害等类别的表现均有显著提升。所有测试均在未启用安全过滤器的情况下进行,以评估模型的能力和行为。无论是文本到文本还是图像到文本任务,在所有模型尺寸上,模型产生的政策违规内容极少,并且在无根据推断方面,相较于之前的Gemma模型表现出显著改进。
这些模型存在一些用户应注意的局限性。
这些模型的训练目标明确,旨在从文本或图像输出中生成文本翻译。我们不对这些模型的其他能力做任何宣称。
训练数据
上下文与任务复杂度
语言歧义与细微差别
事实准确性
常识判断
视觉语言模型(VLMs)的发展引发了若干伦理问题。在创建开放模型时,我们仔细考虑了以下几点:
偏差与公平性
错误信息与滥用
透明度与问责制:
已识别的风险及缓解措施:
在发布时,此系列模型提供了基于 Gemma 3 模型微调的高性能翻译模型实现。
通过本文档中描述的基准评估指标,这些模型已展现出相较于其他同等规模开源模型替代品更卓越的性能。