描述
Gemma-3n-E4B-it 是谷歌开发的 Gemma 系列模型的一部分,旨在通过开源和开放科学推动人工智能能力的发展。该模型经过优化,能够在低资源设备上高效执行,使其适用于广泛的应用场景。它支持多模态输入,包括文本、图像、视频和音频,并能够生成文本输出。该模型采用 MatFormer 架构构建,允许在 E4B 模型中嵌套子模型,从而提供模型大小和性能的灵活性。
Gemma-3n-E4B-it 模型的内存占用与传统的 4B 模型相当,尽管其原始参数数量为 8B。这是通过将低利用率矩阵从加速器中卸载来实现的,从而实现高效的参数管理。该模型支持总输入上下文为 32K 个标记,并能够生成相同长度的输出,适合需要广泛上下文的复杂任务。
Gemma-3n-E4B-it 的训练数据包括来自多种来源的多样化数据,总计约 11 万亿个标记,知识截止日期为 2024 年 6 月。数据涵盖了 140 多种语言、网络文档、代码、数学、图像和音频,确保模型接触到广泛的语言风格和主题。采用严格的过滤方法以确保排除有害和非法内容。
Gemma-3n-E4B-it 在多个基准测试中进行评估,展示了在推理、事实性、多语言能力以及 STEM 和代码任务中的高性能。该模型使用张量处理单元(TPU)硬件进行训练,提供显著的计算能力和成本效益。它使用 JAX 和 ML Pathways 实现,允许高效的训练和开发。
该模型旨在广泛应用于内容创作、沟通、研究和教育等领域。然而,用户应注意其局限性,例如训练数据中的潜在偏见和开放式任务的挑战。伦理考虑包括偏见和公平性、错误信息和隐私侵犯,并提供负责任使用的指南。
gemma-3n-E4B-it 模型亮点
支持文本、图像、视频和音频输入
生成文本输出
使用 MatFormer 架构
操作参数为 8B
高效的参数管理
在 11 万亿个标记上训练
支持 140 多种语言
在多个基准上进行评估
使用 TPU 硬件进行训练
使用 JAX 和 ML Pathways 实现
gemma-3n-E4B-it 模型入门
访问页面:访问 Hugging Face 仓库
加载模型:初始化 Gemma-3n-E4B-it
配置环境:使用 Transformers 库进行设置
集成:与 Hugging Face transformers 一起使用
微调:使用 Mix-and-Match 方法进行定制
gemma-3n-E4B-it 模型的使用案例
- 内容创作
- 对话式人工智能
- 文本摘要
- 图像数据提取
- 音频数据提取












