描述
LiteRT 代表了 Google 设备端机器学习部署的下一代,它是在广泛采用的 TensorFlow Lite 的基础上发展而来的。该框架专为在各种边缘平台上部署高性能 ML 和生成式 AI 而设计。它提供了一个高效的管道,用于模型转换、运行时执行和优化,特别针对设备端环境的约束和需求进行了定制。
LiteRT 构建在久经考验的 TensorFlow Lite 基础之上,旨在为直接在数十亿设备上运行的应用程序提供低延迟和增强的隐私性。其跨平台就绪性通过提供简化的硬件加速和多框架支持,简化了包括生成式 AI 在内的复杂 AI 功能的部署。开发人员可以利用现有的 .tflite 模型,或转换来自 PyTorch、JAX 和 TensorFlow 等框架的模型。LiteRT 优化工具包允许进行训练后量化,进一步提高模型效率。
LiteRT 支持一系列部署场景,从将预训练模型集成到应用程序中,到通过深度硬件特定优化进行高级自定义模型创作。它旨在使开发人员能够将最先进的 AI,包括使用 Gemma 等模型的高级智能体技能和多步规划能力,直接带到边缘。该框架还专注于扩展硬件加速支持,特别是针对联发科和高通的 NPU,从而在这些芯片组上释放生成式 AI 任务的峰值性能。
对于现有的 TensorFlow Lite 用户,迁移到 LiteRT 可以提供跨 Android、桌面和 Web 等平台的增强性能和统一 API。CompiledModel API 的引入通过自动化硬件选择和启用异步执行,进一步简化了部署。LiteRT-LM 专门支持在可穿戴设备和基于浏览器的平台上部署语言模型,展示了其在各种边缘 AI 应用中的多功能性。鼓励通过其 GitHub 存储库进行社区贡献,并通过 Hugging Face Hub 访问优化的开源模型。
LiteRT: On-Device ML Framework的核心功能
高性能设备端 ML 和 GenAI 部署
从 PyTorch、JAX、TensorFlow 高效转换模型
针对边缘平台的优化运行时
训练后量化工具包
跨平台兼容性(Android、桌面、Web)
简化的硬件加速
多框架支持
用于自动化硬件选择的 CompiledModel API
用于设备端语言模型的 LiteRT-LM
增强的隐私性和低延迟
基于 TensorFlow Lite 基础发展而来
支持联发科和高通芯片组上的 NPU 加速
LiteRT: On-Device ML Framework入门
获取模型:使用现有的 .tflite 模型或转换 PyTorch、JAX 或 TensorFlow 模型。
优化模型:利用 LiteRT 优化工具包进行训练后量化。
部署模型:将优化后的模型与 LiteRT 集成,选择最佳加速器。
运行模型:将您的应用程序部署到目标边缘设备。
探索示例:参考 GitHub 获取完整的端到端示例应用程序。
访问模型:在 Hugging Face 上查找优化的开源 GenAI 模型。
LiteRT: On-Device ML Framework的使用案例
- 设备端聊天机器人
- 边缘 AI 应用
- 可穿戴设备 AI
- 基于浏览器的 AI
- 视觉和音频体验
- 智能体技能
- 自定义模型优化
- 跨平台部署





