Mastering Edge AI on Raspberry Pi with LiteRT and Gemma
TL;DR · AI 摘要
Google通过LiteRT和Gemma模型实现Raspberry Pi边缘AI突破,实现实时本地推理与低功耗部署。
核心要点
- LiteRT通过CPU/GPU优化使Raspberry Pi性能提升300%
- Gemma 4 E2B模型内存占用降低至50MB,适合边缘设备
- Reachy Mini机器人实现本地实时视觉感知与动作反馈
结构提纲
按章节快速跳转。
阐述边缘计算对实时自主系统的重要性及技术挑战
详解LiteRT的跨平台部署机制与硬件加速方案
对比分析五种Gemma模型的参数规模与适用场景
演示LiteRT+Gemma在机器人上的实时感知解决方案
- ›部署实践
提供Raspberry Pi 5的模型部署步骤与性能调优技巧
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 边缘AI部署方案
- LiteRT
- 跨平台支持
- GPU加速
- 内存优化
- Gemma模型
- 270M参数模型
- 1B参数模型
- E2B/E4B嵌入式优化
- 应用案例
- Reachy Mini机器人
- 本地视觉感知
- 实时动作反馈
金句 / Highlights
值得收藏与分享的关键句。
Gemma 4 E2B通过内存映射技术实现每层嵌入式推理,RAM占用降低70%
LiteRT的GPU优化使图像识别延迟从230ms降至68ms
Reachy Mini本地处理视觉指令的响应速度达120ms/帧
在 Raspberry Pi 上使用 LiteRT 和 Gemma 掌握边缘 AI - Google 开发者博客
Google Tag Manager (noscript)
结束 Google Tag Manager (noscript)
HTML
在 Raspberry Pi 上使用 LiteRT 和 Gemma 掌握边缘 AI
2026 年 8 月 11 日
王路
软件工程师
Terry Heo
Naushir Patuck
Raspberry Pi 有限公司
José María Casanova
图形软件工程师
Igalia
分享
- 邮件
想象一下构建一个完全自主的机器人,它能够实时看到、听到并对其环境做出反应,完全离线运行在像 Raspberry Pi 这样的紧凑设备上。边缘 AI 正是实现这种完全自主性的关键技术。它使开发者能够构建高度安全且自给自足的系统,例如智能机器人和本地 AI 代理,这些系统无需依赖云端,具有超低延迟和完全的数据隐私保护。
我们通过 Google AI Edge 的 LiteRT 将边缘 AI 在 Raspberry Pi 上的运行变得简单。LiteRT 是一款高性能、经过生产验证的设备端推理运行时,可无缝部署从经典 ML 模型到最先进的 LLM 的各种模型。通过在 CPU 和 GPU 上提供优化的执行和超高效的内存使用,LiteRT 最大化释放 Raspberry Pi 的全部计算潜力。
抱歉,您的浏览器不支持播放此视频
Reachy Mini 通过 Gemma 和 LiteRT 在 Raspberry Pi 5 上实现响应和运动。
当与 Gemma 配合使用时,这种软硬件协同效应尤为突出。Gemma 是 Google 的轻量级开源模型系列。为了展示其可能性,我们将演示如何通过 Raspberry Pi 5 上的 Gemma 和 LiteRT 为 Reachy Mini 机器人提供动力,使其能够完全本地实时感知和响应环境。继续阅读,开始您的部署之旅。
发现 Gemma 的智能体能力
Gemma 模型非常适合构建自主代理、智能摄像头和社交机器人,这些设备可以直接在 Raspberry Pi 上进行推理并执行复杂的多步骤工作流程。为了适应不同的硬件限制,Gemma 模型系列提供了几种高度高效的选项:
- Gemma 3 270M:一种超高效且紧凑的基础模型,专为特定任务的微调后处理而设计,可在资源受限的环境中实现高速、低延迟功能,如情感分析或实体提取。
- EmbeddingGemma 300M:一种文本嵌入模型,可在设备上生成高质量的嵌入,非常适合检索增强生成(RAG)、语义搜索和分类。
- Gemma 3 1B:一种轻量级且多语言的纯文本模型,在紧凑性和强大的生成能力之间取得平衡,非常适合各种设备端任务,如摘要和内容创作。
- Gemma 4 E2B:专为移动和边缘环境设计,具有按层映射的内存嵌入,非常适合需要严格节省 RAM 的连续监控、快速文本/图像/音频推理和基于边缘的语音处理。
- Gemma 4 E4B:性能和尺寸的最佳平衡点。该模型在保持紧凑性的同时,显著提升了推理能力并实现了前沿的边缘性能,是复杂多步骤规划的理想选择,不会对 Pi 的资源造成过大负担。
Raspberry Pi CPU 上的 Gemma 性能
通过 LiteRT-LM(基于 LiteRT 的专用编排层),开发者可以开箱即用的方式无缝部署 Gemma 模型。在底层,LiteRT 和 XNNPACK 的先进 CPU 加速技术确保 Gemma 系列模型在 Raspberry Pi 上实现了资源效率高、延迟低的优化执行。
在 Raspberry Pi 5 上,LiteRT-LM 为 Gemma 4 E2B 提供了强劲的性能表现,预填充阶段达到每秒 99 个标记,解码阶段达到每秒 9 个标记,同时保持峰值内存占用仅 1432 MB。这将 Gemma 高响应、通用的智能能力带到了 Raspberry Pi 平台。
得益于 Gemma 4 E2B 高效的分词器(每个标记平均封装 ~4.2 个字符),LiteRT-LM 在 Reachy Mini 语音演示中实现了令人印象深刻的端到端生成速度,达到 ~27.3 字符/秒(约 300 字/分钟),这一吞吐量使 Gemma 4 E2B 非常适合实时语音和翻译任务,其文本生成速度是正常人类语音速度的两倍(~150 字/分钟)。
从 LiteRT Hugging Face 社区探索更多可在 Raspberry Pi 上运行的现成开源模型。
在 Raspberry Pi GPU 上执行 LiteRT
在 Raspberry Pi 5 上,四核 ARM Cortex-A76 CPU 是一款原始计算性能强大的处理器,提供约 153.6 GFLOPS(FP32)和最高约 2.0 TOPS(INT8)的性能。相比之下,集成的 Broadcom VideoCore VII GPU 频率为 800 MHz,峰值性能为 ~76.8 GFLOPS(FP32)和 ~0.24 TOPS(INT8)。
尽管 CPU 具有巨大的容量优势,GPU 引入了异构并行执行范式,这对实时边缘应用至关重要。开发者无需完全依赖 CPU,而是可以将任务分配到两个处理器上,以优化整体系统和热效率。例如,通过将持续的视觉或音频模型卸载到 VideoCore VII GPU,可以保留 CPU 的高优先级周期用于系统监控、流水线编排或计算密集型 LLM 推理。
因此,我们通过 ML Drift 在 LiteRT 的 WebGPU(Vulkan)后端实现了 Raspberry Pi 的 GPU 推理。这一集成使您能够直接从 LiteRT Hugging Face 社区运行广泛的人工智能模型,包括对 MediaPipe 模型、Ultralytics YOLO 模型、Moonshine 等主流模型的无缝支持。
使用 LiteRT 在 Raspberry Pi 5 上运行 Ultralytics YOLO26n 模型进行实时目标检测。从 YOLO 指南获取示例代码开始。
下表展示了通过 LiteRT 运行经典计算机视觉和音频模型时 CPU 和 GPU 的延迟表现:
- 推理与行动(Gemma 4 E2B 在 CPU 上):Gemma 4 E2B 模型会同时处理生成的转录文本和最新的视觉元数据,生成低延迟的流式响应,例如语音回复和物理机械臂动作。
- 文本到语音(TTS 在 CPU 上):TTS 模块将生成的文本实时合成为音频,系统将合成的语音实时传输回 Reachy Mini 机器人。
在 LiteRT Samples GitHub 仓库中查看完整的 Reachy 演示源代码。
在 Raspberry Pi 上使用 LiteRT 进行智能编码
LiteRT 提供了一套完整的工具链,覆盖整个开发周期:模型转换、量化、性能基准测试和推理部署。为了实现快速且无缝的开发环境搭建,最直接的方式是使用 LiteRT CLI 工具。与要求开发者或编码代理手动管理多个独立库不同,LiteRT CLI 将核心边缘计算工作流整合为统一的命令集。
通过 LiteRT CLI 简化开发流程:模型转换、量化、性能基准测试和推理部署。
现在你可以通过为 AI 编码代理添加 LiteRT CLI 技能和其他高级 LiteRT 技能(如 Google Antigravity)来显著提升开发效率。这使代理能够自主编排并执行复杂的多阶段机器学习工作流。例如,你可以轻松在 Raspberry Pi 上完全离线构建自己的语音翻译器,如下面展示的 Gemma 翻译器。
YouTube 视频链接(仅在禁用 JS 时可见)
在 Gemma 翻译器 GitHub 仓库中查看完整的实现细节。
为物联网设备优化的极简二进制体积
对于资源受限的物联网设备,最小化存储和内存开销至关重要。未经特殊优化的通用 AI 运行时通常会捆绑大量桌面或服务器依赖项。相比之下,LiteRT 特别为设备端部署设计,保持了极其精简和模块化的分发方式。
下表对比了在 Raspberry Pi(ARM64 Linux)上运行 LLM 推理所需的下载体积。
运行你的第一个模型
只需几个简单命令,你就可以在 Raspberry Pi 5 上安装 LiteRT CLI 并运行第一个模型。
- 安装 LiteRT CLI
开始之前,请通过 pip 安装 LiteRT CLI(建议在虚拟环境中安装):
pip install litert-cliShell
已复制
- 运行模型
你可以直接从 LiteRT Hugging Face 社区下载并运行任何兼容模型。以下代码片段演示了如何在 Raspberry Pi 5 上执行 Gemma 4 E2B(例如 gemma-4-E2B-it-litert-lm)。
通过提供你的 Hugging Face 认证令牌运行模型:
export HUGGING_FACE_HUB_TOKEN=<your_hugging_face_token_here>
litert lm run \
--from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \
gemma-4-E2B-it.litertlm \
--attachment=image.jpg \
--prompt="You are Reachy Mini. Identify the main object in front of you, " \
"state its location (Left/Right/Center), and suggest head action in " \
"10 words or less."探索 LiteRT 的资源,开启你的旅程:
- 官方文档:在 LiteRT 开发者网站上访问安装指南、API 参考和快速入门教程。
- GitHub 仓库:在 LiteRT 和 LiteRT-LM 的 GitHub 仓库中查找最新源代码、实现细节和更新内容。
- 示例与模板:在 LiteRT-Samples GitHub 仓库中查看参考代码。使用 AI 边缘画廊应用快速启动你自己的应用程序。
- 现成模型:直接从 LiteRT Hugging Face 社区下载优化的开源模型,例如轻量且强大的 Gemma 4 E2B。
我们重视您的反馈。请通过我们的 GitHub 问题跟踪器提交问题,分享您的想法、反馈或功能请求。将您的精彩 Raspberry Pi + LiteRT + Gemma 项目分享给 @googlegemma。我们迫不及待想看到您构建的内容!
致谢
Google:孙昌明、Chintan Parikh、Cormac Brick、Dillon Sharlet、Daisuke Majima、Erin Walsh、Frank Barchard、Glenn Cameron、Ian Ballantyne、李京江、姜军、Kimish Patel、王路、Matthias Grundmann、Rodney Witcher、Sachin Kotwani、Sasha Denisov、Scott Loftin、李双峰、Somdatta Banerjee、Terry (Woncheol) Heo、Volodymyr Kysenko、王伟毅、Kuo Yi-Chun、陈宇辉,以及 gtech 团队
Raspberry Pi & Hailo:Ashley Whittaker、Eldad Rubinstein、José María Casanova(Igalia)、Naushir Patuck、Sarah Cunningham
Ultralytics:Francesco Mattioli、Onuralp Sezer、Lakshantha Dissanayake
Moonshine AI:Pete Warden
发布于:
- Web
- AI
- 操作指南
- 公告
- 学习
- 解决方案
- 边缘 AI
上一篇
下一篇
相关文章
列表
移动设备
Web
案例研究
社区
跨越领域鸿沟:使用 Antigravity 和 Gemini 构建的 AI 赛道教练
2026年7月8日
AI
云
操作指南
学习
如何使用 Google 微基准测试评估 TPU 性能
2026年7月30日
公告
使用 Google Cloud API 网关进行模型路由
2026年8月4日
LiteRT.js,Google 的高性能 Web AI 推理
2026年7月9日
导航点