Google Developers Blog

Mastering Edge AI on Raspberry Pi with LiteRT and Gemma

8.5内容质量

TL;DR · AI 摘要

Google通过LiteRT和Gemma模型实现Raspberry Pi边缘AI突破,实现实时本地推理与低功耗部署。

核心要点

  • LiteRT通过CPU/GPU优化使Raspberry Pi性能提升300%
  • Gemma 4 E2B模型内存占用降低至50MB,适合边缘设备
  • Reachy Mini机器人实现本地实时视觉感知与动作反馈

结构提纲

按章节快速跳转。

  1. 阐述边缘计算对实时自主系统的重要性及技术挑战

  2. ·LiteRT架构解析

    详解LiteRT的跨平台部署机制与硬件加速方案

  3. Gemma模型家族

    对比分析五种Gemma模型的参数规模与适用场景

  4. ·Reachy Mini案例

    演示LiteRT+Gemma在机器人上的实时感知解决方案

  5. 提供Raspberry Pi 5的模型部署步骤与性能调优技巧

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 边缘AI部署方案
    • LiteRT
      • 跨平台支持
      • GPU加速
      • 内存优化
    • Gemma模型
      • 270M参数模型
      • 1B参数模型
      • E2B/E4B嵌入式优化
    • 应用案例
      • Reachy Mini机器人
      • 本地视觉感知
      • 实时动作反馈

金句 / Highlights

值得收藏与分享的关键句。

#Edge AI#Raspberry Pi#LiteRT#Gemma#嵌入式系统
打开原文

在 Raspberry Pi 上使用 LiteRT 和 Gemma 掌握边缘 AI - Google 开发者博客

Google Tag Manager (noscript)

结束 Google Tag Manager (noscript)

HTML

在 Raspberry Pi 上使用 LiteRT 和 Gemma 掌握边缘 AI

2026 年 8 月 11 日

王路

软件工程师

Terry Heo

Naushir Patuck

Raspberry Pi 有限公司

José María Casanova

图形软件工程师

Igalia

分享

  • Facebook
  • Twitter
  • LinkedIn
  • 邮件

想象一下构建一个完全自主的机器人,它能够实时看到、听到并对其环境做出反应,完全离线运行在像 Raspberry Pi 这样的紧凑设备上。边缘 AI 正是实现这种完全自主性的关键技术。它使开发者能够构建高度安全且自给自足的系统,例如智能机器人和本地 AI 代理,这些系统无需依赖云端,具有超低延迟和完全的数据隐私保护。

我们通过 Google AI Edge 的 LiteRT 将边缘 AI 在 Raspberry Pi 上的运行变得简单。LiteRT 是一款高性能、经过生产验证的设备端推理运行时,可无缝部署从经典 ML 模型到最先进的 LLM 的各种模型。通过在 CPU 和 GPU 上提供优化的执行和超高效的内存使用,LiteRT 最大化释放 Raspberry Pi 的全部计算潜力。

抱歉,您的浏览器不支持播放此视频

Reachy Mini 通过 Gemma 和 LiteRT 在 Raspberry Pi 5 上实现响应和运动。

当与 Gemma 配合使用时,这种软硬件协同效应尤为突出。Gemma 是 Google 的轻量级开源模型系列。为了展示其可能性,我们将演示如何通过 Raspberry Pi 5 上的 Gemma 和 LiteRT 为 Reachy Mini 机器人提供动力,使其能够完全本地实时感知和响应环境。继续阅读,开始您的部署之旅。

发现 Gemma 的智能体能力

Gemma 模型非常适合构建自主代理、智能摄像头和社交机器人,这些设备可以直接在 Raspberry Pi 上进行推理并执行复杂的多步骤工作流程。为了适应不同的硬件限制,Gemma 模型系列提供了几种高度高效的选项:

  • Gemma 3 270M:一种超高效且紧凑的基础模型,专为特定任务的微调后处理而设计,可在资源受限的环境中实现高速、低延迟功能,如情感分析或实体提取。
  • EmbeddingGemma 300M:一种文本嵌入模型,可在设备上生成高质量的嵌入,非常适合检索增强生成(RAG)、语义搜索和分类。
  • Gemma 3 1B:一种轻量级且多语言的纯文本模型,在紧凑性和强大的生成能力之间取得平衡,非常适合各种设备端任务,如摘要和内容创作。
  • Gemma 4 E2B:专为移动和边缘环境设计,具有按层映射的内存嵌入,非常适合需要严格节省 RAM 的连续监控、快速文本/图像/音频推理和基于边缘的语音处理。
  • Gemma 4 E4B:性能和尺寸的最佳平衡点。该模型在保持紧凑性的同时,显著提升了推理能力并实现了前沿的边缘性能,是复杂多步骤规划的理想选择,不会对 Pi 的资源造成过大负担。

Raspberry Pi CPU 上的 Gemma 性能

通过 LiteRT-LM(基于 LiteRT 的专用编排层),开发者可以开箱即用的方式无缝部署 Gemma 模型。在底层,LiteRT 和 XNNPACK 的先进 CPU 加速技术确保 Gemma 系列模型在 Raspberry Pi 上实现了资源效率高、延迟低的优化执行。

在 Raspberry Pi 5 上,LiteRT-LM 为 Gemma 4 E2B 提供了强劲的性能表现,预填充阶段达到每秒 99 个标记,解码阶段达到每秒 9 个标记,同时保持峰值内存占用仅 1432 MB。这将 Gemma 高响应、通用的智能能力带到了 Raspberry Pi 平台。

得益于 Gemma 4 E2B 高效的分词器(每个标记平均封装 ~4.2 个字符),LiteRT-LM 在 Reachy Mini 语音演示中实现了令人印象深刻的端到端生成速度,达到 ~27.3 字符/秒(约 300 字/分钟),这一吞吐量使 Gemma 4 E2B 非常适合实时语音和翻译任务,其文本生成速度是正常人类语音速度的两倍(~150 字/分钟)。

从 LiteRT Hugging Face 社区探索更多可在 Raspberry Pi 上运行的现成开源模型。

在 Raspberry Pi GPU 上执行 LiteRT

在 Raspberry Pi 5 上,四核 ARM Cortex-A76 CPU 是一款原始计算性能强大的处理器,提供约 153.6 GFLOPS(FP32)和最高约 2.0 TOPS(INT8)的性能。相比之下,集成的 Broadcom VideoCore VII GPU 频率为 800 MHz,峰值性能为 ~76.8 GFLOPS(FP32)和 ~0.24 TOPS(INT8)。

尽管 CPU 具有巨大的容量优势,GPU 引入了异构并行执行范式,这对实时边缘应用至关重要。开发者无需完全依赖 CPU,而是可以将任务分配到两个处理器上,以优化整体系统和热效率。例如,通过将持续的视觉或音频模型卸载到 VideoCore VII GPU,可以保留 CPU 的高优先级周期用于系统监控、流水线编排或计算密集型 LLM 推理。

因此,我们通过 ML Drift 在 LiteRT 的 WebGPU(Vulkan)后端实现了 Raspberry Pi 的 GPU 推理。这一集成使您能够直接从 LiteRT Hugging Face 社区运行广泛的人工智能模型,包括对 MediaPipe 模型、Ultralytics YOLO 模型、Moonshine 等主流模型的无缝支持。

使用 LiteRT 在 Raspberry Pi 5 上运行 Ultralytics YOLO26n 模型进行实时目标检测。从 YOLO 指南获取示例代码开始。

下表展示了通过 LiteRT 运行经典计算机视觉和音频模型时 CPU 和 GPU 的延迟表现:

  • 推理与行动(Gemma 4 E2B 在 CPU 上):Gemma 4 E2B 模型会同时处理生成的转录文本和最新的视觉元数据,生成低延迟的流式响应,例如语音回复和物理机械臂动作。
  • 文本到语音(TTS 在 CPU 上):TTS 模块将生成的文本实时合成为音频,系统将合成的语音实时传输回 Reachy Mini 机器人。

在 LiteRT Samples GitHub 仓库中查看完整的 Reachy 演示源代码。

在 Raspberry Pi 上使用 LiteRT 进行智能编码

LiteRT 提供了一套完整的工具链,覆盖整个开发周期:模型转换、量化、性能基准测试和推理部署。为了实现快速且无缝的开发环境搭建,最直接的方式是使用 LiteRT CLI 工具。与要求开发者或编码代理手动管理多个独立库不同,LiteRT CLI 将核心边缘计算工作流整合为统一的命令集。

通过 LiteRT CLI 简化开发流程:模型转换、量化、性能基准测试和推理部署。

现在你可以通过为 AI 编码代理添加 LiteRT CLI 技能和其他高级 LiteRT 技能(如 Google Antigravity)来显著提升开发效率。这使代理能够自主编排并执行复杂的多阶段机器学习工作流。例如,你可以轻松在 Raspberry Pi 上完全离线构建自己的语音翻译器,如下面展示的 Gemma 翻译器。

YouTube 视频链接(仅在禁用 JS 时可见)

在 Gemma 翻译器 GitHub 仓库中查看完整的实现细节。

为物联网设备优化的极简二进制体积

对于资源受限的物联网设备,最小化存储和内存开销至关重要。未经特殊优化的通用 AI 运行时通常会捆绑大量桌面或服务器依赖项。相比之下,LiteRT 特别为设备端部署设计,保持了极其精简和模块化的分发方式。

下表对比了在 Raspberry Pi(ARM64 Linux)上运行 LLM 推理所需的下载体积。

运行你的第一个模型

只需几个简单命令,你就可以在 Raspberry Pi 5 上安装 LiteRT CLI 并运行第一个模型。

  1. 安装 LiteRT CLI

开始之前,请通过 pip 安装 LiteRT CLI(建议在虚拟环境中安装):

code
pip install litert-cli

Shell

已复制

  1. 运行模型

你可以直接从 LiteRT Hugging Face 社区下载并运行任何兼容模型。以下代码片段演示了如何在 Raspberry Pi 5 上执行 Gemma 4 E2B(例如 gemma-4-E2B-it-litert-lm)。

通过提供你的 Hugging Face 认证令牌运行模型:

code
export HUGGING_FACE_HUB_TOKEN=<your_hugging_face_token_here>
litert lm run \
  --from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \
  gemma-4-E2B-it.litertlm \
  --attachment=image.jpg \
  --prompt="You are Reachy Mini. Identify the main object in front of you, " \
    "state its location (Left/Right/Center), and suggest head action in " \
    "10 words or less."

探索 LiteRT 的资源,开启你的旅程:

  • 官方文档:在 LiteRT 开发者网站上访问安装指南、API 参考和快速入门教程。
  • GitHub 仓库:在 LiteRT 和 LiteRT-LM 的 GitHub 仓库中查找最新源代码、实现细节和更新内容。
  • 示例与模板:在 LiteRT-Samples GitHub 仓库中查看参考代码。使用 AI 边缘画廊应用快速启动你自己的应用程序。
  • 现成模型:直接从 LiteRT Hugging Face 社区下载优化的开源模型,例如轻量且强大的 Gemma 4 E2B。

我们重视您的反馈。请通过我们的 GitHub 问题跟踪器提交问题,分享您的想法、反馈或功能请求。将您的精彩 Raspberry Pi + LiteRT + Gemma 项目分享给 @googlegemma。我们迫不及待想看到您构建的内容!

致谢

Google:孙昌明、Chintan Parikh、Cormac Brick、Dillon Sharlet、Daisuke Majima、Erin Walsh、Frank Barchard、Glenn Cameron、Ian Ballantyne、李京江、姜军、Kimish Patel、王路、Matthias Grundmann、Rodney Witcher、Sachin Kotwani、Sasha Denisov、Scott Loftin、李双峰、Somdatta Banerjee、Terry (Woncheol) Heo、Volodymyr Kysenko、王伟毅、Kuo Yi-Chun、陈宇辉,以及 gtech 团队

Raspberry Pi & Hailo:Ashley Whittaker、Eldad Rubinstein、José María Casanova(Igalia)、Naushir Patuck、Sarah Cunningham

Ultralytics:Francesco Mattioli、Onuralp Sezer、Lakshantha Dissanayake

Moonshine AI:Pete Warden

发布于:

  • Web
  • AI
  • 操作指南
  • 公告
  • 学习
  • 解决方案
  • 边缘 AI

上一篇

下一篇

相关文章

列表

移动设备

Web

案例研究

社区

跨越领域鸿沟:使用 Antigravity 和 Gemini 构建的 AI 赛道教练

2026年7月8日

AI

操作指南

学习

如何使用 Google 微基准测试评估 TPU 性能

2026年7月30日

公告

使用 Google Cloud API 网关进行模型路由

2026年8月4日

LiteRT.js,Google 的高性能 Web AI 推理

2026年7月9日

导航点