https://t.co/UpN8YgfMbI
Google Gemini API整合Google Maps和Search工具,实现单次调用完成搜索、地图定位和自定义功能联动,大幅简化位置应用开发。
入选理由:Gemini API单次调用可整合Maps和Search工具,减少70%的API交互次数
人物
别名:@_philschmid
推文发布者
已跟踪 30 条高相关材料
最近变化
2026-08-12 · Gemini API现在支持同时调用Google Maps和Google Search工具
为什么值得关注
Philipp Schmid 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
https://t.co/UpN8YgfMbI
Philipp Schmid(@_philschmid) · 8.5 分
Google Gemini API整合Google Maps和Search工具,实现单次调用完成搜索、地图定位和自定义功能联动,大幅简化位置应用开发。
I hardly write a blog about an eval, but this one felt interesting. EvoCode is a new eval that tests...
Philipp Schmid(@_philschmid) · 8.5 分
EvoCode是首个测试代理在多轮交互中持续满足演变需求的基准,强调避免破坏已有功能。
https://t.co/y4ywBykMCv
Philipp Schmid(@_philschmid) · 8.5 分
EvoCode-Bench是首个模拟真实开发循环的多轮编码基准,通过持久工作区、演变规范和累积测试提升代理评估的实用性。
已收录 30 条与 Philipp Schmid 相关的内容,按评分排序。
Google Gemini API整合Google Maps和Search工具,实现单次调用完成搜索、地图定位和自定义功能联动,大幅简化位置应用开发。
入选理由:Gemini API单次调用可整合Maps和Search工具,减少70%的API交互次数
EvoCode-Bench是首个模拟真实开发循环的多轮编码基准,通过持久工作区、演变规范和累积测试提升代理评估的实用性。
入选理由:EvoCode-Bench包含227个连续轮次任务,覆盖5个技术领域
EvoCode是首个测试代理在多轮交互中持续满足演变需求的基准,强调避免破坏已有功能。
入选理由:EvoCode包含26个任务、227轮测试(每任务5-15轮),使用持久容器确保连续性
本文展示如何使用Gemini Live Translate、Next.js、LiveKit和Cloud Run构建实时翻译应用,涵盖音频流处理、翻译优化和部署方案。
入选理由:使用WebRTC将音频流传输至LiveKit Room。
Gemini Interactions API 的入门指南被全面重写,提供从首次 API 调用到运行自主代理的 11 步教程。
入选理由:Gemini Interactions API 入门指南已全面重写,包含 11 个步骤。
Agents' Last Exam (ALE) 是一个评估代理在 55 个行业中 1000 多个真实专业任务上的表现的基准测试。
入选理由:最佳代理在最难任务中的通过率低于 10%。
Google Colab 现在支持 CLI 和 Skills,允许用户通过终端直接访问 Colab 运行时,包括 GPU/TPU 配置和自动训练模型。
入选理由:通过 CLI 可以直接在终端中配置 GPU/TPU,如使用 'colab --gpu A100'。
Gemma 4 12B通过移除独立视觉与音频编码器,采用原生多模态架构实现单模型处理文本、图像和音频。该设计摒弃传统外挂编码器拼接模式,直接在统一表征空间内完成跨模态对齐,显著降低推理延迟并提升端侧部署效率。
入选理由:Gemma 4 12B移除独立视觉/音频编码器,采用原生多模态统一架构
GEPA 是一个通用框架,可用于自动优化 CLI 工具的提示,支持自定义 CLI、本地模型和 API 代理。
入选理由:GEPA 可以优化任何 CLI 工具的提示,只需提供一个 `(str) -> str` 类型的可调用函数。
Google DeepMind开源了Science Skills工具集,为AI Agent提供基因组学、结构生物学及文献检索等科研任务的标准技能接口,加速科学智能体工作流构建。
入选理由:Google DeepMind发布science-skills开源库,专为科研AI Agent设计。
Gemma 4 12B是首个支持原生音频输入的中型多模态模型,采用无编码器统一架构,仅需16GB显存即可运行,性能接近26B模型且遵循Apache 2.0开源协议。
入选理由:Gemma 4 12B采用无编码器统一架构,直接将视觉与音频信号输入LLM,降低推理延迟。
本文介绍如何使用 Gemini Live API、LiveKit 和 Google Cloud Run 构建实时翻译应用,适合前端工程师参考。
入选理由:Gemini Live API 支持实时语音翻译,适用于多语言场景。
Gemini API新增Google Maps与Google Search工具联动功能,可同时调用构建位置应用,但未披露技术细节与使用限制。
入选理由:Gemini API现在支持同时调用Google Maps和Google Search工具
Gemini 3.6 Flash 成为 Gemini Managed Agents 默认模型,无需代码修改即可自动使用。
入选理由:Gemini 3.6 Flash 现为默认模型,无需代码更改
文章预告了Philipp Schmid在aiDotEngineer会议的两个演讲,分别讨论代理沙箱和技能评估的重要性。
入选理由:代理应拥有独立沙箱以确保安全隔离
Gemini Omni Flash通过对话接口实现视频编辑,仅需12行代码和Interactions API。
入选理由:Gemini Omni Flash支持通过自然语言描述修改视频光影效果
Interactions API 引入 background=True 参数以处理超时的异步任务,但文章信息密度较低,缺乏深度和实用性。
入选理由:Interactions API 新增 background=True 参数用于处理长时间异步任务。
Gemini TTS 现在支持音频流式传输,无需等待即可生成语音。
入选理由:Gemini TTS 现在支持音频流式传输。
Google 的 Gemma 4 模型使本地代理编码成为可能,性能接近前沿模型的 75%。
入选理由:Gemma 4 模型支持本地代理编码。
Gemini 3.5 Flash模型在OCR和VQA任务中表现更优,但文章缺乏技术细节和论证。
入选理由:Gemini 3.5 Flash在OCR和VQA任务中速度更快、成本更低
Go 语言在 AI 工具开发中具有优势,但文章内容信息量不足,缺乏具体案例和深度分析。
入选理由:Go 语言编译速度快,适合 AI 工具开发。
推文介绍了一种通过中间代理层实现GitHub令牌安全管理的方案,但未提供技术细节和验证数据。
入选理由:使用OAuth 2.0和令牌管理技术可降低GitHub令牌泄露风险
Google AI Studio 正在改进计费体验,本周已修复部分问题,但整体信息密度较低。
入选理由:Google AI Studio 已移除无限制的 API 密钥。
文章内容信息密度低,缺乏技术深度和实用价值,主要为社交媒体上的链接分享。
入选理由:文章未提供具体技术细节或实用建议。
文章内容为社交媒体帖子,信息密度低,缺乏技术深度和实用价值。
入选理由:文章为社交媒体帖子,未提供具体技术内容。
文章内容信息密度低,缺乏具体技术细节和深度分析,仅提供了一个 CLI 工具的链接。
入选理由:文章未提供具体技术细节或深度分析。
推文内容为社交媒体互动片段,缺乏技术深度和实用价值,主要包含用户评论与表情互动。
入选理由:文章未提供技术原理或工程实践内容
本文介绍了一个名为 gemma-dev 的技能,用于在开发中使用 Google 的 Gemma 模型,通过 npx 命令安装,但未提供详细技术信息。
入选理由:使用命令 `npx skills add google-gemma/gemma-skills --skill gemma-dev` 安装 Gemma 开发技能。
该推文内容缺乏技术深度,主要为社交媒体互动,不涉及具体技术方案或工程实践。
入选理由:社交媒体动态不适合作为技术文章阅读
该推文仅为Google Gemma-4-12B-it模型在Hugging Face的发布链接,缺乏技术解析、性能数据或工程实践指导,信息密度极低,不具备独立阅读价值。
入选理由:Gemma-4-12B-it是Google发布的120亿参数指令微调模型,托管于Hugging Face平台。