使用 EC2 Capacity Blocks for ML 和 SageMaker Training Plans 预留短期 GPU 容量
AWS 推出 EC2 Capacity Blocks for ML 和 SageMaker Training Plans,帮助用户以折扣价格预留短期 GPU 资源,适用于负载测试、模型验证等临时性任务。
入选理由:EC2 Capacity Blocks 提供 40-50% 折扣并保障短期 GPU 资源可用。
概念
别名:graphics processing unit
用于并行计算的专用硬件
已跟踪 19 条高相关材料
最近变化
2026-08-04 · 静态批处理导致请求延迟与批次填充速度强相关,最长请求决定整体处理时间。
为什么值得关注
GPU 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Secure short-term GPU capacity for ML workloads with EC2 Capacity Blocks for ML and SageMaker training plans
AWS Machine Learning Blog · 8.7 分
AWS 推出 EC2 Capacity Blocks for ML 和 SageMaker Training Plans,帮助用户以折扣价格预留短期 GPU 资源,适用于负载测试、模型验证等临时性任务。
Static vs. Dynamic vs. Continuous Batching in LLM Inference
Machine Learning Mastery · 8.5 分
静态批处理在LLM推理中存在显著延迟问题,动态批处理通过超时窗口优化,连续批处理则需在token层级调度以提升吞吐。
GPU Management: Why Idle GPUs Are the New Grounded Aircraft
Hugging Face Blog · 8.5 分
GPU利用率决定AI企业经济性,类似航空业飞机利用率,闲置GPU成为新瓶颈。
已收录 19 条与 GPU 相关的内容,按评分排序。
AWS 推出 EC2 Capacity Blocks for ML 和 SageMaker Training Plans,帮助用户以折扣价格预留短期 GPU 资源,适用于负载测试、模型验证等临时性任务。
入选理由:EC2 Capacity Blocks 提供 40-50% 折扣并保障短期 GPU 资源可用。
GPU利用率决定AI企业经济性,类似航空业飞机利用率,闲置GPU成为新瓶颈。
入选理由:GPU成本按日历小时计算,收益仅来自计算小时
Red Hat OpenShift AI通过实时训练进度跟踪和自动化中断机制,帮助用户节省高达70%的GPU资源浪费。
入选理由:实时指标收集可减少70%的GPU资源浪费
静态批处理在LLM推理中存在显著延迟问题,动态批处理通过超时窗口优化,连续批处理则需在token层级调度以提升吞吐。
入选理由:静态批处理导致请求延迟与批次填充速度强相关,最长请求决定整体处理时间。
微软推出MAI-Voice-2-Flash,性能提升2倍且成本降低32%,适用于企业客服平台并减少GPU成本89%。
入选理由:MAI-Voice-2-Flash比前代快2倍,价格每百万字符15美元
异步策略蒸馏(AsyncOPD)在强化学习中可能导致学生策略与教师策略的log概率差异,引发不稳定性,Verl库通过k-step off-policy方法缓解此问题。
入选理由:异步方法允许生成与训练并行,但可能因策略过时导致log概率差异扩大
Google Cloud Blog详解GKE Autopilot集群配置DRANET支持GPU/TPU的完整流程,包含代码示例和参数说明。
入选理由:GKE Autopilot集群部署需指定VPC网络和预留资源URL
DeepSeek通过优化AI芯片的利用效率,解决了AI系统计算资源浪费的问题,使AI运行更高效。
入选理由:AI系统中存在计算资源浪费问题,GPU利用率仅40%。
现代AI依赖于专用硬件如GPU、TPU和NPU,它们在并行计算和大规模数据处理上表现优异。
入选理由:AI训练需要执行万亿次数学运算,传统CPU无法高效完成。
Cerebras凭借其AI计算机在推理速度上比GPU快15-20倍,与OpenAI达成200亿美元合作,并通过AWS云服务扩展,推动AI基础设施革新。
入选理由:Cerebras的AI推理速度比GPU快15-20倍,覆盖所有规模模型
Cloud Storage Rapid 提供高性能对象存储解决方案,显著提升 AI 和分析工作负载的效率。
入选理由:Rapid Bucket 提供高达 2000 万次查询每秒和亚毫秒级延迟。
本文探讨了利用语言模型作为选择性代理进行 GPU 内核运行时优化的新方法,通过预测和选择最优内核配置,显著提升了性能。
入选理由:语言模型被用作选择性代理,预测 GPU 内核的最佳配置。
Perplexity Computer 将推出本地模型与云端前沿模型混合推理功能,提升隐私保护、能耗效率并优化任务分配,预计 soon 推出。
入选理由:本地模型运行于用户硬件,确保数据隐私。
CPU、GPU和TPU针对不同计算类型优化,CPU处理通用任务,GPU擅长并行数学运算,TPU专为机器学习张量操作设计,工程师应据此选择硬件加速AI工作负载。
入选理由:CPU has few powerful cores optimized for general-purpose tasks like web servers and databases with branching logic.
微软研究院发布最新研究,涵盖从SQL自动生成GPU内核、AI匹配肿瘤模型等前沿技术。
入选理由:SQL可自动生成GPU内核,提升分析速度30倍
文章讨论了AI技术的不可逆发展,强调其带来的深远影响。
入选理由:AI技术发展不可逆,需提前规划应对。
文章主要报道马斯克宣布解散xAI团队,并将22万张GPU算力租给Anthropic,但内容缺乏深度和技术细节。
入选理由:马斯克宣布解散xAI团队,原因未详细说明。
马斯克因AI伦理争议被指“邪恶”,却在短时间内将22万张GPU出租给Anthropic,一年预计收入50亿美元,凸显AI产业资本与道德立场的复杂博弈。
入选理由:马斯克将22万张GPU租给Anthropic,年收入或达50亿美元。
马斯克解散xAI团队,将22万张GPU算力资源转移给Anthropic,Claude取消高峰期使用限制。
入选理由:马斯克决定解散xAI团队,停止相关研发工作。