亚马逊AWS官方博客

基于SGLang的大模型推理实践——从benchmark方法论到部署方案选型与调优

随着大语言模型(LLM)的快速发展,模型规模不断增大,对推理部署的要求也越来越高。在实际项目中,如何高效地在GPU集群上部署和优化大模型推理,已经成为AI基础设施团队面临的核心挑战之一。本文基于多个实际项目的经验积累,系统性地介绍大模型推理部署的方法论、部署方案选型、性能调优以及常见问题的解决方案。

在 Amazon EKS 上构建开源可观测性数据栈:VictoriaMetrics + Grafana Loki + Grafana Tempo

本文分享在 Amazon EKS 上自建开源可观测性数据栈的完整实战:用 VictoriaMetrics、Grafana Loki、Grafana Tempo 分别承载指标、日志与链路,数据存入 Amazon S3 与 EBS gp3,通过 IRSA 安全集成。借助 OpenTelemetry Operator 实现存量微服务零代码接入,并在 Grafana 中打通 trace、log、metrics 三向一键关联,自动生成服务拓扑,显著提升故障排查效率。

AWS DevOps Agent 实战:如何使用生成式 AI 加速故障演练

本文将通过示例介绍,如何借助 Kiro 与 AWS DevOps Agent,把原本高度依赖人力的演练,转变为低成本、可复现、并能在每次演练中自动产出调查结论的流程。读完本文,您将了解如何为每一类故障切换信号设计可靠的检测、如何运行基础演练并设计其他演练流程,以及如何把 DevOps Agent 集成到您的 on-call 流程。