关注最新报道、解读和相关科技故事。
CNCF 的一篇文章指出,运行企业级人工智能基础设施并不意味着部署单个模型或集群,而是要为多个团队管理共享的 GPU 单元集群,同时平衡利用率、隔离性和成本。文章介绍了包括供应、分配、调度、网络、存储、监控和计费在内的技术层。
CNCF 的分析得出结论:Dynamic Resource Allocation 并不会让 HAMi 变得多余,而是接管 GPU 配额调度的一部分,同时 HAMi-core 仍负责在容器内部强制执行限制。文章介绍了 HAMi-DRA 的架构、运行要求,以及迁移到该方案前应考虑的限制。