AI Runway AKS 设置
此技能引导用户从裸 Kubernetes 集群进入运行中的 AI 模型部署。除非用户提供 skip-to-step N 以从特定阶段恢复,否则请按顺序执行每个步骤。
成本意识: GPU 节点池会产生显著的计算费用(A100-80GB 可能花费 $3–5+/hr)。在预配 GPU 资源之前,请确认用户理解成本影响。
前置条件
此技能假设已存在一个 AKS 集群。如果用户没有集群,请先移交给 azure-kubernetes 技能预配一个集群(除非可接受仅 CPU 推理,否则应包含 GPU 节点池),然后返回此处。
快速参考
| 属性 | 值 | |----------|-------| | 最适合 | 在 AKS 上端到端引导 AI Runway | | CLI 工具 | kubectl, make, curl | | MCP 工具 | 无 | | 相关技能 | azure-kubernetes(集群设置)、azure-diagnostics(故障排除) |
何时使用此技能
当用户希望以下操作时使用此技能:
- 在现有 AKS 集群上从头设置 AI Runway
- 安装 AI Runway 控制器和 CRDs
- 评估 GPU 硬件兼容性以部署模型
- 选择并安装推理提供商(KAITO、Dynamo、KubeRay)
- 通过 AI Runway 将首个 AI 模型部署到 AKS
- 从特定步骤恢复尚未完成的 AI Runway 设置
MCP 工具
此技能不使用任何 MCP 工具。所有集群操作都直接通过 kubectl 和 make 执行。
规则
- 按顺序执行步骤 — 到达每个步骤时加载其参考文档
- 在每个步骤报告集群状态:✓ 正常,✗ 缺失/失败
- 在任何安装或部署操作之前请求用户确认
- 如果步骤已完成,报告状态并跳到下一步
- 如果用户提供
skip-to-step N,从步骤 N 开始;假设之前的步骤已完成
步骤
| # | 步骤 | 参考 | |---|------|-----------| | 1 | 集群验证 — 上下文检查、节点清单、GPU 检测 | [step-1-verify.md](references/steps/step-1-verify.md) | | 2 | 控制器安装 — CRD + 控制器部署 | [step-2-controller.md](references/steps/step-2-controller.md) | | 3 | GPU 评估 — 检测 GPU 模型,标记 dtype/attention 约束 | [step-3-gpu.md](references/steps/step-3-gpu.md) | | 4 | 提供商设置 — 推荐并安装推理提供商 | [step-4-provider.md](references/steps/step-4-provider.md) | | 5 | 首次部署 — 选择模型、部署、验证 Ready | [step-5-deploy.md](references/steps/step-5-deploy.md) | | 6 | 总结 — 回顾、冒烟测试、后续步骤 | [step-6-summary.md](references/steps/step-6-summary.md) |
错误处理
| 错误 / 症状 | 可能原因 | 补救措施 | |-----------------|--------------|-------------| | 无 kubeconfig 上下文 | 未连接到集群 | 运行 az aks get-credentials 或等效命令 | | 控制器处于 CrashLoopBackOff | 配置或 RBAC 问题 | kubectl logs -n airunway-system -l control-plane=controller-manager --previous | | 提供商未就绪 | 镜像拉取或 RBAC 问题 | 对提供商 pod 运行 kubectl logs <pod-name> -n <namespace> | | ModelDeployment 卡在 Pending | GPU 调度失败或提供商未就绪 | 查看 kubectl describe modeldeployment <name> -n <namespace> 事件 | | 推理期间出现 bfloat16 错误 | T4 或 V100 缺少 bfloat16 支持 | 在服务参数中添加 --dtype float16 |
有关完整的错误处理和回滚程序,请参阅 [troubleshooting.md](references/troubleshooting.md)。