⚡ TL;DR
基于中国信通院 Q/KXY SS004-2025《云服务卓越架构能力成熟度模型》+ 腾讯云卓越架构标准 + SRE 最佳实践,通过 CloudQ 智能顾问的多云凭证托管 + 自定义 MCP/Skills/知识库能力,对云架构可运维成熟度进行系统化评估。
6 维度评分(可观测性 / 高可用容错 / 安全合规 / 变更管理 / 应急响应 / 性能保障)× 5 级成熟度(L1 初始级 ~ L5 卓越级),木桶封顶规则,输出雷达图 + 评分卡 + 改进路线图,支持多架构横向对比。
引言:为什么需要架构可运维等级评估
企业云架构的"可用"和"可运维"是两个不同维度的能力。一套架构可能当前运行正常(可用性达标),但在故障发生时缺乏快速发现、定位、恢复的能力(可运维性不足)。架构可运维等级评估正是为量化这一能力而设计——回答核心问题:这套架构在故障发生时,能否快速被发现、被定位、被恢复,且在恢复过程中不影响业务连续性。
本评估方案基于三大标准体系构建,旨在为客户提供权威、可复现、可对比的架构可运维成熟度评估能力,输出结构化评估报告,并通过腾讯云 CloudQ 智能顾问实现自动化数据采集与评级计算。
CloudQ 能力基础
本评估 Skill 运行于 CloudQ 智能顾问平台,依赖以下 CloudQ 核心能力:
| CloudQ 能力 | 在本评估中的用途 |
|---|---|
| 多云凭证托管 | 托管客户腾讯云多账号凭证,在托管态下查询资源信息、监控指标、告警信息 |
| 自定义 MCP | 接入客户业务数据源(Prometheus/Loki/ELK/EventBridge 等),补充监控/日志/变更数据 |
| 自定义 Skills | 本评估 Skill 自身即通过 CloudQ 自定义 Skill 机制加载运行 |
| 自定义知识库 | 客户上传 SOP/Runbook/演练记录等补充材料,Skill 读取后做补充评级 |
| 全景图谱 | 基于托管凭证生成资源拓扑全景,用于跨 AZ 部署/关联分析 |
| 云巡检 | 基于托管凭证执行巡检,输出风险数据(安全组/CAM/COS/DB 备份等) |
| 容量水位 | 基于托管凭证采集资源容量利用率数据 |
| 混沌演练 | 执行混沌演练并采集稳态基线数据 |
多云凭证托管是本评估的前置条件:评估前需确保客户已在 CloudQ 托管对应腾讯云账号凭证。多账号场景下,Skill 可跨账号聚合评估。
一、评估依据
本评估方案依据以下三大标准体系构建,三者互补、不可替代:
| 标准体系 | 角色 | 覆盖范围 |
|---|---|---|
| 中国信通院 Q/KXY SS004-2025 | 主体标准 | 5 大支柱成熟度分级体系(L1-L5 定义 + 检查项) |
| 腾讯云卓越架构标准 | 云产品映射 | 腾讯云产品最佳实践 + CloudQ 数据来源映射 |
| SRE 最佳实践 | 运维方法论 | 可运维性的工程方法论 + 关键指标定义 |
1.1 中国信通院 Q/KXY SS004-2025
《云服务卓越架构能力成熟度模型》(Q/KXY SS004-2025)由中国信息通信研究院、腾讯云、华为云、移动云、量子科技长三角产业创新中心联合起草,2025 年 7 月 22 日由云计算开源产业联盟发布。该标准定义了云服务卓越架构的 5 大支柱(稳定性/安全/性能/成本/运营运维)和 5 级成熟度分级体系(初始级/基础级/全面级/优秀级/卓越级)。
本评估引用该标准的以下章节:
| 标准章节 | 标题 | 对应评估维度 |
|---|---|---|
| §5.2 | 分级概述 | 评分等级 L1-L5 + 90% 规则 |
| §6.2 | 高可用架构 | 高可用与容错韧性 |
| §6.3 | 可观测性 | 可观测性 |
| §6.4 | 熔断限流 | 高可用与容错韧性 |
| §6.5 | 基础设施稳定 | 高可用与容错韧性 |
| §6.6 | 可运维性 | 性能保障 |
| §7 | 安全(安全防护+应用安全+数据安全) | 安全合规 |
| §8 | 性能(性能分析+性能优化) | 性能保障 |
| §10.3 | 变更管理 | 变更管理 |
| §10.4 | 应急管理 | 应急响应 |
| §10.5 | 故障/事件管理 | 应急响应 |
| §10.7 | 事故演练 | 应急响应 |
1.2 腾讯云卓越架构标准
腾讯云作为 Q/KXY SS004-2025 的起草单位之一,其卓越架构标准与信通院模型高度对齐,并补充了腾讯云产品特定的最佳实践。本评估方案通过腾讯云 CloudQ 智能顾问的多云凭证托管能力(支持腾讯云多账号凭证托管),在托管状态下查询对应凭证下的资源信息、监控指标与告警信息,并利用自定义 MCP/Skills/知识库扩展数据来源。
| 检查项 | 腾讯云产品 | CloudQ 能力 | CloudQ 数据来源 |
|---|---|---|---|
| 跨 AZ 部署 | CVM/CLB/TDSQL-C | 凭证托管 + 全景图谱 | 全景图谱拓扑 |
| DB 备份策略 | TDSQL-C/CDB | 凭证托管 + 云巡检 | 巡检数据 |
| COS 版本控制 | COS | 凭证托管 + 云巡检 | 巡检数据 |
| COS 加密 | COS/KMS | 凭证托管 + 云巡检 | 巡检数据 |
| 安全组规则 | VPC/SecurityGroup | 凭证托管 + 云巡检 | 巡检数据 |
| CAM 权限 | CAM | 凭证托管 + 云巡检 | 巡检数据 |
| 容量水位 | CVM/CDB/Redis | 凭证托管 + 容量水位 | 容量水位数据 |
| 变更审计 | CloudAudit | 凭证托管 + 云巡检 | 巡检数据 |
| 事件总线 | EventBridge | 自定义 MCP | M3 MCP 接入 |
| 监控告警 | CloudMonitor | 自定义 MCP | M3 MCP 接入 |
| 日志服务 | CLS | 自定义 MCP | M3 MCP 接入 |
| 混沌演练 | 智能顾问混沌演练 | 混沌演练 | 混沌演练数据 |
| 稳态基线 | 智能顾问混沌演练 | 混沌演练 | 稳态基线数据 |
1.3 SRE 最佳实践
《Site Reliability Engineering》(SRE 最佳实践)是运维领域的工程方法论经典,定义了可运维性的核心概念和指标。本评估中,SRE Book 与信通院并列作为评估依据,提供运维理论基础和关键指标定义。
本评估引用的 SRE 概念:
| SRE 概念 | 出处 | 对应评估维度 |
|---|---|---|
| 监控黄金信号 | Ch.6 Monitoring Distributed Systems | 可观测性(延迟/流量/错误/饱和度) |
| 错误预算 | Ch.3 Embracing Risk | 高可用与容错韧性 |
| SLO/SLI | Ch.4 Service Level Objectives | 可观测性 + 应急响应 |
| MTTD | Ch.11 Being On-Call | 应急响应(平均检测时间) |
| MTTR | Ch.11 Being On-Call | 应急响应(平均恢复时间) |
| Postmortem | Ch.15 Postmortem Culture | 应急响应(故障复盘机制) |
| 变更管理 | Ch.14 — 约束变更 | 变更管理 |
| 容量规划 | Ch.5 Distributing the Load | 性能保障 |
| 自动化价值 | Ch.7 — 自动化的真实价值 | 性能保障(可运维性) |
二、6 评估维度
从信通院 Q/KXY SS004-2025 的 4 大支柱(稳定性/安全/性能/运营运维)中,结合 SRE 运维闭环模型(监控→告警→根因→修复→复盘→改进),选取 6 个与"可运维性"最相关的子维度作为评估维度:
| # | 维度 | 信通院章节 | SRE 对应概念 | 权重 | 评估核心 |
|---|---|---|---|---|---|
| 1 | 可观测性 | §6.3 | 监控黄金信号(延迟/流量/错误/饱和度) | 0.20 | 监控/日志/链路追踪覆盖度 + 告警分级 + 智能分析 |
| 2 | 高可用与容错韧性 | §6.2+§6.4+§6.5 | 冗余设计 + 错误预算 | 0.20 | 多 AZ 部署 + 冗余 + 备份恢复 + 流量保护 |
| 3 | 安全合规 | §7 | — | 0.15 | 安全组 + CAM + 加密 + 数据分级 + 等保合规 |
| 4 | 变更管理 | §10.3 | 变更管理 + SLO 迭代 | 0.15 | 变更审批 + 灰度发布 + 回滚 + 自动化部署 |
| 5 | 应急响应 | §10.4+§10.5+§10.7 | MTTD + MTTR + Postmortem | 0.15 | 值班 + 故障分级 + MTTD/MTTR + 故障复盘 + 混沌演练 |
| 6 | 性能保障 | §8+§6.6 | 容量规划 + 性能基线 | 0.15 | 性能基线 + 容量规划 + 自动调优 + 自动化运维 |
2.1 SRE 运维闭环验证
验证 6 维度是否覆盖 SRE 定义的运维完整闭环:
| SRE 闭环环节 | 覆盖维度 | SRE 出处 |
|---|---|---|
| 监控 | 可观测性 | Ch.6 Monitoring Distributed Systems |
| 告警 | 可观测性 | Ch.6 — 黄金信号 |
| 根因定位 | 可观测性 + 应急响应 | Ch.6 + Ch.11 |
| 修复 | 应急响应 + 变更管理 | Ch.11 + 变更管理 |
| 复盘 | 应急响应 | Ch.15 Postmortem Culture |
| 改进 | 变更管理 | 持续改进 |
2.2 未评估的维度
| 标准维度 | 不评估原因 |
|---|---|
| Q/KXY §6.1 服务解耦 | 属架构设计评估,非运维能力评估 |
| Q/KXY §9 成本 | 成本高不等于运维能力差,由独立成本评估 Skill 覆盖 |
| Q/KXY §10.1 组织架构 | 非技术评估项,需人工问卷 |
| Q/KXY §10.2 团队建设 | 非技术评估项,需人工问卷 |
| Q/KXY §10.6 入网测试 | 属上线前评估,非运维评估 |
三、评分等级(L1-L5)
严格采用信通院 Q/KXY SS004-2025 §5.2 的 5 级定义,并与 SRE 成熟度特征对应:
| 等级 | 英文 | 中文 | 信通院定义 | SRE 对应 |
|---|---|---|---|---|
| L1 | Initial Level | 初始级 | 被动救火,无规范/无工具/无文档 | 无 SLO,靠用户投诉发现问题 |
| L2 | Basic Level | 基础级 | 有基础规范和工具,但覆盖不全 | 有基础 SLO 但不迭代 |
| L3 | Comprehensive Level | 全面级 | 体系化覆盖,自动化初步形成 | SLO 迭代,有错误预算管理 |
| L4 | Excellent Level | 优秀级 | 全自动化 + 智能化辅助,少量人工决策 | SLO 驱动,自动告警 + 自动根因 |
| L5 | Fabulous Level | 卓越级 | AI 大脑中枢,自学习/自优化/自愈 | 全自动自愈,预测性运维 |
90% 规则:每级满足 90% 的能力项即可认为达到该级别(Q/KXY SS004 §5.2)。高级别内容宜包含低级别内容,无需重复引用。
四、评分机制
4.1 综合分计算公式
综合分 = Σ(维度等级分 × 维度权重) 范围 1.00-5.00
等级分值映射:L1=1.0, L2=2.0, L3=3.0, L4=4.0, L5=5.0
权重表(依据信通院支柱重要性 + SRE 原则):
| 维度 | 权重 | 依据 |
|---|---|---|
| 可观测性 | 0.20 | Q/KXY §6.3 + SRE:监控是运维基础 |
| 高可用与容错韧性 | 0.20 | Q/KXY §6.2 核心稳定性 + SRE 错误预算 |
| 安全合规 | 0.15 | Q/KXY §7 安全支柱 |
| 变更管理 | 0.15 | Q/KXY §10.3 + SRE 变更管理 |
| 应急响应 | 0.15 | Q/KXY §10.4+10.5 + SRE MTTD/MTTR |
| 性能保障 | 0.15 | Q/KXY §8 + SRE 容量规划 |
| 合计 | 1.00 |
综合分到等级的映射:
| 综合分范围 | 综合等级 |
|---|---|
| [1.0, 1.8) | L1 初始级 |
| [1.8, 2.6) | L2 基础级 |
| [2.6, 3.4) | L3 全面级 |
| [3.4, 4.2) | L4 优秀级 |
| [4.2, 5.0] | L5 卓越级 |
4.2 木桶封顶规则
综合等级 = min(加权综合分对应等级, 最低维度等级)
依据:信通院 Q/KXY SS004 §5.2 "每级满足 90% 的能力项即可认为达到该级别"。一个维度严重不足即不满足晋级条件。
示例:
| 场景 | 可观测 | 容错 | 安全 | 变更 | 应急 | 性能 | 加权分 | 封顶后 |
|---|---|---|---|---|---|---|---|---|
| 客户 A | L4 | L4 | L4 | L4 | L1 | L4 | 3.6 (L4) | L1 |
| 客户 B | L3 | L3 | L3 | L3 | L3 | L3 | 3.0 (L3) | L3 |
| 客户 C | L4 | L4 | L3 | L4 | L4 | L4 | 3.8 (L4) | L3 |
4.3 维度内评级规则
- 每个维度有多个检查项(详见 Skill 包 references/check-items.md)
- 每个检查项独立判定 L1-L5
- 维度内 90% 检查项达到某等级 → 该维度取该等级
- 不足 90% → 取下一等级
- 每条判定必须附证据(数据源 + 具体值)
4.4 Baseline 缺失保护
- 首次评估:报告显式标注"首次评估,无历史 baseline",对比表留空
- 第二次起:输出 Δ 变化(等级升降 + 分数差)
- 禁止编造趋势:没有历史数据时,不允许输出"较上次提升 X"这类语句
4.5 降级评估规则
| 数据源状态 | 对应维度处理 |
|---|---|
| MCP 未接入(Prometheus/Loki/ELK) | 可观测性维度降级为 L1-Unknown,标注"数据未接入" |
| CloudAudit 无数据 | 变更管理维度降级,仅基于知识库评级 |
| 知识库无文档 | 应急响应/变更管理部分检查项标注"需补充材料" |
| L1-Unknown | 不参与综合分计算(权重按比例分配给其他维度),木桶封顶不适用 |
五、检查项标准
每个维度包含多个检查项,每个检查项有明确的 L1-L5 判定标准。以下以"可观测性"和"高可用与容错韧性"为例展示完整检查项表,其余维度详见 Skill 包 references/check-items.md。
5.1 可观测性检查项(Q/KXY §6.3)
| 检查项 | L1 | L2 | L3 | L4 | L5 |
|---|---|---|---|---|---|
| 数据采集覆盖 | 缺乏标准化,Excel 手工处理 | 关键指标规范化,部分组件未覆盖 | 覆盖性能/业务/健康/UX 各层面,实时采集 | 动态调整采集粒度,资源+架构+应用多维 | AI 自动调整策略,多云统一底座 |
| 监控与告警 | 仅基础性能指标,手动触发 | 主要应用监控,静态阈值,有漏检误报 | 全面监控+静态/动态阈值+实时告警+分析能力 | 基于历史数据告警+故障风险识别+自动诊断建议 | AI 多 Agent 协同,故障检测/分析/自愈闭环 |
| 指标/日志/链路系统 | 无集中管理 | 基本集中管理,无跨服务追踪 | 指标+日志+链路集中收集,跨服务追踪 | 端到端全自动化,多维度深度查询 | 高度可视化/自动化/智能化,AI 识别优化点 |
5.2 高可用与容错韧性检查项(Q/KXY §6.2 + §6.4 + §6.5)
| 检查项 | L1 | L2 | L3 | L4 | L5 |
|---|---|---|---|---|---|
| 冗余架构设计 | 单点部署,单点故障 | 初步冗余(主备/双机热备),手动干预 | 核心模块冗余+自动故障转移+多 AZ 部署 | 全组件冗余+多 AZ+自动切换 RTO 分钟级 | 多云/混合云跨区域灾备+AI 智能恢复 RTO 秒级 |
| 数据备份与恢复 | 无备份机制 | 定期全量备份,恢复慢有丢失风险 | 标准化备份+快速恢复+多地点存储 | 跨区域恢复+自动化 RTO 秒级 | AI 智能同步备份+RPO≈0 |
| 熔断限流 | 无熔断限流,突发流量直冲 | 基础限流(QPS/TPS/CPU),静态阈值 | 智能熔断+动态限流+负载均衡+自动伸缩 | 自适应熔断+细粒度限流+快速恢复 | AI 预测过载+多维熔断+智能自愈 |
| 容灾演练 | 无 | 无 | 有一定混沌演练和风险巡检,依赖人工 | 全自动混沌演练和风险巡检 | AI 管控演练+可视化分析报告 |
5.3 行业阈值配置
不同行业对运维能力的要求不同,Skill 包内置 thresholds.yaml 配置文件,支持按行业加载不同阈值:
| 行业 | 典型差异 | 示例 |
|---|---|---|
| 互联网(默认) | L4 监控覆盖率 85%+ | 日志保留 90 天 |
| 金融 | L4 监控覆盖率 95%+,安全权重 0.20 | 日志保留 180 天,KMS 90 天轮转 |
| 政务 | 应急演练半年 1 次 | 安全权重 0.20 |
六、评估流程
6.1 输入
| 字段 | 必填 | 说明 |
|---|---|---|
| 架构范围 | 是 | 项目名 / 资源标签 / 资源 ID 列表 / 地域 |
| 评估时间窗口 | 否 | 默认最近 30 天,用于变更/告警统计 |
| 行业类型 | 否 | internet/finance/gov,加载不同阈值 |
| 补充知识库 | 否 | 客户上传的 SOP/Runbook/演练记录等 |
6.2 Workflow
| 步骤 | 内容 |
|---|---|
| 第一步:资源盘点 | 基于 CloudQ 全景图谱,列出架构涉及的所有资源 |
| 第二步:数据采集(并行) | 巡检+容量+拓扑+告警+日志+变更+知识库 |
| 第三步:评分 | 对每个维度的检查项逐一判定 L1-L5,计算维度等级 |
| 第四步:报告生成 | 生成评估报告 + 雷达图 + 横向对比 + 改进路线图 |
6.3 数据来源与阶段路线图
| 阶段 | 评分范围 | 数据来源 |
|---|---|---|
| M0 | 完整标尺定义(6维度 × L1-L5 × 检查项 × 阈值) | 不依赖外部数据 |
| M1 | 3 维度完整评分(安全/容错/性能)+ 3 维度降级评估 | CloudQ 内置数据 |
| M2 | +知识库补充(应急响应/变更管理的 SOP/演练记录) | CloudQ + 知识库 |
| M3 | 6 维度完整评分 | 接入 MCP + 知识库 |
七、知识库补充机制
无法通过 MCP 等扩展方式自动获取数据的检查项,可在 CloudQ 自定义知识库上传补充材料,Skill 读取后做补充评级:
| 知识库内容类型 | 对应维度 | 用途 |
|---|---|---|
| 架构图(PNG/PDF) | 全维度 | 资源拓扑核对 |
| Runbook/SOP 文档 | 应急响应/变更管理 | SOP 完整度评级 |
| 故障复盘报告 | 应急响应/变更管理 | 演练/复盘频率评级 |
| 值班排班表 | 应急响应 | 值班制度评级 |
| 等保测评报告 | 安全合规 | 合规等级交叉验证 |
| CI/CD 流水线配置 | 变更管理 | 灰度/回滚能力评级 |
| 混沌演练记录 | 应急响应 | 演练频率评级 |
Skill 读取逻辑:
- 检查知识库中是否有对应类型的文档
- 有 → LLM 解析文档内容,提取检查项通过/未通过
- 无 → 该检查项标注"需用户补充材料",对应维度评级上限锁定 L2
八、报告输出结构
评估报告包含以下 8 个章节:
- 评估依据:三大标准声明 + 评估覆盖范围
- TL;DR:综合等级 + 综合分 + Top3 短板 + 数据覆盖度 + 评估时间 + 耗时
- 6 维度雷达图:SVG 可视化
- 各维度评分卡:检查项 × 等级 × 证据 × L+1 目标 × 改进建议
- 横向对比:历史趋势(首次评估留空)
- 改进路线图:按 ROI 排序的改进项清单
- 评估覆盖度说明:已评维度数 / 总维度数
- 附录:评估标准映射 + 检查项清单 + 阈值配置
报告封面必须包含以下声明:
本评估依据以下标准:
- 中国信通院 Q/KXY SS004-2025《云服务卓越架构能力成熟度模型》
- 腾讯云卓越架构标准
- SRE 最佳实践(Site Reliability Engineering, 2016)
评估覆盖 4/5 支柱(稳定性/安全/性能/运营运维),成本维度不在评估范围。
分级体系 L1-L5 对应 Q/KXY SS004 §5.2 定义。
运维指标定义(MTTD/MTTR/SLO/SLI/错误预算)依据 SRE 最佳实践。
九、Skill 包与使用指引
9.1 Skill 包下载
完整的评估 Skill 包可从以下地址下载:
📦 architecture-operability-grade.zip(16KB)
下载地址:architecture-operability-grade.zip
9.2 Skill 包结构
architecture-operability-grade/
├── SKILL.md # 主指令(评估 Workflow + 报告模板)
├── references/
│ ├── standards.md # 三大标准 + 章节映射 + SRE 概念映射
│ ├── check-items.md # 6 维度 × 检查项 × L1-L5 判定标准
│ ├── scoring-formula.md # 评分公式 + 木桶封顶 + baseline 保护
│ └── thresholds.yaml # 行业阈值(internet/finance/gov)
9.3 上传到 CloudQ 使用指引
- 登录 CloudQ 控制台:访问 CloudQ 智能顾问控制台,进入「Skill 管理」页面
- 上传 Skill 包:点击「上传自定义 Skill」按钮,选择下载的
architecture-operability-grade.zip文件上传 - 验证安装:上传成功后,在 Skill 列表中确认技能名称
architecture-operability-grade已激活 - 发起评估:在 CloudQ 会话中输入架构范围(如项目名/资源标签/地域),触发评估
- (可选)配置行业阈值:如客户属于金融/政务行业,在 Skill 配置中指定
industry: finance或industry: gov以加载对应阈值 - (可选)上传知识库:在 CloudQ 自定义知识库中上传 SOP/Runbook/演练记录等补充材料,以获得更完整的评估覆盖
- 查看报告:评估完成后,在会话中查看评估报告(含雷达图 + 评分卡 + 改进路线图)
9.4 SKILL.md frontmatter 格式
CloudQ 对 Skill 名称有命名规范要求:仅允许小写字母、数字、连字符和下划线。本 Skill 的 frontmatter 如下:
---
name: architecture-operability-grade
description: |
Evaluate cloud architecture operability maturity based on CAICT Q/KXY SS004-2025,
Tencent Cloud Well-Architected Framework, and SRE 最佳实践.
Assesses 6 dimensions: Observability, High Availability & Fault Tolerance,
Security & Compliance, Change Management, Emergency Response, Performance Assurance.
Each dimension is scored L1-L5 per the CAICT standard.
---
十、总结
本评估方案通过三大标准体系的融合,为客户提供权威、可复现、可对比的架构可运维成熟度评估能力:
- 权威性:基于中国信通院 Q/KXY SS004-2025 国家行业标准 + SRE 最佳实践 运维方法论经典
- 可复现性:每个检查项都有可程序化检测的阈值,同一架构重复评估结果一致
- 可对比性:支持多次评估横向对比 + 多架构横向对比
- 可执行性:通过 CloudQ 智能顾问自动化数据采集,无需人工问卷
- 行业适配:内置互联网/金融/政务三套行业阈值,可按客户行业加载
评估结果不仅给出当前等级,还提供按 ROI 排序的改进路线图,帮助客户明确从当前等级到下一等级的最优路径。