7 章 · 共 16

正常流程、审批点与异常分支

7.1 正常订单状态机

正在绘制业务流程…
把正文中的参与者、动作与交接关系放回同一条业务链观察。

状态迁移必须由证据触发,不能由人员直接把订单从 Designed 改成 Active。例如 Active 的必要条件可以是合同有效、付款或信用放行、资源ID完整、测试通过、客户授权代表验收、监控与计量启用、运行手册交接。具体企业可调整条件,但每条都要可机器校验或人工复核。

7.2 关键审批门

必要输入唯一A禁止绕过失败出口
许可门实际业务、网络和地区说明ROLE-I01-02用营销名称推断许可修改范围或完成办理
容量门负载、故障域、时间和缓冲ROLE-I01-06只看名义资源数候补地点或建设变更
价格毛利门成本卡、价格、折扣和风险授权商业负责人用未来未批准扩建压低成本改SKU或升级审批
合同门条款、附件、例外和版本ROLE-I01-05邮件承诺覆盖合同形成可签版或拒绝
生产变更门作业票、测试、回退和通信ROLE-I01-10口头要求直接操作重新排窗或紧急变更
账单门合同、资源、计量和价格版本ROLE-I01-16缺计量仍发布冻结争议行并重跑

7.3 变更控制:资源数量、地点和SLA都不能只改一处

客户增加机柜或云配额时,应新建 DOC-I01-08 变更单,重新做容量、架构、安全、价格、交付窗口和计费评估。获批后同时更新合同订单、容量账、配置项、监控、计量、账单计划和客户运行手册。减少资源也不能直接删除:先确认最小承诺、数据和资产迁移、未结账单、服务结束日,再撤权释放。

正在绘制业务流程…
把正文中的参与者、动作与交接关系放回同一条业务链观察。

7.4 重大故障:先保护人、服务和证据

业务起点
协作与交接
结果与复盘
事件指挥在网络运营中心组织设施网络云平台安全和客户沟通角色按时间线恢复服务并保全证据

图 4:重大事件需要一名事件指挥统一优先级,技术恢复、证据保全和客户更新并行,而不是多人各自解释。

正在绘制业务流程…
把正文中的参与者、动作与交接关系放回同一条业务链观察。

前 60 分钟应完成:确认影响范围而非猜根因;指定事件指挥、技术负责人、记录员和客户沟通人;冻结非必要变更;保全监控、配置、门禁和操作日志;采取可逆止损;按约定节奏发布已知事实和下一次更新时间。恢复后不能立即关单,要验证客户业务、积压任务、数据一致性、计量连续性和冗余是否恢复。

7.5 七类高频异常与出口条件

异常立即动作唯一A财务影响出口条件
容量超卖停止新承诺,锁定受影响资源,重算故障域ROLE-I01-06退款、延期成本、机会损失容量账与现场盘点一致且客户方案确认
电力/制冷中断人身安全优先,隔离故障,启用预案ROLE-I01-12修复成本、服务抵扣、潜在损失服务与冗余验证,复盘行动立项
网络中断或路由错误冻结变更、切换或回退、保全配置ROLE-I01-12抵扣和上游追偿端到端业务验证和配置基线更新
云资源争用限制异常负载,保护租户隔离,扩容或迁移ROLE-I01-12额外资源成本、抵扣性能回基线并验证邻居影响
计量缺失/重复冻结受影响账单行,保全原始事件ROLE-I01-16收入延迟、客户争议重跑可复现且客户/财务复核
客户欠费信用升级,按合同通知,限制非关键扩容ROLE-I01-17应收账龄、减值风险回款、批准还款计划或依法终止
未授权访问/跨境立即阻断、吊销凭证、保全日志、风险评估ROLE-I01-13事件处置与潜在赔付依法依约完成通知整改与复核

7.6 计量异常的四步回放

假设计费批次在 02:00 重跑时,把 01:00—02:00 的用量事件重复读取。正确处置不是删掉一行就结束,而是:第一,冻结受影响 bill_id;第二,以不可变原始事件和去重键确定重复范围;第三,用相同价格版本重算并记录前后差异;第四,让计费与财务分别复核,必要时向客户出具调整说明,已经开票的按税务流程处理。

检查问题控制
完整性所有应到事件是否到齐事件序号、时间窗水位、迟到队列
唯一性同一用量是否重复资源ID+时段+事件类型+版本去重键
准确性单位和数量是否可信单位换算、负数/极值规则、源系统对账
价格性是否使用正确合同价格生效区间、价目版本、优惠与封顶
可追溯重跑能否还原批次ID、代码版本、输入快照、审批记录

7.7 欠费、暂停和退场不能由财务单独关资源

财务确认逾期后发出信用事件,商务核对合同通知和宽限期,客户经理联系授权人,交付与安全评估暂停或限制的业务影响,最终按获批方案执行。对于承载关键业务的资源,技术团队不能只看到“逾期”就删除;对于已依法终止的客户,也不能因为客户关系好而无限期保留数据和容量。

退场至少完成:最终账单与争议冻结、客户资产盘点、数据导出与校验、客户接收确认、账号和密钥吊销、设备下架或资源销毁、备份按保留期处理、门禁取消、容量账释放、监控和计费停止、证明归档。任何未完成项都应有责任人和到期日。

7.8 请求、事件、问题和变更要走不同路径

客户申请增加一个端口是服务请求;现有端口不可用是事件;连续三个月同类端口故障的深层原因是问题;执行设备升级或路由调整是变更。四者有关联但不能互相替代。把全部内容都叫“工单”会丢失优先级、SLA、根因和审批边界。

类型目标什么时候关闭典型指标
服务请求交付标准且授权的动作请求完成并由申请人/规则确认响应、履行时长、一次完成率
事件尽快恢复服务和控制影响业务恢复且观察期通过MTTD、MTTR、更新准时率
问题找到根因并防止复发长期措施验证,不是报告写完复发率、行动按期率
变更受控改变生产配置实施、测试、配置与文档更新成功率、回退率、变更致事件率

一次重大事件可以先恢复服务后关闭事件状态,同时保留问题记录继续完成根因整改。若强迫“根因未完不能恢复结案”,运营看板会混乱;若服务一恢复就删除问题,又会重复发生。

7.9 计划维护的六个时钟

计划维护需同时管理客户通知提前量、内部审批截止、配置冻结、实施窗口、验证观察期和回退最晚启动时点。假设窗口为00:00—04:00,预计实施120分钟、验证30分钟、回退60分钟、缓冲30分钟,则若02:30仍未进入可验证状态,就应认真启动回退,而不能拖到03:59才讨论。

时钟示例控制意义
客户通知合同约定提前量给客户安排业务和异议时间
内部批准窗口前完成确保资源、工具和责任到位
配置冻结实施前基线锁定避免方案和现场不同
实施截止02:00留出验证与回退
回退决定点02:30防止窗口尾部冒险
观察结束04:00或另定确认业务和监控稳定

7.10 客户沟通只说已知事实、影响、动作和下一更新时间

初始通知可以非常短:检测到什么服务异常、已确认哪些范围、团队正在做什么、客户可以采取什么临时动作、下一次更新时间。根因未确认前不要猜“是运营商”“是客户流量”或“是电源”。恢复通知要说明服务是否完全恢复、是否仍有降级、怎样验证、下一次复盘安排;根因报告再给证据、贡献因素和整改。

客户沟通岗位不替代事件指挥。ROLE-I01-14 负责用客户能理解的语言与节奏传递经确认事实,ROLE-I01-12 决定技术优先级与现场状态,ROLE-I01-13 判断安全或数据事件的法定/合同通知,ROLE-I01-05 解释合同救济。每类内容都有权威来源。

章末理解检查

合上原文,你能讲明白了吗?

不看原文,用自己的话解释「正常流程、审批点与异常分支」真正要解决什么业务问题。

已输入 0 个字,还需 12 个字;提交后会显示自检标准,并把本章记为已完成。
本章目录10