可靠性
可靠性不是只多写一个 try/catch。调用方需要区分立即结果、提交拒绝、任务失败、等待超时和长期趋势,并为每类事件保留正确的观察出口。
- 失败可观察性:组合
future、failure callback、累计计数和最近事件。 - 监控与采样:按开销和所需精度收集任务统计或完整生命周期快照。
- 按症状排查运行故障:从不执行、积压、等待超时、关闭卡住、实时丢任务和 GPU 不可用获得固定检查顺序。
- Linux、Windows 与 Android 部署核对:检查构建、CPU、实时权限、内存锁定、Android CPU-only 降级和平台特有行为是否真实生效。
通信组件的 drop、覆盖、stale 与 missed phase 属于组件本地事件,不会自动进入 ExecutorFailureStatus;请在通信组件选型中为它们设置对应观察路径。