What problem does it solve? Validating operator correctness and measuring performance on Huawei Ascend 910B NPUs requires coordinating CANN toolchains, native ACLNN binaries, torch_npu scripts, and strict result contracts, which is error-prone when done manually. ## Core Features & Use Cases - Accuracy Validation: Compares FP32/FP16 operator outputs on the 910B against freshly generated CPU ground-truth references. - Native Performance Benchmarks: Measures GEMM (448 cases), CUDA-style Conv2d forward plus dual backward (126 cases), FP32/FP16 LongTail operators (80 cases), and FP32 Transformer encoder/decoder inference latency. - Result Contract 2.0 Collection: Validates case identities, finite positive latencies, workload fingerprints, and run tokens, then atomically publishes a standardized result.json. - Use Case: An engineer evaluating Ascend 910B operator support launches the verified container, runs the GEMM benchmark via the provided runner, and obtains a validated result.json with per-case latencies and p50/p95 summary metrics. ## Quick Start Ask the agent to run the Ascend 910B GEMM operator benchmark and collect the Result Contract 2.0 output.