This bundle contains the independent frozen reference, candidate kernels, exact evaluator, public API benchmark, safety audit, and final receipts for the Apple Silicon MPS optimization.
Run from the repository root with the project environment:
PYTHONPATH=. python optimization_candidates/eval_muon_exact.py --device mps --candidate out_mm_bx_cast_after_context
PYTHONPATH=. python optimization_candidates/eval_muon_public_api.py
PYTHONPATH=. python optimization_candidates/audit_muon_safety.pyThe final public benchmark receipt reports a 1.091x median speedup. The gates use raw tensor-byte equality, output metadata, input immutability, contracts, gradients, adversarial values, and held-out shapes.