379fcb62eb
- Detected interleaved 24-byte vertex layout: xyz(12)+color(4)+uv(8). Fast path writes 6 sequential u32s instead of scattered stores. - Normal stride=0 (shared global) — write once in writeback, not 4x. - Added stride_info export + logging for vertex layout analysis. - A/B: ~30% peak reduction, baseline also improved due to less overhead.