PTXBench: 아키텍처별 PTX를 사용한 GPU 커널 최적화를 위한 LLM 벤치마크 및 적응
PTXBench: Benchmark and Adapt LLMs for GPU Kernel Optimization with Architecture-specific PTX
August 18, 2026
저자: Genghan Zhang, Yixin Dong, Chengze Fan, Zhichen Zeng, Yueming Yuan, Shaowei Zhu, Kunle Olukotun
cs.AI
초록
우리는 GPU 커널 최적화를 위해 아키텍처별 PTX를 활용하도록 대규모 언어 모델(LLM)을 평가하고 적응시키기 위한 벤치마크인 PTXBench를 소개한다. PTXBench는 기능적 정확성, 선택된 대상 명령어가 런타임에 실제로 실행되는지 여부, 그리고 H100 및 B200 GPU에서 GEMM 및 어텐션 작업 전반에 걸친 최첨단 라이브러리 대비 속도 향상을 측정한다. 우리의 평가는 아키텍처별 PTX 활용 능력이 여전히 고르지 않음을 보여준다. 복잡한 어텐션 역방향 작업에서는 성공률이 상당히 하락하며, 대상 명령어를 실행한다고 해서 반드시 경쟁력 있는 성능으로 이어지지는 않는다. 평가된 어떤 모델도 스위트 전반에서 최첨단 라이브러리와 일관되게 일치하지 못했다. 우리는 또한 지도 미세 조정을 통해 Qwen3.6-27B를 추가로 적응시켰다. 수리 조건화 훈련은 여러 작업에서 성능을 개선했지만, 일반화는 여전히 고르지 않다. 데이터 범위, 균형, 추론 교사 모델의 품질이 데이터셋 규모와 더불어 중요하다. PTXBench는 진화하는 GPU 아키텍처를 활용하는 LLM의 능력을 측정하고 개선하기 위한 감사 가능한 테스트베드를 제공한다.
English
We introduce PTXBench, a benchmark for evaluating and adapting large language models (LLMs) to use architecture-specific PTX for GPU kernel optimization. PTXBench measures functional correctness, whether selected target instructions execute at runtime, and speedup over frontier libraries across GEMM and attention workloads on H100 and B200 GPUs. Our evaluation shows that architecture-specific PTX capability remains uneven: success rates fall substantially on complex attention backward workloads, and executing the target instructions does not necessarily translate into competitive performance. No evaluated model consistently matches frontier libraries across the suite. We further adapt Qwen3.6-27B using supervised fine-tuning. Repair-conditioned training improves several tasks, but generalization remains uneven; data coverage, balance, and the quality of the reasoning teacher matter in addition to dataset size. PTXBench provides an auditable testbed for measuring and improving LLMs' ability to exploit evolving GPU architectures.