Deep learning inference and training performance depends critically on GPU kernel efficiency. Modern compilers such as PyTorch Inductor automatically generat…
机构:Red Hat
来源:arXiv 2609.30059 | AI4Papers 论文推荐平台