Complex reasoning queries can be decomposed into directed acyclic task graphs and distributed across heterogeneous LLMs, reducing latency through parallelism…
机构:UT Austin
来源:arXiv 2610.03296 | AI4Papers 论文推荐平台