| 标题 |
Cola: Cross-Processor Operator Parallelism for Asynchronous Deep Learning Inference |
| 网址 | |
| DOI | |
| 其它 |
摘要: 多任务推理作为当今流行的推理范式,需要在硬件平台上部署多个深度学习模型以并发处理推理任务。现代平台通常配备各种异构处理器,如CPU-GPU平台。为了减少资源争用并提升多任务场景中的服务质量,现有工作已在细粒度操作员层面研究跨处理器推断。然而,它缺乏针对异步多任务推理系统的具体优化。在这些系统中,任务动态生成,导致每个模型的推理进展各异。这使得仅基于原始计算图的离线优化策略变得次优甚至无效。因此,我们提出了一个新颖的框架Cola,用于处理异步任务的跨处理器操作员调度问题。Cola 引入中间表示来抽象和简化此类动态调度问题,考虑任务到达模式对推理进展的影响,并采用高效的两阶段搜索算法。我们在智能钢结构制造的真实案例中实施并验证了Cola。Cola 在吞吐量和资源利用率上都优于最先进的跨处理器操作员调度框架,运行时开销也非常可接受。 |
| 求助人 | |
| 下载 | 该求助完结已超 24 小时,文件已从服务器自动删除,无法下载。 |
PDF的下载单位、IP信息已删除
(2025-6-4)