Publications

* indicates equal contribution

UniCache: Unifying Prefix Cache Eviction for Heterogeneous LLM Serving Workloads

Bei Ouyang, Yifan Qiao, Jiarong Xing

Proceedings of the ACM on Measurement and Analysis of Computing Systems (SIGMETRICS) 2026

Paper

Venus: An Efficient Edge Memory-and-Retrieval System for VLM-based Online Video Understanding

Shengyuan Ye*, Bei Ouyang*, Tianyi Qian, Liekang Zeng, Mu Yuan, Xiaowen Chu, Weijie Hong, Xu Chen

IEEE INFOCOM 2026-IEEE Conference on Computer Communications (INFOCOM) 2026

Resource-Efficient Personal Large Language Models Fine-Tuning with Collaborative Edge Computing

Shengyuan Ye*, Bei Ouyang*, Tianyi Qian, Liekang Zeng, Jingyi Li, Jiangsu Du, Xiaowen Chu, Guoliang Xing, Xu Chen

IEEE Transactions on Parallel and Distributed Systems (TPDS) 2026

DOIPaper

Jupiter: Fast and resource-efficient collaborative inference of generative llms on edge devices

Shengyuan Ye, Bei Ouyang, Liekang Zeng, Tianyi Qian, Xiaowen Chu, Jian Tang, Xu Chen

IEEE INFOCOM 2025-IEEE Conference on Computer Communications (INFOCOM) 2025

DOIPaper

Revisiting Location Privacy in MEC-Enabled Computation Offloading

Jingyi Li, Wenzhong Ou, Bei Ouyang, Shengyuan Ye, Liekang Zeng, Lin Chen, Xu Chen

IEEE Transactions on Information Forensics and Security (TIFS) 2025

DOIPaper

Resource-Efficient Collaborative Edge Transformer Inference with Hybrid Model Parallelism

Shengyuan Ye, Bei Ouyang, Jiangsu Du, Liekang Zeng, Tianyi Qian, Wenzhong Ou, Xiaowen Chu, Deke Guo, Yutong Lu, Xu Chen

IEEE Transactions on Mobile Computing (TMC) 2025

DOIPaper

Pluto and Charon: A Time and Memory Efficient Collaborative Edge AI Framework for Personal LLMs Fine-tuning

Bei Ouyang*, Shengyuan Ye*, Liekang Zeng, Tianyi Qian, Jingyi Li, Xu Chen

Proceedings of the 53rd International Conference on Parallel Processing (ICPP) 2024

DOISlidePaper