Organization <Full Program · Contributors · Organizations · Search Program · Flagged · My Recommendations · Happening NowMore…Search ProgramFlaggedMy RecommendationsHappening NowResearch Center for High Efficiency Computing Infrastructure, Zhejiang LabPresentationsResearch ManuscriptScoutattention: Efficient KV Cache Offloading via Layer-Ahead CPU Pre-Computation for LLM Inference4:18pm - 4:30pm PDT Tuesday, July 28 Mtg Room 101AAIAI2-II. AI/ML Algorithms and ModelsContributorsPeng Xu