LatVision: Attention-Driven Dual-Layer Prediction Model for Persisting Tail Latency in SSDs and HDDs
Linxiao Bai, Zhijie Jiang, Yuanliang Zhang, Haoran Liu, Xiangbing Huang, Wang Li, Bin Lin · ACM Transactions on Design Automation of Electronic Systems · 2026
Persisting tail latency in storage systems poses critical challenges to cloud computing and real-time applications. While existing software solutions predominantly target transient latency spikes through single-operation prediction, their effectiveness diminishes significantly when confronting persisting performance degradation in modern SSDs. We present LatVision , an operating system (OS) kernel-level monitoring framework that integrates dual-layer prediction and attention mechanisms for cross-storage latency analysis. Leveraging eBPF to capture I/O performance metrics at the OS kernel level, LatVision implements a dual-layer detection pipeline: a lightweight classifier initially filters normal operations, while suspicious data failing the Layer-1 screening are routed to Layer-2 prediction model for double check. This hierarchical architecture reduces average computational overhead by 75.3% compared with monolithic prediction models. An attention-enhanced neural network further improves persisting tail latency prediction precision by prioritizing critical temporal patterns. Experimental evaluations across six SSD and HDD configurations demonstrate LatVision’s generalization capability, achieving prediction accuracy exceeding 90% across all test cases. Heuristic algorithm integration with the prediction results enhances operational stability under diverse workload conditions. The framework achieves real-time, lightweight, and high-precision persisting tail latency prediction for low-latency SSDs while maintaining minor latency overhead.