Research
I have a broad interest in training and inference optimization techniques, with a particular focus on applications in the vision and language domains. I am passionate about exploring advanced methods to improve model efficiency and performance in these cutting-edge fields.
📚 Publications
🗣️ Language
Unlocking the Edge Deployment and On-Device Acceleration of Multi-LoRA Enabled One-for-All Foundational LLM
Sravanth Kodavanti, Sowmya Vajrala, Srinivas Miriyala, Utsav Tiwari, Uttam Kumar, Utkarsh Kumar Mahawar, Achal Pratap Singh, Arya D, Narendra Mutyala, Vikram Nelvoy Rajendiran, Sharan Kumar Allur, Euntaik Lee, Dohyoung Kim, HyeonSu Lee, Gyusung Cho, JungBae Kim
ACL 2026 Findings
👁️ Vision
TOC-SR: Task-Optimal Compact diffusion for Image Super Resolution
Sowmya Vajrala, Akshay Bankar, Manjunath Arveti, Shreyas Pandith, Sravanth Kodavanti, Subhajit Sanyal, Amit Unde, Srinivas Miriyala
LoViF, ECCV 2026 (Oral)
EdgeDiT: Hardware-Aware Diffusion Transformers for Efficient On-Device Image Generation
Sravanth Kodavanti, Manjunath Arveti, Sowmya Vajrala, Srinivas Miriyala, Vikram N R
Mobile AI, CVPR 2026 (Oral)
Hardware-aware Low Light Image Enhancement on Edge
Sowmya Vajrala, Sravanth Kodavanti, Srinivas Miriyala
WiCV, CVPR 2026 (Spotlight)
Quantization with Unified Adaptive Distillation to enable multi-LoRA based one-for-all Generative Vision Models on edge
Sowmya Vajrala, Aakash Parmar, Prasanna R, Sravanth Kodavanti, Manjunath Arveti, Srinivas Soumitri Miriyala, Ashok Senapati
Mobile AI, CVPR 2026 (Oral)
Edge-Efficient Image Restoration: Transformer Distillation into State-Space Models
Sravanth Kodavanti, Srinivas Miriyala, Sowmya Vajrala, Vikram N R, Sharan Allur
Preprint
Towards Efficient Image Deblurring for Edge Deployment
Sowmya Vajrala, Srinivas Miriyala, Sravanth Kodavanti
Preprint
⚙️ Patents
Multi-objective Optimization for Balanced Inference-time Latency-efficient and Eviction-aware SWA (Mobile SWA)
Sravanth Kodavanti, Srinivas Miriyala, Sowmya Vajrala, Nikita Malik, Vikram N R
Provisional Specification Filed
Proposes a dynamic window for generic token eviction algorithms reducing KV Cache without significant drop in accuracy of LLMs.
System and Method for Accelerating On-Device Large Language Model Inference
Sravanth Kodavanti, Srinivas Miriyala, Sowmya Vajrala
Complete Specification Filed
Proposes a novel self-speculative decoding technique to significantly improve efficiency and reduce latency in LLM inference.