About Me

Jialong Xue

I am a first-year master's student at Shanghai Jiao Tong University, advised by Prof. Guo Lu. I received my bachelor's degree in Information Engineering from the same university.

My research focuses on omni-modal models, with an emphasis on integrating vision, audio, and language for natural, real-time interaction. I am particularly interested in how these models can perceive, reason, and act throughout an ongoing conversation. My previous work explored efficient video understanding through spatiotemporal token compression.

I am also a research intern at StepFun, working on audio-language model post-training. I contributed to StepAudio 3 Realtime, primarily in full-duplex dialogue and voice agent capabilities. This work aligns with my broader interest in building multimodal assistants that interact naturally and carry out tasks through conversation.

News
2026
StepAudio 3 Realtime is released! I contributed primarily to its full-duplex interaction and Voice Agent capabilities. Check out our technical report and try it on the StepFun Open Platform.
Sep 15
I started a research internship at StepFun, working on Audio-LMM post-training.
Jun 01
Our paper Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention was accepted to CVPR 2026. Read more
Mar 23
Selected Publications (view all )
StepAudio 3 Realtime Technical Report
StepAudio 3 Realtime Technical Report

Bin Lin, Bo Zhao, Boyang Zhang, …, Jialong Xue,

arXiv preprint arXiv:2609.14005 2026

StepAudio 3 Realtime integrates audio understanding, full-duplex conversation, parallel reasoning and speech generation, and voice-based task execution. It supports natural turn-taking and interruptions, with asynchronous tool use that keeps conversations flowing. My contributions: primarily full-duplex interaction and Voice Agent capabilities.

StepAudio 3 Realtime Technical Report

Bin Lin, Bo Zhao, Boyang Zhang, …, Jialong Xue,

arXiv preprint arXiv:2609.14005 2026

StepAudio 3 Realtime integrates audio understanding, full-duplex conversation, parallel reasoning and speech generation, and voice-based task execution. It supports natural turn-taking and interruptions, with asynchronous tool use that keeps conversations flowing. My contributions: primarily full-duplex interaction and Voice Agent capabilities.

Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention
Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention

Junhao Du*, Jialong Xue*, Anqi Li, Jincheng Dai, Guo Lu

IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

We formulate token compression for Video-LLMs as a unified spatiotemporal allocation problem under a global retention budget. The method preserves strong video understanding performance at ultra-low token retention without retraining.

Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention

Junhao Du*, Jialong Xue*, Anqi Li, Jincheng Dai, Guo Lu

IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

We formulate token compression for Video-LLMs as a unified spatiotemporal allocation problem under a global retention budget. The method preserves strong video understanding performance at ultra-low token retention without retraining.

All publications
Education
Shanghai Jiao Tong University
Master's Student
2026 - Present
Shanghai Jiao Tong University
B.Eng. in Information Engineering
2022 - 2026
Experience
StepFun
Research Intern, Audio-LMM Post-training
Jun. 1, 2026 - Present
NUS Summer SOC Program
Robotics and Deep Learning Project
Jul. 2024 - Aug. 2024