Search UW

Publications

Representative contributions in world models, visual perception, multimodal reasoning, and efficient learning.

World models & visual navigation

From human-aware navigation benchmarks to memory, prediction, and language-conditioned planning.

Language-conditioned world modeling for visual navigation overview

NeurIPS 2026 OralCorresponding author

Language-Conditioned World Modeling for Visual Navigation

Connects language instructions, imagined future observations, and action selection in a world model for visual navigation.

Yifei Dong, Fengyi Wu, Yilong Dai, Lingdong Kong, Guangyu Chen, Xu Zhu, Qiyu Hu, Tianyu Wang, Johnalbert Garnica, Feng Liu, Siyu Huang, Qi Dai, Zhi-Qi Cheng

Human-aware vision-and-language navigation

NeurIPS 2024 · Datasets and Benchmarks Spotlight Co-first authorCorresponding author

Human-Aware Vision-and-Language Navigation

Introduces human-aware vision-and-language navigation, bringing moving people into embodied navigation tasks.

Heng Li, Minghan Li, Zhi-Qi Cheng, Yifei Dong, Yuxuan Zhou, Jun-Yan He, Qi Dai, Teruko Mitamura, Alexander Hauptmann

Visual perception & retrieval

Contributions to crowd counting, human action and pose understanding, streaming perception, and cross-domain visual retrieval.

Learning Spatial Awareness to Improve Crowd Counting overview

ICCV 2019 OralCo-first author

Learning Spatial Awareness to Improve Crowd Counting

Introduces spatially aware density estimation and a pixel-level discrepancy loss to improve crowd counting in dense, noisy scenes.

Zhi-Qi Cheng, Jun-Xiu Li, Qi Dai, Xiao Wu, Alexander G. Hauptmann

Video eCommerce: Towards Online Video Advertising overview

ACM Multimedia 2016 ACM SCF Best Student Paper AwardFirst author

Video eCommerce: Towards Online Video Advertising

Connects video semantics, shopping preferences, and viewing behavior to recommend products at relevant moments in a video.

Zhi-Qi Cheng, Yang Liu, Xiao Wu, Xian-Sheng Hua

Multimodal reasoning & generation

Models and datasets for understanding charts, situations, emotions, and events, and for generating images and human motion.

Efficient & robust learning

Faster inference, stronger representations, and reliable adaptation of foundation models.