Publications
My research focuses on Video-Language Models, with three main directions:
- Robust Temporal Reasoning: Learning temporal dynamics from video beyond static visual cues and language priors.
- Efficient Long-Context Modeling: Adapting image-language models to video and retaining long-term visual context under limited memory and computation.
- Mechanistic Interpretability: Understanding how video-language models process and use visual information, and using these insights to improve model behavior.
You can also find my papers on my Google Scholar profile.
Selected Publications
Map the Flow: Revealing Hidden Pathways of Information in VideoLLMs
Minji Kim*, Taekyung Kim*, Bohyung Han (*Equal Contribution)
ICLR 2026

Leveraging Temporal Contextualization for Video Action Recognition
Minji Kim, Dongyoon Han, Taekyung Kim*, Bohyung Han* (*Corresponding Authors)
ECCV 2024

Towards Sequence-Level Training for Visual Tracking
Minji Kim*, Seungkwan Lee*, Jungseul Ok, Bohyung Han, Minsu Cho (*Equal Contribution)
ECCV 2022

Online Hybrid Lightweight Representations Learning: Its Application to Visual Tracking
Ilchae Jung, Minji Kim, Eunhyeok Park, Bohyung Han
IJCAI 2022
![]()
Other Projects
Learning Gaussian Models for Orientation-Aware Visual Tracking
Minji Kim, Bohyung Han
U.S. Patent Application 18/370,531 — Allowed

Spatio-Temporal Modeling via Adaptive Frequency Filtering for Video Action Recognition
Minji Kim, Taehoon Kim, Jonghyeon Seon, Bohyung Han
Journal of Korean Institute of Information Scientists and Engineers (KIISE), 2024
Ensemble Modeling with Convolutional Neural Networks for Application in Visual Object Tracking
Minji Kim, Ilchae Jung, Bohyung Han
Journal of Korean Institute of Information Scientists and Engineers (KIISE), 2021
Top-down Thermal Tracking Based on Rotatable Elliptical Motion Model for Intelligent Livestock Breeding
Minji Kim, Wonjun Kim
Multimedia Systems, Springer, 2020
