All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Towards Interpreting Visual Information Processing in Vision-Language ModelsarXiv 2024Perspective-taking and Pragmatics for Generating Empathetic Responses Focused on Emotion CausesEMNLP 2021 11GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual GroundingarXiv 2024MMVU: Measuring Expert-Level Multi-Discipline Video UnderstandingCVPR 2025 1CFGPT: Chinese Financial Assistant with Large Language ModelarXiv 2023Towards Unifying Medical Vision-and-Language Pre-training via Soft PromptsICCV 2023 1Performance-Efficiency Trade-offs in Unsupervised Pre-training for Speech RecognitionarXiv 2021Auto-scaling Vision Transformers without Trainingauto-scaling-vision-transformers-withoutDeep Learning for Case-Based Reasoning through Prototypes: A Neural Network that Explains Its PredictionsarXiv 2017TeleQnA: A Benchmark Dataset to Assess Large Language Models Telecommunications KnowledgearXiv 2023Video Motion Transfer with Diffusion TransformersCVPR 2025 1VideoAgent: Self-Improving Video GenerationarXiv 2024Evaluating Mathematical Reasoning Beyond AccuracyarXiv 2024UniFuse: Unidirectional Fusion for 360$^{\circ}$ Panorama Depth EstimationarXiv 2021MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence ModelsarXiv 2024Linear algebra with transformersarXiv 2021Linear algebra with transformersarXiv 2021BioBridge: Bridging Biomedical Foundation Models via Knowledge GraphsarXiv 2023DrM: Mastering Visual Reinforcement Learning through Dormant Ratio MinimizationarXiv 2023How to Reduce Change Detection to Semantic SegmentationarXiv 2022Pix2Video: Video Editing using Image DiffusionICCV 2023 1Animal Avatars: Reconstructing Animatable 3D Animals from Casual VideosarXiv 2024RAP: Retrieval-Augmented Personalization for Multimodal Large Language ModelsCVPR 2025 1PointDistiller: Structured Knowledge Distillation Towards Efficient and Compact 3D DetectionCVPR 2023 1Joint Visual Grounding and Tracking with Natural Language SpecificationCVPR 2023 1Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language ModelsarXiv 2022Toward Interpretable Sleep Stage Classification Using Cross-Modal TransformersarXiv 2022Towards Coherent Image Inpainting Using Denoising Diffusion Implicit ModelsarXiv 2023Batch Prompting: Efficient Inference with Large Language Model APIsarXiv 2023Configurable EBEN: Extreme Bandwidth Extension Network to enhance body-conducted speech capturearXiv 2023Tuning Large Multimodal Models for Videos using Reinforcement Learning from AI FeedbackarXiv 2024The Gutenberg Dialogue DatasetEACL 2021 2GenNBV: Generalizable Next-Best-View Policy for Active 3D ReconstructionCVPR 2024 1Fast Neural Scene FlowICCV 2023 1Full-Body Articulated Human-Object InteractionICCV 2023 1SemiReward: A General Reward Model for Semi-supervised LearningarXiv 2023Medical Hallucinations in Foundation Models and Their Impact on HealthcarearXiv 2025Revisiting Rainbow: Promoting more Insightful and Inclusive Deep Reinforcement Learning ResearcharXiv 2020MouSi: Poly-Visual-Expert Vision-Language ModelsarXiv 2024Zero-Shot Contrastive Loss for Text-Guided Diffusion Image Style TransferICCV 2023 1Mixout: Effective Regularization to Finetune Large-scale Pretrained Language ModelsICLR 2020 1Grammar Prompting for Domain-Specific Language Generation with Large Language Modelsgrammar-prompting-for-domain-specific-1MambaTalk: Efficient Holistic Gesture Synthesis with Selective State Space ModelsarXiv 2024QuEST: Stable Training of LLMs with 1-Bit Weights and ActivationsarXiv 2025Speech2Lip: High-fidelity Speech to Lip Generation by Learning from a Short VideoICCV 2023 1Adapting Pre-Trained Vision Models for Novel Instance Detection and
SegmentationarXiv 2024GeoMAE: Masked Geometric Target Prediction for Self-supervised Point
Cloud Pre-TrainingarXiv 2023A Dataset for Answering Time-Sensitive QuestionsarXiv 2021TeachMyAgent: a Benchmark for Automatic Curriculum Learning in Deep RLarXiv 2021Inorganic Materials Synthesis Planning with Literature-Trained Neural NetworksarXiv 2018Contrastive Pseudo Learning for Open-World DeepFake AttributionICCV 2023 1Recurrent Diffusion for Large-Scale Parameter GenerationarXiv 2025DeLLMa: Decision Making Under Uncertainty with Large Language ModelsarXiv 2024Towards Achieving Human Parity on End-to-end Simultaneous Speech Translation via LLM AgentarXiv 2024Quark: Controllable Text Generation with Reinforced UnlearningarXiv 2022ConZIC: Controllable Zero-shot Image Captioning by Sampling-Based PolishingCVPR 2023 1MixSup: Mixed-grained Supervision for Label-efficient LiDAR-based 3D Object DetectionarXiv 2024ZerO Initialization: Initializing Neural Networks with only Zeros and Oneszero-initialization-initializing-residualMEAformer: Multi-modal Entity Alignment Transformer for Meta Modality HybridarXiv 2022Sensitivity-Aware Visual Parameter-Efficient Fine-TuningICCV 2023 1"Principal Components" Enable A New Language of ImagesICCV 2025Bifurcated backbone strategy for RGB-D salient object detectionarXiv 2020CharacterChat: Learning towards Conversational AI with Personalized Social SupportarXiv 2023Generate Your Own Scotland: Satellite Image Generation Conditioned on MapsarXiv 2023ConceptExpress: Harnessing Diffusion Models for Single-image Unsupervised Concept ExtractionarXiv 2024PRIOR: Prototype Representation Joint Learning from Medical Images and ReportsICCV 2023 1Leveraging the Invariant Side of Generative Zero-Shot Learningleveraging-the-invariant-side-of-generative-1MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI UnderstandingarXiv 2024SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular ControlarXiv 2022MCUFormer: Deploying Vision Transformers on Microcontrollers with Limited Memorymcuformer-deploying-vision-tranformers-onComposable Sparse Fine-Tuning for Cross-Lingual TransferACL 2022 5Hibou: A Family of Foundational Vision Transformers for PathologyarXiv 2024Modeling Graph Structure in Transformer for Better AMR-to-Text Generationmodeling-graph-structure-in-transformer-for-1Towards Geospatial Foundation Models via Continual PretrainingICCV 2023 1Fine-grained Audible Video DescriptionCVPR 2023 1Dependency-Guided LSTM-CRF for Named Entity Recognitiondependency-guided-lstm-crf-for-named-entityDistill-VQ: Learning Retrieval Oriented Vector Quantization By Distilling Knowledge from Dense EmbeddingsarXiv 2022Representation Learning and Identity Adversarial Training for Facial Behavior UnderstandingarXiv 2024Optimized Minimal 3D Gaussian SplattingarXiv 2025ViD-GPT: Introducing GPT-style Autoregressive Generation in Video Diffusion ModelsarXiv 2024Probabilistic 3D Multi-Object Cooperative Tracking for Autonomous Driving via Differentiable Multi-Sensor Kalman FilterarXiv 2023What to Hide from Your Students: Attention-Guided Masked Image ModelingarXiv 2022Diverse Human Motion Prediction Guided by Multi-Level Spatial-Temporal AnchorsarXiv 2023Sitcom-Crafter: A Plot-Driven Human Motion Generation System in 3D ScenesarXiv 2024What Can Simple Arithmetic Operations Do for Temporal Modeling?ICCV 2023 1Monet: Mixture of Monosemantic Experts for TransformersarXiv 2024OPEN: Object-wise Position Embedding for Multi-view 3D Object DetectionarXiv 2024GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric EnhancersICCV 2025POCO: 3D Pose and Shape Estimation with ConfidencearXiv 2023Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty RegularizationarXiv 2022DreamCoder: Growing generalizable, interpretable knowledge with wake-sleep Bayesian program learningarXiv 2020EasyGen: Easing Multimodal Generation with BiDiffuser and LLMsarXiv 2023What Happened in LLMs Layers when Trained for Fast vs. Slow Thinking: A Gradient PerspectivearXiv 2024Eliminating Warping Shakes for Unsupervised Online Video StitchingarXiv 2024Examining User-Friendly and Open-Sourced Large GPT Models: A Survey on Language, Multimodal, and Scientific GPT ModelsarXiv 2023Visualizing Deep Similarity NetworksarXiv 2019Generation-Augmented Retrieval for Open-domain Question AnsweringACL 2021 5SimMMDG: A Simple and Effective Framework for Multi-modal Domain Generalizationsimmmdg-a-simple-and-effective-framework-forGiraffeDet: A Heavy-Neck Paradigm for Object Detectiongiraffedet-a-heavy-neck-paradigm-for-objectAn Open Dataset and Model for Language IdentificationarXiv 2023ColBERT: Using BERT Sentence Embedding in Parallel Neural Networks for Computational HumorarXiv 2020LightHuBERT: Lightweight and Configurable Speech Representation Learning with Once-for-All Hidden-Unit BERTarXiv 2022EcoFormer: Energy-Saving Attention with Linear ComplexityarXiv 2022Decoupled Iterative Refinement Framework for Interacting Hands Reconstruction from a Single RGB ImageICCV 2023 1Pre-training strategies and datasets for facial representation learningarXiv 2021D2A: A Dataset Built for AI-Based Vulnerability Detection Methods Using Differential AnalysisarXiv 2021Towards Evaluating and Building Versatile Large Language Models for MedicinearXiv 2024FEVEROUS: Fact Extraction and VERification Over Unstructured and Structured informationarXiv 2021Probabilistic Human Mesh Recovery in 3D Scenes from Egocentric ViewsICCV 2023 1Self-Supervised Scene Flow Estimation with 4-D Automotive RadararXiv 2022Aligning Language Models with Preferences through f-divergence MinimizationarXiv 2023Streaming Diffusion Policy: Fast Policy Synthesis with Variable Noise Diffusion ModelsarXiv 2024Point-Cloud Completion with Pretrained Text-to-image Diffusion ModelsarXiv 2023Neighborhood Contrastive Learning for Scientific Document Representations with Citation EmbeddingsarXiv 2022Stochastic Latent Residual Video PredictionICML 2020 1Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache SharingarXiv 2024OGNI-DC: Robust Depth Completion with Optimization-Guided Neural IterationsarXiv 2024Parameter-Efficient Transfer Learning with Diff Pruningparameter-efficient-transfer-learning-withVisual Explanation for Deep Metric LearningarXiv 2019Orthogonal Annotation Benefits Barely-supervised Medical Image SegmentationCVPR 2023 1EMOVA: Empowering Language Models to See, Hear and Speak with Vivid EmotionsCVPR 2025 1BLOOM+1: Adding Language Support to BLOOM for Zero-Shot PromptingarXiv 2022ViT5: Pretrained Text-to-Text Transformer for Vietnamese Language GenerationNAACL (ACL) 2022 7DASO: Distribution-Aware Semantics-Oriented Pseudo-label for Imbalanced Semi-Supervised LearningCVPR 2022 1FreestyleRet: Retrieving Images from Style-Diversified QueriesarXiv 2023Gloss-free Sign Language Translation: Improving from Visual-Language PretrainingICCV 2023 1Scaling Laws of RoPE-based ExtrapolationarXiv 2023InitNO: Boosting Text-to-Image Diffusion Models via Initial Noise OptimizationCVPR 2024 1Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal TrainingarXiv 2024HermesFlow: Seamlessly Closing the Gap in Multimodal Understanding and GenerationarXiv 2025LVD-2M: A Long-take Video Dataset with Temporally Dense CaptionsarXiv 2024E.T. the Exceptional Trajectories: Text-to-camera-trajectory generation with character awarenessarXiv 2024Get Your Vitamin C! Robust Fact Verification with Contrastive EvidenceNAACL 2021 4Large Language Models Can Self-Improve in Long-context ReasoningarXiv 2024Integrally Migrating Pre-trained Transformer Encoder-decoders for Visual Object DetectionICCV 2023 1From Similarity to Superiority: Channel Clustering for Time Series ForecastingarXiv 2024RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and StylearXiv 2024Diffusion Prior-Based Amortized Variational Inference for Noisy Inverse ProblemsarXiv 2024CodeUltraFeedback: An LLM-as-a-Judge Dataset for Aligning Large Language Models to Coding PreferencesarXiv 2024Towards Robust and Adaptive Motion Forecasting: A Causal Representation PerspectiveCVPR 2022 1Referring Image Segmentation Using Text SupervisionICCV 2023 1FedX: Unsupervised Federated Learning with Cross Knowledge DistillationarXiv 2022Uni-O4: Unifying Online and Offline Deep Reinforcement Learning with Multi-Step On-Policy OptimizationarXiv 2023One Model to Reconstruct Them All: A Novel Way to Use the Stochastic Noise in StyleGANarXiv 2020Open-Vocabulary Attention Maps with Token Optimization for Semantic Segmentation in Diffusion ModelsCVPR 2024 1Fair Attribute Classification through Latent Space De-biasingCVPR 2021 1Compact 3D Gaussian Splatting for Static and Dynamic Radiance FieldsarXiv 2024SPOT: Self-Training with Patch-Order Permutation for Object-Centric Learning with Autoregressive TransformersCVPR 2024 1Generalizable Data-free Objective for Crafting Universal Adversarial PerturbationsarXiv 2018Bongard-HOI: Benchmarking Few-Shot Visual Reasoning for Human-Object InteractionsCVPR 2022 1Large Language Models as Urban Residents: An LLM Agent Framework for Personal Mobility GenerationarXiv 2024InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and ReflectionarXiv 2025Goal-conditioned Imitation Learninggoal-conditioned-imitation-learning-1Mining Legal Arguments in Court DecisionsarXiv 2022MobileViG: Graph-Based Sparse Attention for Mobile Vision ApplicationsarXiv 2023MPO: Boosting LLM Agents with Meta Plan OptimizationarXiv 2025FedDisco: Federated Learning with Discrepancy-Aware CollaborationarXiv 2023Self-slimmed Vision TransformerarXiv 2021REFINER: Reasoning Feedback on Intermediate RepresentationsarXiv 2023Exposure Correction Model to Enhance Image QualityarXiv 2022Kuro Siwo: 33 billion $m^2$ under the water. A global multi-temporal satellite dataset for rapid flood mappingarXiv 2023Mask-Attention-Free Transformer for 3D Instance SegmentationICCV 2023 1AlignMixup: Improving Representations By Interpolating Aligned FeaturesCVPR 2022 1Demystify Transformers & Convolutions in Modern Image Deep NetworksarXiv 2022A Closer Look at Smoothness in Domain Adversarial Traininga-closer-look-at-smoothness-in-domainLLaMAX: Scaling Linguistic Horizons of LLM by Enhancing Translation Capabilities Beyond 100 LanguagesarXiv 2024Video-STaR: Self-Training Enables Video Instruction Tuning with Any SupervisionarXiv 2024ALYMPICS: LLM Agents Meet Game Theory -- Exploring Strategic Decision-Making with AI AgentsarXiv 2023NTIRE 2021 Challenge on Quality Enhancement of Compressed Video: Methods and ResultsarXiv 2021Zero-shot Visual Question Answering using Knowledge GrapharXiv 2021GroundVLP: Harnessing Zero-shot Visual Grounding from Vision-Language Pre-training and Open-Vocabulary Object DetectionarXiv 2023EDGE-LLM: Enabling Efficient Large Language Model Adaptation on Edge Devices via Layerwise Unified Compression and Adaptive Layer Tuning and VotingarXiv 2024Model Evaluation, Model Selection, and Algorithm Selection in Machine LearningarXiv 2018DCTdiff: Intriguing Properties of Image Generative Modeling in the DCT SpacearXiv 2024Disentangle then Parse:Night-time Semantic Segmentation with Illumination DisentanglementarXiv 2023Zoom Out and Observe: News Environment Perception for Fake News DetectionACL 2022 5TSDAE: Using Transformer-based Sequential Denoising Auto-Encoder for Unsupervised Sentence Embedding LearningarXiv 2021Graph Transformer for RecommendationarXiv 2023TTSDS -- Text-to-Speech Distribution ScorearXiv 2024Hierarchical Supervision and Shuffle Data Augmentation for 3D Semi-Supervised Object DetectionCVPR 2023 1TFG: Unified Training-Free Guidance for Diffusion ModelsarXiv 2024TIMEDIAL: Temporal Commonsense Reasoning in DialogACL 2021 5LEGION: Learning to Ground and Explain for Synthetic Image DetectionICCV 2025Training Language Models to Reason EfficientlyarXiv 2025Universal Image Restoration Pre-training via Degradation ClassificationarXiv 2025Randomized Quantization: A Generic Augmentation for Data Agnostic Self-supervised LearningICCV 2023 1AutoTAMP: Autoregressive Task and Motion Planning with LLMs as Translators and CheckersarXiv 2023End-to-End Diffusion Latent Optimization Improves Classifier GuidanceICCV 2023 1Learning Perturbations to Explain Time Series PredictionsarXiv 2023Mukayese: Turkish NLP Strikes BackFindings (ACL) 2022 53DPPE: 3D Point Positional Encoding for Multi-Camera 3D Object Detection TransformersarXiv 2022M-VAR: Decoupled Scale-wise Autoregressive Modeling for High-Quality Image GenerationarXiv 2024MutexMatch: Semi-Supervised Learning with Mutex-Based Consistency Regularizationmutexmatch-semi-supervised-learning-withAnyAttack: Towards Large-scale Self-supervised Adversarial Attacks on Vision-language ModelsCVPR 2025 1Holistic Interaction Transformer Network for Action DetectionarXiv 2022SwiftBrush: One-Step Text-to-Image Diffusion Model with Variational Score DistillationCVPR 2024 1Online Neural Networks for Change-Point DetectionarXiv 2020OMNI-EPIC: Open-endedness via Models of human Notions of Interestingness with Environments Programmed in CodearXiv 2024Neural Semantic Role Labeling with Dependency Path Embeddingsneural-semantic-role-labeling-with-dependency-1Cross-Modal Collaborative Representation Learning and a Large-Scale RGBT Benchmark for Crowd CountingCVPR 2021 1