All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
CTVIS: Consistent Training for Online Video Instance SegmentationICCV 2023 1Emotional Speech-driven 3D Body Animation via Disentangled Latent DiffusionCVPR 2024 1Exploring Lightweight Hierarchical Vision Transformers for Efficient Visual TrackingICCV 2023 1Identity Mappings in Deep Residual NetworksarXiv 2016Real-Time User-Guided Image Colorization with Learned Deep PriorsarXiv 2017Metasql: A Generate-then-Rank Framework for Natural Language to SQL TranslationarXiv 2024Language Models are Realistic Tabular Data GeneratorsarXiv 2022A Foundation Language-Image Model of the Retina (FLAIR): Encoding Expert Knowledge in Text SupervisionarXiv 2023Unsupervised Foundation Model-Agnostic Slide-Level Representation LearningCVPR 2025 1HAP: Structure-Aware Masked Image Modeling for Human-Centric Perceptionhap-structure-aware-masked-image-modeling-forLearning Imbalanced Datasets with Label-Distribution-Aware Margin Losslearning-imbalanced-datasets-with-label-1SkillWeaver: Web Agents can Self-Improve by Discovering and Honing SkillsarXiv 2025Hidden in the Noise: Two-Stage Robust Watermarking for ImagesarXiv 2024NeRF++: Analyzing and Improving Neural Radiance FieldsarXiv 2020Adjoint Sampling: Highly Scalable Diffusion Samplers via Adjoint MatchingarXiv 2025A Generalized Bandsplit Neural Network for Cinematic Audio Source SeparationarXiv 2023A Light Weight Model for Active Speaker DetectionCVPR 2023 1Libriheavy: a 50,000 hours ASR corpus with punctuation casing and contextarXiv 2023Active Retrieval Augmented GenerationarXiv 2023KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV CachearXiv 2024Moving Object Segmentation: All You Need Is SAM (and Flow)arXiv 2024Towards Universal Soccer Video UnderstandingCVPR 2025 1What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of GrapharXiv 2025MoonCast: High-Quality Zero-Shot Podcast GenerationarXiv 2025MultiBLiMP 1.0: A Massively Multilingual Benchmark of Linguistic Minimal PairsarXiv 2025Do Multilingual Language Models Think Better in English?arXiv 2023Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual TokenizationarXiv 2023DreamCube: 3D Panorama Generation via Multi-plane SynchronizationarXiv 2025MOSAIC: Modeling Social AI for Content Dissemination and Regulation in Multi-Agent SimulationsarXiv 2025GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote SensingarXiv 2025Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language ModelsarXiv 2024Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMsarXiv 2024Learning by Planning: Language-Guided Global Image EditingCVPR 2021 1Pure Transformers are Powerful Graph LearnersarXiv 2022Graph-based Neural Weather Prediction for Limited Area ModelingarXiv 2023LoRI: Reducing Cross-Task Interference in Multi-Task Low-Rank AdaptationarXiv 2025YaRN: Efficient Context Window Extension of Large Language ModelsarXiv 2023Personalized Soups: Personalized Large Language Model Alignment via Post-hoc Parameter MergingarXiv 2023Video-Text as Game Players: Hierarchical Banzhaf Interaction for Cross-Modal Representation LearningCVPR 2023 1DiffusionRet: Generative Text-Video Retrieval with Diffusion ModelICCV 2023 1LumberChunker: Long-Form Narrative Document SegmentationarXiv 2024Spam-T5: Benchmarking Large Language Models for Few-Shot Email Spam DetectionarXiv 2023FigGen: Text to Scientific Figure GenerationarXiv 2023Neuro-3D: Towards 3D Visual Decoding from EEG SignalsCVPR 2025 1Cramming: Training a Language Model on a Single GPU in One DayarXiv 2022LATR: 3D Lane Detection from Monocular Images with TransformerICCV 2023 1Bongard-OpenWorld: Few-Shot Reasoning for Free-form Visual Concepts in the Real WorldarXiv 2023CLIPScore: A Reference-free Evaluation Metric for Image CaptioningEMNLP 2021 11MicroVQA: A Multimodal Reasoning Benchmark for Microscopy-Based Scientific ResearchCVPR 2025 1Approximate Nearest Neighbor Search with Window FiltersarXiv 2024PixIT: Joint Training of Speaker Diarization and Speech Separation from Real-world Multi-speaker RecordingsarXiv 2024SAM-Body4D: Training-Free 4D Human Body Mesh Recovery from VideosarXiv 2025Are Large Language Models Consistent over Value-laden Questions?arXiv 2024OSDFace: One-Step Diffusion Model for Face RestorationCVPR 2025 1What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical ExamsarXiv 2020Too Many Frames, Not All Useful: Efficient Strategies for Long-Form Video QAarXiv 2024Late Chunking: Contextual Chunk Embeddings Using Long-Context Embedding ModelsarXiv 2024Improving Text-to-SQL Evaluation Methodologyimproving-text-to-sql-evaluation-methodology-1DiffIR2VR-Zero: Zero-Shot Video Restoration with Diffusion-based Image Restoration ModelsarXiv 2024One-shot Voice Conversion by Separating Speaker and Content Representations with Instance NormalizationarXiv 2019UniverSeg: Universal Medical Image SegmentationICCV 2023 1Style Injection in Diffusion: A Training-free Approach for Adapting Large-scale Diffusion Models for Style TransferCVPR 2024 1TALL: Temporal Activity Localization via Language Querytall-temporal-activity-localization-via-1Momentum-GS: Momentum Gaussian Self-Distillation for High-Quality Large Scene ReconstructionarXiv 2024SLEB: Streamlining LLMs through Redundancy Verification and Elimination of Transformer BlocksarXiv 2024Optimus-1: Hybrid Multimodal Memory Empowered Agents Excel in Long-Horizon TasksarXiv 2024KTPFormer: Kinematics and Trajectory Prior Knowledge-Enhanced Transformer for 3D Human Pose EstimationCVPR 2024 1WavChat: A Survey of Spoken Dialogue ModelsarXiv 2024PhD: A ChatGPT-Prompted Visual hallucination Evaluation DatasetCVPR 2025 1ConsistNet: Enforcing 3D Consistency for Multi-view Images DiffusionCVPR 2024 1Temporal Modeling Matters: A Novel Temporal Emotional Modeling Approach for Speech Emotion RecognitionarXiv 2022PeFoMed: Parameter Efficient Fine-tuning of Multimodal Large Language Models for Medical ImagingarXiv 2024Surgical SAM 2: Real-time Segment Anything in Surgical Video by Efficient Frame PruningarXiv 2024MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic WorkflowarXiv 2025Densely Connected Parameter-Efficient Tuning for Referring Image SegmentationarXiv 2025Particle Transformer for Jet TaggingarXiv 2022Crystal Structure Prediction by Joint Equivariant Diffusioncrystal-structure-prediction-by-jointShifting Attention to Relevance: Towards the Predictive Uncertainty Quantification of Free-Form Large Language ModelsarXiv 2023An Engorgio Prompt Makes Large Language Model Babble onarXiv 2024MASTER: Multi-Aspect Non-local Network for Scene Text RecognitionarXiv 2019FeatureNeRF: Learning Generalizable NeRFs by Distilling Foundation ModelsICCV 2023 1Parameter-Efficient Fine-Tuning in Spectral Domain for Point Cloud LearningarXiv 2024LogicPro: Improving Complex Logical Reasoning via Program-Guided LearningarXiv 2024Robust Outlier Rejection for 3D Registration with Variational BayesCVPR 2023 1Cultural evolution in populations of Large Language ModelsarXiv 2024GREAD: Graph Neural Reaction-Diffusion NetworksarXiv 2022PromptMRG: Diagnosis-Driven Prompts for Medical Report GenerationarXiv 2023MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokensmms-llama-efficient-llm-based-audio-visualMoSca: Dynamic Gaussian Fusion from Casual Videos via 4D Motion ScaffoldsCVPR 2025 1Improving Chinese Spelling Check by Character Pronunciation Prediction: The Effects of Adaptivity and GranularityarXiv 2022Masked Frequency Modeling for Self-Supervised Visual Pre-TrainingarXiv 2022People who frequently use ChatGPT for writing tasks are accurate and robust detectors of AI-generated textarXiv 2025APOLLO: Automated LLM and Lean Collaboration for Advanced Formal ReasoningarXiv 2025Disentangled Motion Modeling for Video Frame InterpolationarXiv 2024Looking Backward: Streaming Video-to-Video Translation with Feature BanksarXiv 2024DiffusionPDE: Generative PDE-Solving Under Partial ObservationarXiv 2024Forecast-MAE: Self-supervised Pre-training for Motion Forecasting with Masked AutoencodersICCV 2023 1Glow-TTS: A Generative Flow for Text-to-Speech via Monotonic Alignment Searchglow-tts-a-generative-flow-for-text-to-speech-1QVHighlights: Detecting Moments and Highlights in Videos via Natural Language QueriesarXiv 2021AnyCalib: On-Manifold Learning for Model-Agnostic Single-View Camera CalibrationICCV 2025PassGPT: Password Modeling and (Guided) Generation with Large Language ModelsarXiv 2023Learning to Compress Prompts with Gist TokensNeurIPS 2023 11EDA: Easy Data Augmentation Techniques for Boosting Performance on Text Classification Taskseda-easy-data-augmentation-techniques-for-1Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean SpeecharXiv 2024X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-AgentsarXiv 2025Scaling Down to Scale Up: A Cost-Benefit Analysis of Replacing OpenAI's LLM with Open Source SLMs in ProductionarXiv 2023CCPL: Contrastive Coherence Preserving Loss for Versatile Style TransferarXiv 2022Transcoders Find Interpretable LLM Feature CircuitsarXiv 2024Offline Reinforcement Learning as One Big Sequence Modeling ProblemNeurIPS 2021 12Prototypical Networks for Few-shot Learningprototypical-networks-for-few-shot-learning-1Group Preference Optimization: Few-Shot Alignment of Large Language ModelsarXiv 2023OmniFlow: Any-to-Any Generation with Multi-Modal Rectified FlowsCVPR 2025 1Aligning Diffusion Models by Optimizing Human UtilityarXiv 2024Multilinear Mixture of Experts: Scalable Expert Specialization through FactorizationarXiv 2024GLiREL -- Generalist Model for Zero-Shot Relation ExtractionarXiv 2025RankCLIP: Ranking-Consistent Language-Image PretrainingICCV 2025Controlling Rate, Distortion, and Realism: Towards a Single Comprehensive Neural Image Compression ModelarXiv 2024TULIP: Token-length Upgraded CLIParXiv 2024SAR3D: Autoregressive 3D Object Generation and Understanding via Multi-scale 3D VQVAECVPR 2025 1Magicoder: Empowering Code Generation with OSS-InstructarXiv 2023A Change Detection Reality CheckarXiv 2024Distributed Deep Joint Source-Channel Coding with Decoder-Only Side InformationarXiv 2023Distributed Deep Joint Source-Channel Coding over a Multiple Access ChannelarXiv 2022S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language ModelsarXiv 2024Any2AnyTryon: Leveraging Adaptive Position Embeddings for Versatile Virtual Clothing TasksICCV 2025LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMsICCV 2025SWE-Fixer: Training Open-Source LLMs for Effective and Efficient GitHub Issue ResolutionarXiv 2025OctGPT: Octree-based Multiscale Autoregressive Models for 3D Shape GenerationarXiv 2025Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language NavigationarXiv 2025WARP: An Efficient Engine for Multi-Vector RetrievalarXiv 2025Marconi: Prefix Caching for the Era of Hybrid LLMsarXiv 2024Griffin: Towards a Graph-Centric Relational Database Foundation ModelarXiv 2025Breaking the Batch Barrier (B3) of Contrastive Learning via Smart Batch MiningarXiv 2025Training-free Regional Prompting for Diffusion TransformersarXiv 2024InstantStyle-Plus: Style Transfer with Content-Preserving in Text-to-Image GenerationarXiv 2024Combinatorial Optimization with Policy Adaptation using Latent Space Searchcombinatorial-optimization-with-policyMultimodal Optimal Transport-based Co-Attention Transformer with Global Structure Consistency for Survival PredictionICCV 2023 1Improving 2D Feature Representations by 3D-Aware Fine-TuningarXiv 2024Can Language Beat Numerical Regression? Language-Based Multimodal Trajectory PredictionCVPR 2024 1Deformable 3D Gaussians for High-Fidelity Monocular Dynamic Scene ReconstructionCVPR 2024 1InfMLLM: A Unified Framework for Visual-Language TasksarXiv 2023LV-Eval: A Balanced Long-Context Benchmark with 5 Length Levels Up to 256KarXiv 2024TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative DecodingarXiv 2024MagicPIG: LSH Sampling for Efficient LLM GenerationarXiv 2024InfiAgent-DABench: Evaluating Agents on Data Analysis TasksarXiv 2024An Edit Friendly DDPM Noise Space: Inversion and ManipulationsCVPR 2024 1Selective Kernel Networksselective-kernel-networks-1Android in the Zoo: Chain-of-Action-Thought for GUI AgentsarXiv 2024Efficient Online Reinforcement Learning with Offline DataarXiv 2023Highly Compressed Tokenizer Can Generate Without TrainingarXiv 2025MultiCorrupt: A Multi-Modal Robustness Dataset and Benchmark of LiDAR-Camera Fusion for 3D Object DetectionarXiv 2024A Survey on Efficient Vision-Language ModelsarXiv 2025MANIQA: Multi-dimension Attention Network for No-Reference Image Quality AssessmentarXiv 2022Likelihood-Based Diffusion Language Modelslikelihood-based-diffusion-language-modelsFRACTAL: An Ultra-Large-Scale Aerial Lidar Dataset for 3D Semantic Segmentation of Diverse LandscapesarXiv 2024FLAIR: a Country-Scale Land Cover Semantic Segmentation Dataset From Multi-Source Optical ImageryarXiv 2023Equivariant 3D-Conditional Diffusion Models for Molecular Linker DesignarXiv 2022Roll the dice & look before you leap: Going beyond the creative limits of next-token predictionarXiv 2025Large Language Models are not Fair EvaluatorsarXiv 2023LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM AgentsICCV 2025Image Content Generation with Causal ReasoningarXiv 2023ATCO2 corpus: A Large-Scale Dataset for Research on Automatic Speech Recognition and Natural Language Understanding of Air Traffic Control CommunicationsarXiv 2022X-Pose: Detecting Any KeypointsarXiv 2023MotionLLM: Understanding Human Behaviors from Human Motions and VideosarXiv 2024Detection Transformer with Stable MatchingICCV 2023 1Combating Online Misinformation Videos: Characterization, Detection, and Future DirectionsarXiv 2023ReasonIR: Training Retrievers for Reasoning TasksarXiv 2025LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision TokenarXiv 2025A Simple Framework for Open-Vocabulary Segmentation and DetectionICCV 2023 1HunyuanCustom: A Multimodal-Driven Architecture for Customized Video GenerationarXiv 2025Diffusion-Based Hierarchical Multi-Label Object Detection to Analyze Panoramic Dental X-raysarXiv 2023GenerateCT: Text-Conditional Generation of 3D Chest CT VolumesarXiv 2023Blended RAG: Improving RAG (Retriever-Augmented Generation) Accuracy with Semantic Search and Hybrid Query-Based RetrieversarXiv 2024Federated Learning with Matched AveragingICLR 2020 1Zshot: An Open-source Framework for Zero-Shot Named Entity Recognition and Relation ExtractionarXiv 2023Detection Recovery in Online Multi-Object Tracking with Sparse Graph TrackerarXiv 2022Efficient Episodic Memory Utilization of Cooperative Multi-Agent Reinforcement LearningarXiv 2024Adversarial Prompt Evaluation: Systematic Benchmarking of Guardrails Against Prompt Input Attacks on LLMsarXiv 2025OpenSDI: Spotting Diffusion-Generated Images in the Open WorldCVPR 2025 1itKD: Interchange Transfer-based Knowledge Distillation for 3D Object DetectionCVPR 2023 1DiLightNet: Fine-grained Lighting Control for Diffusion-based Image GenerationarXiv 2024Do Membership Inference Attacks Work on Large Language Models?arXiv 2024Controllable Text Generation for Large Language Models: A SurveyarXiv 2024Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient InferencearXiv 2024EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything ModelarXiv 2024SparseTrack: Multi-Object Tracking by Performing Scene Decomposition based on Pseudo-DeptharXiv 2023You Only Look at One Sequence: Rethinking Transformer in Vision through Object DetectionNeurIPS 2021 12AdaFlow: Imitation Learning with Variance-Adaptive Flow-Based PoliciesarXiv 2024Cuttlefish: Low-Rank Model Training without All the TuningarXiv 2023ControlAR: Controllable Image Generation with Autoregressive ModelsarXiv 2024GaussianDreamer: Fast Generation from Text to 3D Gaussians by Bridging 2D and 3D Diffusion ModelsCVPR 2024 1Embedding-Free Transformer with Inference Spatial Reduction for Efficient Semantic SegmentationarXiv 2024LocalMamba: Visual State Space Model with Windowed Selective ScanarXiv 2024Generalizable Human Gaussians for Sparse View SynthesisarXiv 2024VampNet: Music Generation via Masked Acoustic Token ModelingarXiv 2023A Survey on Deep Neural Network Pruning-Taxonomy, Comparison, Analysis, and RecommendationsarXiv 2023PatchDPO: Patch-level DPO for Finetuning-free Personalized Image GenerationCVPR 2025 1HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answeringhotpotqa-a-dataset-for-diverse-explainable-1LLM-Powered Hierarchical Language Agent for Real-time Human-AI CoordinationarXiv 2023Leveraging ParsBERT and Pretrained mT5 for Persian Abstractive Text SummarizationarXiv 2020