All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
RULE: Reliable Multimodal RAG for Factuality in Medical Vision Language ModelsarXiv 2024Spatial Dual-Modality Graph Reasoning for Key Information ExtractionarXiv 2021MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language ModelsarXiv 2024Manual2Skill: Learning to Read Manuals and Acquire Robotic Skills for Furniture Assembly Using Vision-Language ModelsarXiv 2025Templates for 3D Object Pose Estimation Revisited: Generalization to New Objects and Robustness to OcclusionsCVPR 2022 1Five A$^{+}$ Network: You Only Need 9K Parameters for Underwater Image EnhancementarXiv 2023Real-time Holistic Robot Pose Estimation with Unknown StatesarXiv 2024SpaceR: Reinforcing MLLMs in Video Spatial ReasoningarXiv 2025FreeVC: Towards High-Quality Text-Free One-Shot Voice ConversionarXiv 2022Large Spatial Model: End-to-end Unposed Images to Semantic 3DarXiv 2024Diffusion Models for Adversarial PurificationarXiv 2022MuggleMath: Assessing the Impact of Query and Response Augmentation on Math ReasoningarXiv 2023Tackling the Generative Learning Trilemma with Denoising Diffusion GANstackling-the-generative-learning-trilemmaCOLMAP-Free 3D Gaussian SplattingCVPR 2024 1VoxFormer: Sparse Voxel Transformer for Camera-based 3D Semantic Scene CompletionCVPR 2023 1QUEEN: QUantized Efficient ENcoding of Dynamic Gaussians for Streaming Free-viewpoint VideosarXiv 2024Prismer: A Vision-Language Model with Multi-Task ExpertsarXiv 2023OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual ReasoningarXiv 2024Open-Vocabulary Panoptic Segmentation with Text-to-Image Diffusion ModelsCVPR 2023 1MaskLLM: Learnable Semi-Structured Sparsity for Large Language ModelsarXiv 2024SwiftEdit: Lightning Fast Text-Guided Image Editing via One-Step DiffusionCVPR 2025 1Guiding a Diffusion Model with a Bad Version of ItselfarXiv 2024DiffiT: Diffusion Vision Transformers for Image GenerationarXiv 2023Object Pose Estimation with Statistical Guarantees: Conformal Keypoint Detection and Geometric Uncertainty PropagationCVPR 2023 1Star Attention: Efficient LLM Inference over Long SequencesarXiv 2024Partial Convolution based PaddingarXiv 2018Flowtron: an Autoregressive Flow-based Generative Network for Text-to-Speech SynthesisICLR 2021 1Nemotron-4 340B Technical ReportarXiv 2024Dynamic Tuning Towards Parameter and Inference Efficiency for ViT AdaptationarXiv 2024Ablating Concepts in Text-to-Image Diffusion ModelsICCV 2023 1CiteTracker: Correlating Image and Text for Visual TrackingICCV 2023 1The Emotional Voices Database: Towards Controlling the Emotion Dimension in Voice Generation SystemsarXiv 2018Towards Reliable Evaluation and Fast Training of Robust Semantic Segmentation ModelsarXiv 2023SegNet4D: Efficient Instance-Aware 4D Semantic Segmentation for LiDAR Point CloudarXiv 2024Jasper and Stella: distillation of SOTA embedding modelsarXiv 2024Faith and Fate: Limits of Transformers on Compositionalityfaith-and-fate-limits-of-transformers-onMMAUD: A Comprehensive Multi-Modal Anti-UAV Dataset for Modern Miniature Drone ThreatsarXiv 2024PINN surrogate of Li-ion battery models for parameter inference. Part II: Regularization and application of the pseudo-2D modelarXiv 2023SlideVQA: A Dataset for Document Visual Question Answering on Multiple ImagesarXiv 2023Empirical Analysis of Training Strategies of Transformer-based Japanese Chit-chat SystemsarXiv 2021Clinical ModernBERT: An efficient and long context encoder for biomedical textarXiv 2025Evaluating LLM Reasoning in the Operations Research Domain with ORQAarXiv 2024NL4Opt Competition: Formulating Optimization Problems Based on Their Natural Language DescriptionsarXiv 2023First-shot anomaly sound detection for machine condition monitoring: A domain generalization baselinearXiv 2023Transforming Science with Large Language Models: A Survey on AI-assisted Scientific Discovery, Experimentation, Content Generation, and EvaluationarXiv 2025Worldwide AI Ethics: a review of 200 guidelines and recommendations for AI governancearXiv 2022A Prompt-Based Knowledge Graph Foundation Model for Universal In-Context ReasoningarXiv 2024Region-Aware Text-to-Image Generation via Hard Binding and Soft RefinementarXiv 2024A Wolf in Sheep's Clothing: Generalized Nested Jailbreak Prompts can Fool Large Language Models EasilyarXiv 2023TextCrafter: Accurately Rendering Multiple Texts in Complex Visual ScenesarXiv 2025R-PRM: Reasoning-Driven Process Reward ModelingarXiv 2025LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language ModelarXiv 2024Anchor-based Plain Net for Mobile Image Super-ResolutionarXiv 2021Large Language Models Are Zero-Shot Time Series Forecasterslarge-language-models-are-zero-shot-timeTemporal Difference Learning for Model Predictive ControlarXiv 2022Learning Instance-Specific Augmentations by Capturing Local InvariancesarXiv 2022TAT-QA: A Question Answering Benchmark on a Hybrid of Tabular and Textual Content in FinanceACL 2021 5NExT-GPT: Any-to-Any Multimodal LLMarXiv 2023ChAda-ViT : Channel Adaptive Attention for Joint Representation Learning of Heterogeneous Microscopy ImagesCVPR 2024 1HowToCaption: Prompting LLMs to Transform Video Annotations at ScalearXiv 2023Diffusion 3D Features (Diff3F): Decorating Untextured Shapes with Distilled Semantic FeaturesCVPR 2024 1Generating Code World Models with Large Language Models Guided by Monte Carlo Tree SearcharXiv 2024Discover-then-Name: Task-Agnostic Concept Bottlenecks via Automated Concept DiscoveryarXiv 2024Towards Cross-Tokenizer Distillation: the Universal Logit Distillation Loss for LLMsarXiv 2024SOAP: Improving and Stabilizing Shampoo using AdamarXiv 2024Paths-over-Graph: Knowledge Graph Empowered Large Language Model ReasoningarXiv 2024CSGO: Content-Style Composition in Text-to-Image GenerationarXiv 2024Neuro-Symbolic Language Modeling with Automaton-augmented RetrievalarXiv 2022BARTScore: Evaluating Generated Text as Text GenerationNeurIPS 2021 12Benchmarking Retrieval-Augmented Generation in Multi-Modal ContextsarXiv 2025What Do Self-Supervised Vision Transformers Learn?arXiv 2023DaWin: Training-free Dynamic Weight Interpolation for Robust AdaptationarXiv 2024Multi-HMR: Multi-Person Whole-Body Human Mesh Recovery in a Single ShotarXiv 2024Beyond Matryoshka: Revisiting Sparse Coding for Adaptive RepresentationarXiv 2025The KiTS19 Challenge Data: 300 Kidney Tumor Cases with Clinical Context, CT Semantic Segmentations, and Surgical OutcomesarXiv 2019Hourglass Tokenizer for Efficient Transformer-Based 3D Human Pose EstimationCVPR 2024 1Language-only Efficient Training of Zero-shot Composed Image RetrievalarXiv 2023MuTual: A Dataset for Multi-Turn Dialogue Reasoningmutual-a-dataset-for-multi-turn-dialogue-1Towards Machine Unlearning Benchmarks: Forgetting the Personal Identities in Facial Recognition SystemsarXiv 2023Prithvi WxC: Foundation Model for Weather and ClimatearXiv 2024Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech SeparationarXiv 2018Matching Patients to Clinical Trials with Large Language ModelsarXiv 2023Demystifying Large Language Models for Medicine: A PrimerarXiv 2024MedCPT: Contrastive Pre-trained Transformers with Large-scale PubMed Search Logs for Zero-shot Biomedical Information RetrievalarXiv 2023RbA: Segmenting Unknown Regions Rejected by AllICCV 2023 13DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video GenerationarXiv 2024MAP-Neo: Highly Capable and Transparent Bilingual Large Language Model SeriesarXiv 2024OmniBench: Towards The Future of Universal Omni-Language ModelsarXiv 2024Prototype-Sample Relation Distillation: Towards Replay-Free Continual LearningarXiv 2023CenterCLIP: Token Clustering for Efficient Text-Video RetrievalarXiv 2022AIM 2024 Challenge on Video Saliency Prediction: Methods and ResultsarXiv 2024FastDVDnet: Towards Real-Time Deep Video Denoising Without Flow Estimationfastdvdnet-towards-real-time-deep-videoVECTOR: Velocity-Enhanced GRU Neural Network for Real-Time 3D UAV Trajectory PredictionarXiv 2024JetMoE: Reaching Llama2 Performance with 0.1M DollarsarXiv 2024Simple Policy OptimizationarXiv 2024Analyzing Fine-tuning Representation Shift for Multimodal LLMs Steering alignmentICCV 2025Large Language Model Cascades with Mixture of Thoughts Representations for Cost-efficient ReasoningarXiv 2023MS-Diffusion: Multi-subject Zero-shot Image Personalization with Layout GuidancearXiv 2024Multi-Meta-RAG: Improving RAG for Multi-Hop Queries using Database Filtering with LLM-Extracted MetadataarXiv 2024Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formattingarXiv 2023NavRAG: Generating User Demand Instructions for Embodied Navigation through Retrieval-Augmented LLMarXiv 2025g3D-LF: Generalizable 3D-Language Feature Fields for Embodied TasksCVPR 2025 1xLSTMTime : Long-term Time Series Forecasting With xLSTMarXiv 2024Gluformer: Transformer-Based Personalized Glucose Forecasting with Uncertainty QuantificationarXiv 2022IMAGDressing-v1: Customizable Virtual DressingarXiv 2024Fine-tuned CLIP Models are Efficient Video LearnersCVPR 2023 1MaPLe: Multi-modal Prompt Learningmaple-multi-modal-prompt-learning-1Label-Free Liver Tumor SegmentationCVPR 2023 1A Hard-to-Beat Baseline for Training-free CLIP-based AdaptationarXiv 2024Towards Stable Test-Time Adaptation in Dynamic Wild WorldarXiv 2023LightM-UNet: Mamba Assists in Lightweight UNet for Medical Image SegmentationarXiv 2024Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QAarXiv 2024FishEye8K: A Benchmark and Dataset for Fisheye Camera Object DetectionarXiv 2023DecompX: Explaining Transformers Decisions by Propagating Token DecompositionarXiv 2023Neural Prototype Trees for Interpretable Fine-grained Image RecognitionCVPR 2021 1Are We on the Right Way for Evaluating Large Vision-Language Models?arXiv 2024Merging Models with Fisher-Weighted AveragingarXiv 2021MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGICVPR 2024 1CommonCanvas: An Open Diffusion Model Trained with Creative-Commons ImagesarXiv 2023ProAPO: Progressively Automatic Prompt Optimization for Visual ClassificationCVPR 2025 1EdgeNeXt: Efficiently Amalgamated CNN-Transformer Architecture for Mobile Vision ApplicationsarXiv 2022EfficientViM: Efficient Vision Mamba with Hidden State Mixer based State Space DualityCVPR 2025 1SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model InterpretabilityarXiv 2025Adaptive Rational Activations to Boost Deep Reinforcement LearningarXiv 2021Kimi k1.5: Scaling Reinforcement Learning with LLMsarXiv 2025Safe Latent Diffusion: Mitigating Inappropriate Degeneration in Diffusion ModelsCVPR 2023 1BUFFER-X: Towards Zero-Shot Point Cloud Registration in Diverse ScenesarXiv 2025Nyströmformer: A Nyström-Based Algorithm for Approximating Self-AttentionarXiv 2021Quest: Query-Aware Sparsity for Efficient Long-Context LLM InferencearXiv 2024Open-Vocabulary Universal Image Segmentation with MaskCLIParXiv 2022TokenCompose: Text-to-Image Diffusion with Token-level Supervisiontokencompose-text-to-image-diffusion-withLite Pose: Efficient Architecture Design for 2D Human Pose EstimationCVPR 2022 1FastComposer: Tuning-Free Multi-Subject Image Generation with Localized AttentionarXiv 2023PLM-ICD: Automatic ICD Coding with Pretrained Language Modelsplm-icd-automatic-icd-coding-with-pretrainedGraphLLM: Boosting Graph Reasoning Ability of Large Language ModelarXiv 2023Mist: Towards Improved Adversarial Examples for Diffusion ModelsarXiv 2023Effective and Efficient Masked Image Generation ModelsarXiv 2025Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean DataarXiv 2024Concat-ID: Towards Universal Identity-Preserving Video SynthesisarXiv 2025CTSpine1K: A Large-Scale Dataset for Spinal Vertebrae Segmentation in Computed TomographyarXiv 2021A Survey on Evaluation of Large Language ModelsarXiv 2023Editing Models with Task ArithmeticarXiv 2022OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language ModelsarXiv 2023The Platonic Representation HypothesisarXiv 2024A Benchmark for Chinese-English Scene Text Image Super-resolutionICCV 2023 1BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset, and Vision-Language Models Derived from Scientific LiteratureCVPR 2025 1Introducing v0.5 of the AI Safety Benchmark from MLCommonsarXiv 2024BGF-YOLO: Enhanced YOLOv8 with Multiscale Attentional Feature Fusion for Brain Tumor DetectionarXiv 2023Quantifying the Carbon Emissions of Machine LearningarXiv 2019Benchmarking Spatial Relationships in Text-to-Image GenerationarXiv 2022Enhanced Contrastive Learning with Multi-view Longitudinal Data for Chest X-ray Report GenerationCVPR 2025 1UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and GenerationarXiv 2020VidTwin: Video VAE with Decoupled Structure and DynamicsCVPR 2025 1Large Language Models Illuminate a Progressive Pathway to Artificial Healthcare Assistant: A ReviewarXiv 2023Deep High-Resolution Representation Learning for Human Pose Estimationdeep-high-resolution-representation-learning-1Score identity Distillation: Exponentially Fast Distillation of Pretrained Diffusion Models for One-Step GenerationarXiv 2024ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem SolvingarXiv 2023Large Language Models Are State-of-the-Art Evaluators of Translation QualityarXiv 2023Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-TuningarXiv 2025SwinBERT: End-to-End Transformers with Sparse Attention for Video CaptioningCVPR 2022 1Swin3D: A Pretrained Transformer Backbone for 3D Indoor Scene UnderstandingarXiv 2023(Perhaps) Beyond Human Translation: Harnessing Multi-Agent Collaboration for Translating Ultra-Long Literary TextsarXiv 2024When Shift Operation Meets Vision Transformer: An Extremely Simple Alternative to Attention MechanismarXiv 2022Instant3D: Instant Text-to-3D GenerationarXiv 2023SimMIM: A Simple Framework for Masked Image ModelingCVPR 2022 1Aligning Text-to-Image Diffusion Models with Reward BackpropagationarXiv 2023NU-Wave 2: A General Neural Audio Upsampling Model for Various Sampling RatesarXiv 2022SatCLIP: Global, General-Purpose Location Embeddings with Satellite ImageryarXiv 2023Improving Generalization of Adversarial Training via Robust Critical Fine-TuningICCV 2023 1Rho-1: Not All Tokens Are What You NeedarXiv 2024RegionCLIP: Region-based Language-Image PretrainingCVPR 2022 1RefactorBench: Evaluating Stateful Reasoning in Language Agents Through CodearXiv 2025Language Models Can Teach Themselves to Program BetterarXiv 2022Oscar: Object-Semantics Aligned Pre-training for Vision-Language TasksECCV 2020 8Flow Matching for Medical Image Synthesis: Bridging the Gap Between Speed and QualityarXiv 2025OCTDL: Optical Coherence Tomography Dataset for Image-Based Deep Learning MethodsarXiv 2023Compresso: Structured Pruning with Collaborative Prompting Learns Compact Large Language ModelsarXiv 2023Breaking Language Barriers in Multilingual Mathematical Reasoning: Insights and ObservationsarXiv 2023Deep Bidirectional Language-Knowledge Graph PretrainingarXiv 2022LayoutPrompter: Awaken the Design Ability of Large Language Modelslayoutprompter-awaken-the-design-ability-ofTemporal Event Stereo via Joint Learning with Stereoscopic FlowarXiv 2024AVeriTeC: A Dataset for Real-world Claim Verification with Evidence from the Webaveritec-a-dataset-for-real-world-claimCraftax: A Lightning-Fast Benchmark for Open-Ended Reinforcement LearningarXiv 2024Using Large Language Models for Hyperparameter OptimizationarXiv 2023An OpenMind for 3D medical vision self-supervised learningICCV 2025Generalized Kernel Thinninggeneralized-kernel-thinning-1nnInteractive: Redefining 3D Promptable SegmentationarXiv 2025GODEL: Large-Scale Pre-Training for Goal-Directed DialogarXiv 2022Focal Modulation NetworksarXiv 2022Explaining black box text modules in natural language with language modelsarXiv 2023BatteryML:An Open-source platform for Machine Learning on Battery DegradationarXiv 2023V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal ReasoningarXiv 2025BioGPT: Generative Pre-trained Transformer for Biomedical Text Generation and MiningarXiv 2022InteractVLM: 3D Interaction Reasoning from 2D Foundational ModelsCVPR 2025 1Love Me, Love Me, Say (and Write!) that You Love Me: Enriching the WASABI Song Corpus with Lyrics Annotationslove-me-love-me-say-and-write-that-you-love-1Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMsarXiv 2023Everything of Thoughts: Defying the Law of Penrose Triangle for Thought GenerationarXiv 2023ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase PartitionarXiv 2024Natural Language Supervision for General-Purpose Audio RepresentationsarXiv 2023Privacy-Preserving In-Context Learning with Differentially Private Few-Shot GenerationarXiv 2023