All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
HEMM: Holistic Evaluation of Multimodal Foundation ModelsarXiv 2024Masked Autoencoding for Scalable and Generalizable Decision MakingarXiv 2022Cognitive Mirage: A Review of Hallucinations in Large Language ModelsarXiv 2023Salmon: A Suite for Acoustic Language Model EvaluationarXiv 2024A Survey on Data Selection for LLM Instruction TuningarXiv 2024Coreference Resolution without Span RepresentationsACL 2021 5Where Does the Performance Improvement Come From? -- A Reproducibility Concern about Image-Text RetrievalarXiv 2022Fair Diffusion: Instructing Text-to-Image Generation Models on FairnessarXiv 2023Instructional Fingerprinting of Large Language ModelsarXiv 2024SemAffiNet: Semantic-Affine Transformation for Point Cloud SegmentationCVPR 2022 1AIGCBench: Comprehensive Evaluation of Image-to-Video Content Generated by AIarXiv 2024Learning Opinion Summarizers by Selecting Informative ReviewsEMNLP 2021 11CLIcK: A Benchmark Dataset of Cultural and Linguistic Intelligence in KoreanarXiv 2024Beyond Size: How Gradients Shape Pruning Decisions in Large Language ModelsarXiv 2023Accident Risk Prediction based on Heterogeneous Sparse Data: New Dataset and InsightsarXiv 2019Efficient Diffusion Transformer with Step-wise Dynamic Attention MediatorsarXiv 2024Teaching Structured Vision&Language Concepts to Vision&Language ModelsarXiv 2022Language Models as Science TutorsarXiv 2024Scaling up self-supervised learning for improved surgical foundation modelsarXiv 2025TrajPAC: Towards Robustness Verification of Pedestrian Trajectory Prediction ModelsICCV 2023 1Accelerating Auto-regressive Text-to-Image Generation with Training-free Speculative Jacobi DecodingarXiv 2024Uncovering Safety Risks of Large Language Models through Concept Activation VectorarXiv 2024On the Robustness of Open-World Test-Time Training: Self-Training with Dynamic Prototype ExpansionICCV 2023 1MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion ModelsarXiv 2024SHISRCNet: Super-resolution And Classification Network For Low-resolution Breast Cancer Histopathology ImagearXiv 2023TheoremLlama: Transforming General-Purpose LLMs into Lean4 ExpertsarXiv 2024Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object SegmentationarXiv 2024RSFNet: A White-Box Image Retouching Approach using Region-Specific Color FiltersICCV 2023 1TreeFormer: a Semi-Supervised Transformer-based Framework for Tree Counting from a Single High Resolution ImagearXiv 2023McEval: Massively Multilingual Code EvaluationarXiv 2024Large Language Models are few(1)-shot Table ReasonersarXiv 2022Multi-XScience: A Large-scale Dataset for Extreme Multi-document Summarization of Scientific ArticlesEMNLP 2020 11AIDE: A Vision-Driven Multi-View, Multi-Modal, Multi-Tasking Dataset for Assistive Driving PerceptionICCV 2023 1Noise-aware Learning from Web-crawled Image-Text Data for Image CaptioningICCV 2023 1RuBQ: A Russian Dataset for Question Answering over WikidataarXiv 2020MelodyT5: A Unified Score-to-Score Transformer for Symbolic Music
ProcessingarXiv 2024SEAL: Steerable Reasoning Calibration of Large Language Models for FreearXiv 2025Errors are Useful Prompts: Instruction Guided Task Programming with
Verifier-Assisted Iterative PromptingarXiv 2023Focus the Discrepancy: Intra- and Inter-Correlation Learning for Image Anomaly DetectionICCV 2023 1MTMamba: Enhancing Multi-Task Dense Scene Understanding by Mamba-Based DecodersarXiv 2024Representation Surgery for Multi-Task Model MergingarXiv 2024Put Your Money Where Your Mouth Is: Evaluating Strategic Planning and Execution of LLM Agents in an Auction ArenaarXiv 2023Constrained Monotonic Neural NetworksarXiv 2022Unveiling and Harnessing Hidden Attention Sinks: Enhancing Large Language Models without Training through Attention CalibrationarXiv 2024Open-World Multi-Task Control Through Goal-Aware Representation Learning and Adaptive Horizon PredictionCVPR 2023 1MM-OR: A Large Multimodal Operating Room Dataset for Semantic Understanding of High-Intensity Surgical EnvironmentsCVPR 2025 1Model Ratatouille: Recycling Diverse Models for Out-of-Distribution GeneralizationarXiv 2022A Large-scale Study of Spatiotemporal Representation Learning with a New Benchmark on Action RecognitionICCV 2023 1Learning to Generate Semantic Layouts for Higher Text-Image Correspondence in Text-to-Image SynthesisICCV 2023 1MatrixVT: Efficient Multi-Camera to BEV Transformation for 3D PerceptionICCV 2023 1Creative Agents: Empowering Agents with Imagination for Creative TasksarXiv 2023GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-trainingarXiv 2024PRISM-TopoMap: Online Topological Mapping with Place Recognition and Scan MatchingarXiv 2024Heterogeneous Graph Representation Learning with Relation AwarenessarXiv 2021Inference Optimal VLMs Need Fewer Visual Tokens and More ParametersarXiv 2024Learning to Generate Grounded Visual Captions without Localization SupervisionarXiv 2019Few-Shot Detection of Machine-Generated Text using Style RepresentationsarXiv 2024AutoLRS: Automatic Learning-Rate Schedule by Bayesian Optimization on the Flyautolrs-automatic-learning-rate-schedule-byCross Lingual Speech Emotion Recognition: Urdu vs. Western LanguagesarXiv 2018LoCoNet: Long-Short Context Network for Active Speaker DetectionCVPR 2024 1UIBert: Learning Generic Multimodal Representations for UI UnderstandingarXiv 2021Distilling and Retrieving Generalizable Knowledge for Robot Manipulation via Language CorrectionsarXiv 2023In-Context Editing: Learning Knowledge from Self-Induced DistributionsarXiv 2024PhysGame: Uncovering Physical Commonsense Violations in Gameplay Videosphysgame-uncovering-physical-commonsenseEnhance Then Search: An Augmentation-Search Strategy with Foundation Models for Cross-Domain Few-Shot Object DetectionarXiv 2025Object pop-up: Can we infer 3D objects and their poses from human interactions alone?object-pop-up-can-we-infer-3d-objects-andOcean-OCR: Towards General OCR Application via a Vision-Language ModelarXiv 2025A Survey of Pre-trained Language Models for Processing Scientific TextarXiv 2024Modeling Uncertainty with Hedged Instance EmbeddingarXiv 2018Adaptive Supervised PatchNCE Loss for Learning H&E-to-IHC Stain Translation with Inconsistent Groundtruth Image PairsarXiv 2023Prototypical Calibrating Ambiguous Samples for Micro-Action RecognitionarXiv 2024CACTUS: Chemistry Agent Connecting Tool-Usage to SciencearXiv 2024Interpretable Bilingual Multimodal Large Language Model for Diverse Biomedical TasksarXiv 2024V2XPnP: Vehicle-to-Everything Spatio-Temporal Fusion for Multi-Agent Perception and PredictionICCV 2025Editable Neural NetworksICLR 2020 1ARGS: Alignment as Reward-Guided SearcharXiv 2024DataDream: Few-shot Guided Dataset GenerationarXiv 2024Restoring Hebrew Diacritics Without a DictionaryFindings (NAACL) 2022 7A Graph is Worth $K$ Words: Euclideanizing Graph using Pure TransformerarXiv 2024AR-LSAT: Investigating Analytical Reasoning of TextarXiv 2021MV-JAR: Masked Voxel Jigsaw and Reconstruction for LiDAR-Based Self-Supervised Pre-TrainingCVPR 2023 1Shrinking Class Space for Enhanced Certainty in Semi-Supervised LearningICCV 2023 1SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language ModelsarXiv 2024Robust Object Modeling for Visual TrackingICCV 2023 1News Summarization and Evaluation in the Era of GPT-3arXiv 2022NAST: Noise Aware Speech Tokenization for Speech Language ModelsarXiv 2024ViLLA: Fine-Grained Vision-Language Representation Learning from Real-World DataICCV 2023 1Learning an Actionable Discrete Diffusion Policy via Large-Scale Actionless Video Pre-TrainingarXiv 2024BF-STVSR: B-Splines and Fourier-Best Friends for High Fidelity Spatial-Temporal Video Super-ResolutionarXiv 2025Rethinking with Retrieval: Faithful Large Language Model InferencearXiv 2022Class Attention Transfer Based Knowledge DistillationCVPR 2023 1Adaptive Image Quality Assessment via Teaching Large Multimodal Model to ComparearXiv 2024Speculative Decoding: Exploiting Speculative Execution for Accelerating Seq2seq GenerationarXiv 2022Reward Model Ensembles Help Mitigate OveroptimizationarXiv 2023Text-to-Motion Retrieval: Towards Joint Understanding of Human Motion Data and Natural LanguagearXiv 2023APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and InferencearXiv 2024NICP: Neural ICP for 3D Human Registration at ScalearXiv 2023Adaptive Thinking via Mode Policy Optimization for Social Language AgentsarXiv 2025ROCKET-1: Mastering Open-World Interaction with Visual-Temporal Context PromptingCVPR 2025 1voc2vec: A Foundation Model for Non-Verbal VocalizationarXiv 2025MUR: Momentum Uncertainty guided Reasoning for Large Language ModelsarXiv 2025Scaling Inference-Time Search with Vision Value Model for Improved Visual ComprehensionICCV 2025CoSQA: 20,000+ Web Queries for Code Search and Question AnsweringACL 2021 5Using the Output Embedding to Improve Language Modelsusing-the-output-embedding-to-improve-1SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language ModelsarXiv 2024EXAMS: A Multi-Subject High School Examinations Dataset for Cross-Lingual and Multilingual Question AnsweringEMNLP 2020 11Extrapolated Urban View Synthesis BenchmarkICCV 2025DP-OPT: Make Large Language Model Your Privacy-Preserving Prompt EngineerarXiv 2023How Do LLMs Acquire New Knowledge? A Knowledge Circuits Perspective on Continual Pre-TrainingarXiv 2025RawHDR: High Dynamic Range Image Reconstruction from a Single Raw ImageICCV 2023 1Differentiable Tracking-Based Training of Deep Learning Sound Source LocalizersarXiv 2021SwinMTL: A Shared Architecture for Simultaneous Depth Estimation and Semantic Segmentation from Monocular Camera ImagesarXiv 2024Bootstrapping Language Models with DPO Implicit RewardsarXiv 2024The Impact of Reasoning Step Length on Large Language ModelsarXiv 2024A Comprehensive Benchmark for COVID-19 Predictive Modeling Using Electronic Health Records in Intensive CarearXiv 2022Non-negative Contrastive LearningarXiv 2024A Comprehensive Guide to Explainable AI: From Classical Models to LLMsarXiv 2024A Call for Clarity in Beam Search: How It Works and When It StopsarXiv 2022NeRRF: 3D Reconstruction and View Synthesis for Transparent and Specular Objects with Neural Refractive-Reflective FieldsarXiv 2023Contrasting with Symile: Simple Model-Agnostic Representation Learning for Unlimited ModalitiesarXiv 2024CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science MasteryarXiv 2024Adversarial Counterfactual Visual ExplanationsCVPR 2023 1Noise-robust Speech Separation with Fast Generative CorrectionarXiv 2024Implicit Neural Spatial Representations for Time-dependent PDEsarXiv 2022Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMsarXiv 2024Practical and Asymptotically Exact Conditional Sampling in Diffusion Modelspractical-and-asymptotically-exactInfinite Feature Selection: A Graph-based Feature Filtering ApproacharXiv 2020SpecDETR: A Transformer-based Hyperspectral Point Object Detection NetworkarXiv 2024Covariant quantum kernels for data with group structurearXiv 2021TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table DomainsarXiv 2024Long-Range Grouping Transformer for Multi-View 3D ReconstructionICCV 2023 1GLAC Net: GLocal Attention Cascading Networks for Multi-image Cued Story GenerationarXiv 2018Online Intrinsic Rewards for Decision Making Agents from Large Language Model FeedbackarXiv 2024GISTEmbed: Guided In-sample Selection of Training Negatives for Text Embedding Fine-tuningarXiv 2024MambaLRP: Explaining Selective State Space Sequence ModelsarXiv 2024Object-aware Gaze Target DetectionICCV 2023 1Adaptive Patch Exiting for Scalable Single Image Super-ResolutionarXiv 2022Coder Reviewer Reranking for Code GenerationarXiv 2022WOMD-Reasoning: A Large-Scale Dataset for Interaction Reasoning in
DrivingarXiv 2024Patched Denoising Diffusion Models For High-Resolution Image SynthesisarXiv 2023Is Neural Topic Modelling Better than Clustering? An Empirical Study on Clustering with Contextual Embeddings for TopicsNAACL 2022 7EGC: Image Generation and Classification via a Diffusion Energy-Based ModelICCV 2023 1PoseBERT: A Generic Transformer Module for Temporal 3D Human ModelingarXiv 2022PartSLIP++: Enhancing Low-Shot 3D Part Segmentation via Multi-View Instance Segmentation and Maximum Likelihood EstimationarXiv 2023GitTables: A Large-Scale Corpus of Relational TablesarXiv 2021Learning from the Worst: Dynamically Generated Datasets to Improve Online Hate DetectionACL 2021 5ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and SpottingCVPR 2024 1DomainAdaptor: A Novel Approach to Test-time AdaptationICCV 2023 1Trained Rank Pruning for Efficient Deep Neural NetworksarXiv 2018Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?arXiv 2025Dataset Interfaces: Diagnosing Model Failures Using Controllable Counterfactual GenerationarXiv 2023Conditional Graph Information Bottleneck for Molecular Relational LearningarXiv 2023MovingFashion: a Benchmark for the Video-to-Shop ChallengearXiv 2021Receler: Reliable Concept Erasing of Text-to-Image Diffusion Models via Lightweight ErasersarXiv 2023Hydragen: High-Throughput LLM Inference with Shared PrefixesarXiv 2024Model Zoo: A Growing "Brain" That Learns ContinuallyarXiv 2021SQ-LLaVA: Self-Questioning for Large Vision-Language AssistantarXiv 2024GoldFinch: High Performance RWKV/Transformer Hybrid with Linear Pre-Fill and Extreme KV-Cache CompressionarXiv 2024Source-Free Domain Adaptation for Image SegmentationarXiv 2021When Semantic Segmentation Meets Frequency AliasingarXiv 2024ODAQ: Open Dataset of Audio QualityarXiv 2023Contrastive Vision-Language Pre-training with Limited ResourcesarXiv 2021Fantastic Questions and Where to Find Them: FairytaleQA -- An Authentic Dataset for Narrative ComprehensionarXiv 2022Demystifying Causal Features on Adversarial Examples and Causal Inoculation for Robust Network by Adversarial Instrumental Variable RegressionCVPR 2023 1CASSPR: Cross Attention Single Scan Place RecognitionICCV 2023 1Evaluating Explainable AI: Which Algorithmic Explanations Help Users Predict Model Behavior?evaluating-explainable-ai-which-algorithmic-1Hyperspectral Pansharpening: Critical Review, Tools and Future PerspectivesarXiv 2024Next Generation Multitarget Trackers: Random Finite Set Methods vs Transformer-based Deep LearningarXiv 2021Unifying Molecular and Textual Representations via Multi-task Language ModellingarXiv 2023AutoDiffusion: Training-Free Optimization of Time Steps and Architectures for Automated Diffusion Model AccelerationICCV 2023 1Geography-Aware Self-Supervised LearningICCV 2021 10RMB: Comprehensively Benchmarking Reward Models in LLM AlignmentarXiv 2024LoRA-XS: Low-Rank Adaptation with Extremely Small Number of ParametersarXiv 2024Less is More: Pre-train a Strong Text Encoder for Dense Retrieval Using a Weak DecoderarXiv 2021Compositional Evaluation on Japanese Textual Entailment and SimilarityarXiv 2022Dataset Enhancement with Instance-Level AugmentationsarXiv 2024Grounding Language with Visual Affordances over Unstructured DataarXiv 2022AgentStore: Scalable Integration of Heterogeneous Agents As Specialized Generalist Computer AssistantarXiv 2024DPMesh: Exploiting Diffusion Prior for Occluded Human Mesh RecoveryCVPR 2024 1Bridging the Novice-Expert Gap via Models of Decision-Making: A Case Study on Remediating Math MistakesarXiv 2023DeiT-LT Distillation Strikes Back for Vision Transformer Training on Long-Tailed DatasetsarXiv 2024HawkEye: Training Video-Text LLMs for Grounding Text in VideosarXiv 2024In-Context Learning for Few-Shot Dialogue State TrackingarXiv 2022Continual Training of Language Models for Few-Shot LearningarXiv 2022I am a Strange Dataset: Metalinguistic Tests for Language ModelsarXiv 2024Deep Graph Representation Learning and Optimization for Influence MaximizationarXiv 2023RAP: Risk-Aware Prediction for Robust PlanningarXiv 2022UniRGB-IR: A Unified Framework for RGB-Infrared Semantic Tasks via Adapter TuningarXiv 2024Pixel-Wise Recognition for Holistic Surgical Scene UnderstandingarXiv 2024Reward-Augmented Decoding: Efficient Controlled Text Generation With a Unidirectional Reward ModelarXiv 2023TableSense: Spreadsheet Table Detection with Convolutional Neural NetworksarXiv 2021Evaluating Language Models for Mathematics through InteractionsarXiv 2023Be Careful What You Smooth For: Label Smoothing Can Be a Privacy Shield but Also a Catalyst for Model Inversion AttacksarXiv 2023UMIE: Unified Multimodal Information Extraction with Instruction TuningarXiv 2024Customizing 360-Degree Panoramas through Text-to-Image Diffusion ModelsarXiv 2023Stacking Your Transformers: A Closer Look at Model Growth for Efficient LLM Pre-TrainingarXiv 2024Learning Over Molecular Conformer Ensembles: Datasets and BenchmarksarXiv 2023TPS++: Attention-Enhanced Thin-Plate Spline for Scene Text RecognitionarXiv 2023SAP Signavio Academic Models: A Large Process Model DatasetarXiv 2022Principled Data Selection for Alignment: The Hidden Risks of Difficult ExamplesarXiv 2025