0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

Training Neural Networks with Fixed Sparse MasksNeurIPS 2021 12I Can't Believe There's No Images! Learning Visual Tasks Using only Language SupervisionICCV 2023 1ViTGAN: Training GANs with Vision Transformersvitgan-training-gans-with-vision-transformers-1Progressive Pretext Task Learning for Human Trajectory PredictionarXiv 2024RegionBLIP: A Unified Multi-modal Pre-training Framework for Holistic and Regional ComprehensionarXiv 2023Compositional Video Generation as Flow EqualizationarXiv 2024Drive&Segment: Unsupervised Semantic Segmentation of Urban Scenes via Cross-modal DistillationarXiv 2022Keyformer: KV Cache Reduction through Key Tokens Selection for Efficient Generative InferencearXiv 2024Cooperative Graph Neural NetworksarXiv 2023UniT: Data Efficient Tactile Representation with Generalization to Unseen ObjectsarXiv 2024Reasons to Reject? Aligning Language Models with JudgmentsarXiv 2023Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality InversionarXiv 2025SNIP: Bridging Mathematical Symbolic and Numeric Realms with Unified Pre-trainingarXiv 2023GrounDiT: Grounding Diffusion Transformers via Noisy Patch TransplantationarXiv 2024Benchmarking Benchmark Leakage in Large Language ModelsarXiv 2024Weak-to-Strong ReasoningarXiv 2024Noise Contrastive Alignment of Language Models with Explicit RewardsarXiv 2024Incremental Sequence Labeling: A Tale of Two ShiftsarXiv 2024MonoWAD: Weather-Adaptive Diffusion Model for Robust Monocular 3D Object DetectionarXiv 2024Prototype-based Embedding Network for Scene Graph GenerationCVPR 2023 1FOSTER: Feature Boosting and Compression for Class-Incremental LearningarXiv 2022A Simple Interpretable Transformer for Fine-Grained Image Classification and AnalysisarXiv 2023LLM-Microscope: Uncovering the Hidden Role of Punctuation in Context Memory of TransformersarXiv 2025Unsupervised Object-Level Representation Learning from Scene ImagesNeurIPS 2021 12Improving Vision-and-Language Navigation with Image-Text Pairs from the WebECCV 2020 8Mitigating Modality Prior-Induced Hallucinations in Multimodal Large Language Models via Deciphering Attention CausalityarXiv 2024Your Transformer is Secretly LineararXiv 2024CHiLS: Zero-Shot Image Classification with Hierarchical Label SetsarXiv 2023PyNeRF: Pyramidal Neural Radiance Fieldspynerf-pyramidal-neural-radiance-fieldsIterative Token Evaluation and Refinement for Real-World Super-ResolutionarXiv 2023Ham2Pose: Animating Sign Language Notation into Pose SequencesCVPR 2023 1MCSE: Multimodal Contrastive Learning of Sentence EmbeddingsarXiv 2022CodeTransOcean: A Comprehensive Multilingual Benchmark for Code TranslationarXiv 2023When to Trust Your Simulator: Dynamics-Aware Hybrid Offline-and-Online Reinforcement LearningarXiv 2022An Efficient Multilingual Language Model Compression through Vocabulary TrimmingarXiv 2023FactKG: Fact Verification via Reasoning on Knowledge GraphsarXiv 2023Towards Enhanced Image Inpainting: Mitigating Unwanted Object Insertion and Preserving Color ConsistencyCVPR 2025 1Slicedit: Zero-Shot Video Editing With Text-to-Image Diffusion Models Using Spatio-Temporal SlicesarXiv 2024How you feelin'? Learning Emotions and Mental States in Movie ScenesCVPR 2023 1ModelDiff: A Framework for Comparing Learning AlgorithmsarXiv 2022Topologically faithful image segmentation via induced matching of persistence barcodesarXiv 2022V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference OptimizationarXiv 2024EffiBench: Benchmarking the Efficiency of Automatically Generated CodearXiv 2024DinoBloom: A Foundation Model for Generalizable Cell Embeddings in HematologyarXiv 2024Sample-level CNN Architectures for Music Auto-tagging Using Raw WaveformsarXiv 2017Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective RewardsarXiv 2024Long Context is Not Long at All: A Prospector of Long-Dependency Data for Large Language ModelsarXiv 2024Causal Agent based on Large Language ModelarXiv 2024Neighboring Autoregressive Modeling for Efficient Visual GenerationICCV 2025Fast Point Cloud Generation with Straight FlowsCVPR 2023 1Improved Probabilistic Image-Text RepresentationsarXiv 2023Search-in-the-Chain: Interactively Enhancing Large Language Models with Search for Knowledge-intensive TasksarXiv 2023Three Pillars improving Vision Foundation Model Distillation for LidarCVPR 2024 1The Devil is in the Points: Weakly Semi-Supervised Instance Segmentation via Point-Guided Mask RepresentationCVPR 2023 1Controlling Language and Diffusion Models by Transporting ActivationsarXiv 2024AnyStory: Towards Unified Single and Multiple Subject Personalization in Text-to-Image GenerationarXiv 2025Seeing the Image: Prioritizing Visual Correlation by Contrastive AlignmentarXiv 2024Talk Structurally, Act Hierarchically: A Collaborative Framework for LLM Multi-Agent SystemsarXiv 2025Pre-gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert InferencearXiv 2023ViewFormer: Exploring Spatiotemporal Modeling for Multi-View 3D Occupancy Perception via View-Guided TransformersarXiv 2024Efficient Reasoning with Hidden ThinkingarXiv 2025VideoCon: Robust Video-Language Alignment via Contrast CaptionsCVPR 2024 1ASSET: A Dataset for Tuning and Evaluation of Sentence Simplification Models with Multiple Rewriting Transformationsasset-a-dataset-for-tuning-and-evaluation-of-1Reasoning or Reciting? Exploring the Capabilities and Limitations of Language Models Through Counterfactual TasksarXiv 2023Bridging the Divide: Reconsidering Softmax and Linear AttentionarXiv 2024SlimFlow: Training Smaller One-Step Diffusion Models with Rectified FlowarXiv 2024Unsupervised Zero-Shot Reinforcement Learning via Functional Reward EncodingsarXiv 2024Visual-Text Cross Alignment: Refining the Similarity Score in Vision-Language ModelsarXiv 2024End-to-end Conversation Modeling Track in DSTC6arXiv 2017Direct Diffusion Bridge using Data Consistency for Inverse Problemsdirect-diffusion-bridge-using-dataThe Importance of Being Scalable: Improving the Speed and Accuracy of Neural Network Interatomic Potentials Across Chemical DomainsarXiv 2024On the Expressivity Role of LayerNorm in Transformers' AttentionarXiv 2023Point-PEFT: Parameter-Efficient Fine-Tuning for 3D Pre-trained ModelsarXiv 2023Explicitly Guided Information Interaction Network for Cross-modal Point Cloud CompletionarXiv 2024Adversarial Supervision Makes Layout-to-Image Diffusion Models ThrivearXiv 2024SPARE3D: A Dataset for SPAtial REasoning on Three-View Line Drawingsspare3d-a-dataset-for-spatial-reasoning-on-1Semantic HELM: A Human-Readable Memory for Reinforcement Learningsemantic-helm-a-human-readable-memory-forCan Atomic Step Decomposition Enhance the Self-structured Reasoning of Multimodal Large Models?arXiv 2025Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language ModelsarXiv 2024WhiteningBERT: An Easy Unsupervised Sentence Embedding ApproachFindings (EMNLP) 2021 11RJUA-QA: A Comprehensive QA Dataset for UrologyarXiv 2023Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight FinetuningarXiv 2024Enhancing Reasoning Capabilities of LLMs via Principled Synthetic Logic CorpusarXiv 2024Exploring Target Representations for Masked AutoencodersarXiv 2022Generative Prompt Model for Weakly Supervised Object LocalizationICCV 2023 1in2IN: Leveraging individual Information to Generate Human INteractionsin2in-leveraging-individual-information-toPoisoning Language Models During Instruction TuningarXiv 2023VIEScore: Towards Explainable Metrics for Conditional Image Synthesis EvaluationarXiv 2023Towards Omni-generalizable Neural Methods for Vehicle Routing ProblemsarXiv 2023MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language ModelsarXiv 2024An Autoregressive Text-to-Graph Framework for Joint Entity and Relation ExtractionarXiv 2024Mind Your Outliers! Investigating the Negative Impact of Outliers on Active Learning for Visual Question AnsweringACL 2021 5BatchTopK Sparse AutoencodersarXiv 2024Diffusion Model as Representation LearnerICCV 2023 1Unsupervised Learning for Solving the Travelling Salesman Problemunsupervised-learning-for-solving-theSEAGULL: No-reference Image Quality Assessment for Regions of Interest via Vision-Language Instruction TuningarXiv 2024TabGenie: A Toolkit for Table-to-Text GenerationarXiv 2023InFoBench: Evaluating Instruction Following Ability in Large Language ModelsarXiv 2024What do we learn from inverting CLIP models?arXiv 2024Color2Embed: Fast Exemplar-Based Image Colorization using Color EmbeddingsarXiv 2021AirfRANS: High Fidelity Computational Fluid Dynamics Dataset for Approximating Reynolds-Averaged Navier-Stokes SolutionsarXiv 2022Reconstructing Hand-Held Objects in 3D from Images and VideosarXiv 2024NOLA: Compressing LoRA using Linear Combination of Random BasisarXiv 2023Rethinking the Evaluation for Conversational Recommendation in the Era of Large Language ModelsarXiv 2023TransRef: Multi-Scale Reference Embedding Transformer for Reference-Guided Image InpaintingarXiv 2023HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual GroundingarXiv 2024Just read twice: closing the recall gap for recurrent language modelsarXiv 2024OMNI: Open-endedness via Models of human Notions of InterestingnessarXiv 2023REBEL: Reinforcement Learning via Regressing Relative RewardsarXiv 2024Mobile-Env: Building Qualified Evaluation Benchmarks for LLM-GUI InteractionarXiv 2023TURJUMAN: A Public Toolkit for Neural Arabic Machine TranslationOSACT (LREC) 2022 6InsightBench: Evaluating Business Analytics Agents Through Multi-Step Insight GenerationarXiv 2024RAS: Retrieval-And-Structuring for Knowledge-Intensive LLM GenerationarXiv 2025Timewarp: Transferable Acceleration of Molecular Dynamics by Learning Time-Coarsened Dynamicstimewarp-transferable-acceleration-ofMultilingual and Multi-Aspect Hate Speech Analysismultilingual-and-multi-aspect-hate-speech-1BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writingblsp-bootstrapping-language-speech-preTowards Efficient Exact Optimization of Language Model AlignmentarXiv 2024PNI : Industrial Anomaly Detection using Position and Neighborhood InformationICCV 2023 1Fixed Point Diffusion ModelsCVPR 2024 1Lung and Colon Cancer Histopathological Image Dataset (LC25000)arXiv 2019Large-batch Optimization for Dense Visual PredictionsarXiv 2022Enhancing Diffusion Models with Text-Encoder Reinforcement LearningarXiv 2023Learned representation-guided diffusion models for large-image generationCVPR 2024 1RAVEL: Evaluating Interpretability Methods on Disentangling Language Model RepresentationsarXiv 2024Attack-Resilient Image Watermarking Using Stable DiffusionarXiv 2024Learning to Balance Specificity and Invariance for In and Out of Domain GeneralizationECCV 2020 8Sparse MoE as the New Dropout: Scaling Dense and Self-Slimmable TransformersarXiv 2023Mini-BEHAVIOR: A Procedurally Generated Benchmark for Long-horizon Decision-Making in Embodied AIarXiv 2023LLM-Inference-Bench: Inference Benchmarking of Large Language Models on AI AcceleratorsarXiv 2024Fine-Grained Visual PromptingNeurIPS 2023 11BEACON: Benchmark for Comprehensive RNA Tasks and Language ModelsarXiv 2024UGG: Unified Generative GraspingarXiv 2023Parallelizing non-linear sequential models over the sequence lengtharXiv 20233D-Aware Neural Body Fitting for Occlusion Robust 3D Human Pose EstimationICCV 2023 1Multitask Vision-Language Prompt TuningarXiv 2022PLANNER: Generating Diversified Paragraph via Latent Language Diffusion Modelplanner-generating-diversified-paragraph-viaQASC: A Dataset for Question Answering via Sentence CompositionarXiv 2019The Accented English Speech Recognition Challenge 2020: Open Datasets, Tracks, Baselines, Results and MethodsarXiv 2021Bootstrap Fine-Grained Vision-Language Alignment for Unified Zero-Shot Anomaly LocalizationarXiv 2023On Measuring Social Biases in Sentence Encoderson-measuring-social-biases-in-sentence-1PartGLEE: A Foundation Model for Recognizing and Parsing Any ObjectsarXiv 2024IndicGenBench: A Multilingual Benchmark to Evaluate Generation Capabilities of LLMs on Indic LanguagesarXiv 2024Routoo: Learning to Route to Large Language Models EffectivelyarXiv 2024Mission: Impossible Language ModelsarXiv 2024Longhorn: State Space Models are Amortized Online LearnersarXiv 2024SPatchGAN: A Statistical Feature Based Discriminator for Unsupervised Image-to-Image TranslationICCV 2021 10IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth GenerationarXiv 2024Dice Semimetric Losses: Optimizing the Dice Score with Soft LabelsarXiv 2023Learning Physical Models that Can Respect Conservation LawsarXiv 2023BiBench: Benchmarking and Analyzing Network BinarizationarXiv 2023Controllable Person Image Synthesis with Spatially-Adaptive Warped NormalizationarXiv 2021VisualMRC: Machine Reading Comprehension on Document ImagesarXiv 2021Cross Modal Retrieval with Querybank NormalisationCVPR 2022 1Get What You Want, Not What You Don't: Image Content Suppression for Text-to-Image Diffusion ModelsarXiv 2024Towards Efficient NLP: A Standard Evaluation and A Strong BaselineNAACL 2022 7Factorized Inverse Path Tracing for Efficient and Accurate Material-Lighting EstimationICCV 2023 1CURE: Code-Aware Neural Machine Translation for Automatic Program RepairarXiv 2021Towards Crowdsourced Training of Large Neural Networks using Decentralized Mixture-of-ExpertsNeurIPS 2020 12Out of the Cage: How Stochastic Parrots Win in Cyber Security EnvironmentsarXiv 2023HumBugDB: A Large-scale Acoustic Mosquito DatasetarXiv 2021VidLanKD: Improving Language Understanding via Video-Distilled Knowledge TransferNeurIPS 2021 12Learn Beyond The Answer: Training Language Models with Reflection for Mathematical ReasoningarXiv 2024Complex Network for Complex Problems: A comparative study of CNN and Complex-valued CNNarXiv 2023VinDr-CXR: An open dataset of chest X-rays with radiologist's annotationsarXiv 2020Automatic Evaluation of Attribution by Large Language ModelsarXiv 2023End-to-End Optimization of Scene Layoutend-to-end-optimization-of-scene-layoutAre We There Yet? A Brief Survey of Music Emotion Prediction Datasets, Models and Outstanding ChallengesarXiv 2024Diff-eRank: A Novel Rank-Based Metric for Evaluating Large Language ModelsarXiv 2024LAION-SG: An Enhanced Large-Scale Dataset for Training Complex Image-Text Models with Structural AnnotationsarXiv 2024A Multimodal Benchmark Dataset and Model for Crop Disease DiagnosisarXiv 2025ECCV Caption: Correcting False Negatives by Collecting Machine-and-Human-verified Image-Caption Associations for MS-COCOarXiv 2022Analyzing Transformers in Embedding SpacearXiv 2022Deep Diffusion Image Prior for Efficient OOD Adaptation in 3D Inverse ProblemsarXiv 2024SciCap: Generating Captions for Scientific FiguresFindings (EMNLP) 2021 11Batch size-invariance for policy optimizationbatch-size-invariance-for-policy-optimization-1A skeletonization algorithm for gradient-based optimizationICCV 2023 1FuseCap: Leveraging Large Language Models for Enriched Fused Image CaptionsarXiv 2023Monitoring Model Deterioration with Explainable Uncertainty Estimation via Non-parametric BootstraparXiv 2022Improving Visual Prompt Tuning for Self-supervised Vision TransformersarXiv 2023Speech-based Age and Gender Prediction with TransformersarXiv 2023Spurious Forgetting in Continual Learning of Language ModelsarXiv 2025SelfIE: Self-Interpretation of Large Language Model EmbeddingsarXiv 2024Anti-Exploration by Random Network DistillationarXiv 2023DebateSum: A large-scale argument mining and summarization datasetCOLING (ArgMining) 2020 12Diversifying Content Generation for Commonsense Reasoning with Mixture of Knowledge Graph ExpertsNAACL (DLG4NLP) 2022 73D Copy-Paste: Physically Plausible Object Insertion for Monocular 3D Detection3d-copy-paste-physically-plausible-objectQAQ: Quality Adaptive Quantization for LLM KV CachearXiv 2024AdaTT: Adaptive Task-to-Task Fusion Network for Multitask Learning in RecommendationsarXiv 2023PhilEO Bench: Evaluating Geo-Spatial Foundation ModelsarXiv 2024Unified Visual Transformer Compressionunified-visual-transformer-compressionGraphEcho: Graph-Driven Unsupervised Domain Adaptation for Echocardiogram Video SegmentationICCV 2023 1UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and EditingCVPR 2025 1ORGAN: Observation-Guided Radiology Report Generation via Tree ReasoningarXiv 2023IOMatch: Simplifying Open-Set Semi-Supervised Learning with Joint Inliers and Outliers UtilizationICCV 2023 1Towards Building Text-To-Speech Systems for the Next Billion UsersarXiv 2022Leveraging SE(3) Equivariance for Learning 3D Geometric Shape AssemblyICCV 2023 1CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular FusionarXiv 2024In-context Pretraining: Language Modeling Beyond Document BoundariesarXiv 2023FAME-ViL: Multi-Tasking Vision-Language Model for Heterogeneous Fashion TasksCVPR 2023 1Ensembling Prioritized Hybrid Policies for Multi-agent PathfindingarXiv 2024

Back to Papers