All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Debiasing Multimodal Large Language ModelsarXiv 2024Identifying Mislabeled Data using the Area Under the Margin RankingNeurIPS 2020 12Agent-SafetyBench: Evaluating the Safety of LLM AgentsarXiv 2024Impossible VideosarXiv 2025Learning deep structured active contours end-to-endlearning-deep-structured-active-contours-end-1Gender Bias in Coreference Resolutiongender-bias-in-coreference-resolution-2SciAssess: Benchmarking LLM Proficiency in Scientific Literature AnalysisarXiv 2024Learning Universal PredictorsarXiv 2024Few-shot Scene-adaptive Anomaly DetectionECCV 2020 8METRA: Scalable Unsupervised RL with Metric-Aware AbstractionarXiv 2023Extending LLMs' Context Window with 100 SamplesarXiv 2024RealViformer: Investigating Attention for Real-World Video Super-ResolutionarXiv 2024Model Sparsity Can Simplify Machine Unlearningmodel-sparsity-can-simplify-machinePidginUNMT: Unsupervised Neural Machine Translation from West African Pidgin to EnglisharXiv 2019ARM-Net: Adaptive Relation Modeling Network for Structured DataarXiv 2021Did Aristotle Use a Laptop? A Question Answering Benchmark with Implicit Reasoning StrategiesarXiv 2021Token Merging for Training-Free Semantic Binding in Text-to-Image SynthesisarXiv 2024Consistent3D: Towards Consistent High-Fidelity Text-to-3D Generation with Deterministic Sampling PriorCVPR 2024 1Locally Typical SamplingarXiv 2022DiffFashion: Reference-based Fashion Design with Structure-aware Transfer by Diffusion ModelsarXiv 2023CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile ApplicationsarXiv 2024A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and InteractivityarXiv 2023DEGREE: A Data-Efficient Generation-Based Event Extraction ModelNAACL 2022 7UniVST: A Unified Framework for Training-free Localized Video Style TransferarXiv 2024Benchmarking and Improving Detail Image CaptionarXiv 2024ReQFlow: Rectified Quaternion Flow for Efficient and High-Quality Protein Backbone GenerationarXiv 2025MSINet: Twins Contrastive Search of Multi-Scale Interaction for Object ReIDCVPR 2023 1Know Your Neighbors: Improving Single-View Reconstruction via Spatial Vision-Language ReasoningCVPR 2024 1FarsTail: A Persian Natural Language Inference DatasetarXiv 2020LoQT: Low-Rank Adapters for Quantized PretrainingarXiv 2024Neural Diffusion ProcessesarXiv 2022Neural Interactive Keypoint DetectionICCV 2023 1DeSTSeg: Segmentation Guided Denoising Student-Teacher for Anomaly DetectionCVPR 2023 1DiffusionPen: Towards Controlling the Style of Handwritten Text GenerationarXiv 2024TIP: Tabular-Image Pre-training for Multimodal Classification with Incomplete DataarXiv 2024No Train No Gain: Revisiting Efficient Training Algorithms For Transformer-based Language ModelsNeurIPS 2023 11CrossQ: Batch Normalization in Deep Reinforcement Learning for Greater Sample Efficiency and SimplicityarXiv 2019Linguistic Binding in Diffusion Models: Enhancing Attribute Correspondence through Attention Map Alignmentlinguistic-binding-in-diffusion-modelsSafety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language ModelsarXiv 2024ScatterFormer: Efficient Voxel Transformer with Scattered Linear AttentionarXiv 2024Emotion Classification in a Resource Constrained Language Using Transformer-based ApproachNAACL 2021 4Weakly Supervised Semantic Segmentation using Out-of-Distribution DataCVPR 2022 1Entropy-SGD: Biasing Gradient Descent Into Wide ValleysarXiv 2016OPA: Object Placement Assessment DatasetarXiv 2021Fewer-token Neural Speech Codec with Time-invariant CodesarXiv 2023Steering Knowledge Selection Behaviours in LLMs via SAE-Based Representation EngineeringarXiv 2024Disentangling Memory and Reasoning Ability in Large Language ModelsarXiv 2024Online Merging Optimizers for Boosting Rewards and Mitigating Tax in AlignmentarXiv 2024Do Llamas Work in English? On the Latent Language of Multilingual TransformersarXiv 2024Top Leaderboard Ranking = Top Coding Proficiency, Always? EvoEval: Evolving Coding Benchmarks via LLMarXiv 2024Align and Distill: Unifying and Improving Domain Adaptive Object
DetectionarXiv 2024XOR QA: Cross-lingual Open-Retrieval Question AnsweringNAACL 2021 4Towards Semantic Equivalence of Tokenization in Multimodal LLMarXiv 2024ASR data augmentation in low-resource settings using cross-lingual multi-speaker TTS and cross-lingual voice conversionarXiv 2022Improving Iterative Text Revision by Learning Where to Edit from Other Revision TasksarXiv 2022Exploiting Diffusion Prior for Generalizable Dense PredictionarXiv 2023Str2Str: A Score-based Framework for Zero-shot Protein Conformation SamplingarXiv 2023ICE-Score: Instructing Large Language Models to Evaluate CodearXiv 2023DyStyle: Dynamic Neural Network for Multi-Attribute-Conditioned Style EditingarXiv 2022Beyond the Contact: Discovering Comprehensive Affordance for 3D Objects from Pre-trained 2D Diffusion ModelsarXiv 2024Self-Supervised Contrastive Learning for Long-term ForecastingarXiv 2024Supervised Prototypical Contrastive Learning for Emotion Recognition in ConversationarXiv 2022WaveCoder: Widespread And Versatile Enhancement For Code Large Language Models By Instruction TuningarXiv 2023BAE-Net: A Low complexity and high fidelity Bandwidth-Adaptive neural
network for speech super-resolutionarXiv 2023MediaSum: A Large-scale Media Interview Dataset for Dialogue SummarizationNAACL 2021 4SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal BehaviorsarXiv 2024Accelerating Image Super-Resolution Networks with Pixel-Level ClassificationarXiv 2024On the Diversity and Realism of Distilled Dataset: An Efficient Dataset Distillation ParadigmCVPR 2024 1Content-Style Decoupling for Unsupervised Makeup Transfer without Generating Pseudo Ground TruthCVPR 2024 1Momentor: Advancing Video Large Language Model with Fine-Grained Temporal ReasoningarXiv 2024EmoKnob: Enhance Voice Cloning with Fine-Grained Emotion ControlarXiv 2024Benchmarking Large Language Models on CMExam -- A Comprehensive Chinese Medical Exam DatasetarXiv 2023Can LLM-Generated Misinformation Be Detected?arXiv 2023Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation DatasetarXiv 2024Improving Code Generation by Training with Natural Language FeedbackarXiv 2023GTA: Global Tracklet Association for Multi-Object Tracking in SportsarXiv 2024Mapping Language to Code in Programmatic Contextmapping-language-to-code-in-programmatic-1SketchVideo: Sketch-based Video Generation and EditingCVPR 2025 1Improving Long-Text Alignment for Text-to-Image Diffusion ModelsarXiv 2024A Deep Neural Network for SSVEP-based Brain-Computer InterfacesarXiv 2020Smaug: Fixing Failure Modes of Preference Optimisation with DPO-PositivearXiv 2024Convolutional Hough Matching Networks for Robust and Efficient Visual CorrespondencearXiv 2021SOTOPIA-$π$: Interactive Learning of Socially Intelligent Language AgentsarXiv 2024DECO: Dense Estimation of 3D Human-Scene Contact In The Wilddeco-dense-estimation-of-3d-human-scenePerceptionCLIP: Visual Classification by Inferring and Conditioning on ContextsarXiv 2023Multi-Scale VMamba: Hierarchy in Hierarchy Visual State Space ModelarXiv 2024Easter2.0: Improving convolutional models for handwritten text recognitionarXiv 2022Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained EvaluationarXiv 2024DataInf: Efficiently Estimating Data Influence in LoRA-tuned LLMs and Diffusion ModelsarXiv 2023Commonsense-Focused Dialogues for Response Generation: An Empirical StudySIGDIAL (ACL) 2021 7Discourse Centric Evaluation of Machine Translation with a Densely Annotated Parallel CorpusarXiv 2023Solving Inverse Problems with Latent Diffusion Models via Hard Data ConsistencyarXiv 2023Evaluating Data Attribution for Text-to-Image ModelsICCV 2023 1Adaptive Chameleon or Stubborn Sloth: Revealing the Behavior of Large Language Models in Knowledge ConflictsarXiv 2023AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMsarXiv 2024G-SimCLR: Self-Supervised Contrastive Learning with Guided Projection via Pseudo LabellingarXiv 2020GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AIarXiv 2024Solving High-Dimensional PDEs with Latent Spectral ModelsarXiv 2023Combining Fact Extraction and Verification with Neural Semantic Matching NetworksarXiv 2018Enabling Intelligent Interactions between an Agent and an LLM: A Reinforcement Learning ApproacharXiv 2023LiDAR-PTQ: Post-Training Quantization for Point Cloud 3D Object DetectionarXiv 2024Self-Supervised High Dynamic Range Imaging with Multi-Exposure Images in Dynamic ScenesarXiv 2023MarsExplorer: Exploration of Unknown Terrains via Deep Reinforcement Learning and Procedurally Generated EnvironmentsarXiv 2021Sentence Embeddings in NLI with Iterative Refinement EncodersarXiv 2018The Harvard USPTO Patent Dataset: A Large-Scale, Well-Structured, and Multi-Purpose Corpus of Patent Applicationsthe-harvard-uspto-patent-dataset-a-largeENVIDR: Implicit Differentiable Renderer with Neural Environment LightingICCV 2023 1Optimizing Model Selection for Compound AI SystemsarXiv 2025FastVAR: Linear Visual Autoregressive Modeling via Cached Token PruningICCV 2025Point-Query Quadtree for Crowd Counting, Localization, and MoreICCV 2023 1CloSe: A 3D Clothing Segmentation Dataset and ModelarXiv 2024iSEARLE: Improving Textual Inversion for Zero-Shot Composed Image RetrievalarXiv 2024M4: Multi-generator, Multi-domain, and Multi-lingual Black-Box Machine-Generated Text DetectionarXiv 2023CascadedGaze: Efficiency in Global Context Extraction for Image RestorationarXiv 2024StyleDiffusion: Prompt-Embedding Inversion for Text-Based EditingarXiv 2023Mr. TyDi: A Multi-lingual Benchmark for Dense RetrievalEMNLP (MRL) 2021 11Expandable Subspace Ensemble for Pre-Trained Model-Based Class-Incremental LearningCVPR 2024 1Variational Learning is Effective for Large Deep NetworksarXiv 2024Prototypical Information Bottlenecking and Disentangling for Multimodal Cancer Survival PredictionarXiv 2024LeX-Art: Rethinking Text Generation via Scalable High-Quality Data SynthesisarXiv 2025PARE-Net: Position-Aware Rotation-Equivariant Networks for Robust Point Cloud RegistrationarXiv 2024Graph Convolutional Network for Recommendation with Low-pass Collaborative FiltersICML 2020 1Identification of Rhetorical Roles of Sentences in Indian Legal JudgmentsarXiv 2019NeuFA: Neural Network Based End-to-End Forced Alignment with
Bidirectional Attention MechanismarXiv 2022Composable Text Controls in Latent Space with ODEsarXiv 2022Variational Bayesian Last LayersarXiv 2024AST-T5: Structure-Aware Pretraining for Code Generation and UnderstandingarXiv 2024CLEX: Continuous Length Extrapolation for Large Language ModelsarXiv 2023Large Language Models Struggle to Learn Long-Tail KnowledgearXiv 2022LINC: A Neurosymbolic Approach for Logical Reasoning by Combining Language Models with First-Order Logic ProversarXiv 2023Fast, Effective, and Self-Supervised: Transforming Masked Language Models into Universal Lexical and Sentence EncodersEMNLP 2021 11Text Image Inpainting via Global Structure-Guided Diffusion ModelsarXiv 2024A Kernel-Based View of Language Model Fine-TuningarXiv 2022Language-Conditioned Imitation Learning for Robot Manipulation TasksNeurIPS 2020 12SimNet: Enabling Robust Unknown Object Manipulation from Pure Synthetic Data via StereoarXiv 2021Strike (with) a Pose: Neural Networks Are Easily Fooled by Strange Poses of Familiar Objectsstrike-with-a-pose-neural-networks-are-easily-1Investigating the Effectiveness of Task-Agnostic Prefix Prompt for Instruction FollowingarXiv 2023Don't Generate, Discriminate: A Proposal for Grounding Language Models to Real-World EnvironmentsarXiv 2022Fully Hyperbolic Convolutional Neural Networks for Computer VisionarXiv 2023Vox-E: Text-guided Voxel Editing of 3D ObjectsICCV 2023 1Dual-Space NeRF: Learning Animatable Avatars and Scene Lighting in Separate SpacesarXiv 2022REEF: Representation Encoding Fingerprints for Large Language ModelsarXiv 2024AnalogGenie: A Generative Engine for Automatic Discovery of Analog Circuit TopologiesarXiv 2025EndoDAC: Efficient Adapting Foundation Model for Self-Supervised Depth Estimation from Any Endoscopic CameraarXiv 2024ESTextSpotter: Towards Better Scene Text Spotting with Explicit Synergy in TransformerICCV 2023 1Exploring the Efficacy of Pre-trained Checkpoints in Text-to-Music Generation TaskarXiv 2022ChemAgent: Self-updating Library in Large Language Models Improves Chemical ReasoningarXiv 2025Expanding Small-Scale Datasets with Guided Imaginationexpanding-small-scale-datasets-with-guidedStochastic Normalizing FlowsNeurIPS 2020 12CiT: Curation in Training for Effective Vision-Language DataICCV 2023 1Visual Dialogvisual-dialog-1Isotropic3D: Image-to-3D Generation Based on a Single CLIP EmbeddingarXiv 2024Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference AdjustmentarXiv 2024DreamText: High Fidelity Scene Text SynthesisCVPR 2025 1Researching Alignment Research: Unsupervised AnalysisarXiv 2022PointOBB: Learning Oriented Object Detection via Single Point SupervisionCVPR 2024 1Video Background Music Generation: Dataset, Method and EvaluationICCV 2023 1Improving Lens Flare Removal with General Purpose Pipeline and Multiple Light Sources RecoveryarXiv 2023Understanding the Limitations of Variational Mutual Information EstimatorsICLR 2020 1Parrot: Multilingual Visual Instruction TuningarXiv 2024How do you know that? Teaching Generative Language Models to Reference Answers to Biomedical QuestionsarXiv 2024UniAdapter: Unified Parameter-Efficient Transfer Learning for Cross-modal ModelingarXiv 2023UFineBench: Towards Text-based Person Retrieval with Ultra-fine GranularityCVPR 2024 1Movie101: A New Movie Understanding BenchmarkarXiv 2023MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World TasksarXiv 2024VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal ModelsarXiv 2024FlexiDreamer: Single Image-to-3D Generation with FlexiCubesarXiv 2024CVPR 2023 Text Guided Video Editing CompetitionarXiv 2023Towards Training-free Anomaly Detection with Vision and Language Foundation ModelsCVPR 2025 1Does Refusal Training in LLMs Generalize to the Past Tense?arXiv 2024APEACH: Attacking Pejorative Expressions with Analysis on Crowd-Generated Hate Speech Evaluation DatasetsarXiv 2022Generative Image as Action ModelsarXiv 2024PTT: Point-Trajectory Transformer for Efficient Temporal 3D Object DetectionCVPR 2024 1Contrast Everything: A Hierarchical Contrastive Framework for Medical Time-SeriesNeurIPS 2023 11Data-Centric Foundation Models in Computational Healthcare: A SurveyarXiv 2024FLEX: Continuous Agent Evolution via Forward Learning from ExperiencearXiv 2025Fast and Accurate Neural CRF Constituency Parsingfast-and-accurate-neural-crf-constituencyJigsaw Clustering for Unsupervised Visual Representation LearningCVPR 2021 1CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language ModelsarXiv 2024Linearizing Large Language ModelsarXiv 2024The Unreasonable Effectiveness of Random Pruning: Return of the Most Naive Baseline for Sparse Trainingthe-unreasonable-effectiveness-of-randomCLIP-Mamba: CLIP Pretrained Mamba Models with OOD and Hessian EvaluationarXiv 2024CTIBench: A Benchmark for Evaluating LLMs in Cyber Threat IntelligencearXiv 2024Set You Straight: Auto-Steering Denoising Trajectories to Sidestep Unwanted ConceptsarXiv 2025The Hidden Language of Diffusion ModelsarXiv 2023The Web as a Knowledge-base for Answering Complex Questionsthe-web-as-a-knowledge-base-for-answering-1Graph Language ModelsarXiv 2024EgoObjects: A Large-Scale Egocentric Dataset for Fine-Grained Object UnderstandingICCV 2023 1Construction of a Japanese Financial Benchmark for Large Language ModelsarXiv 2024Self-Supervised Variational Auto-Encodersself-supervised-variational-auto-encodersGriffin: Aerial-Ground Cooperative Detection and Tracking Dataset and BenchmarkarXiv 2025Towards Semi-supervised Learning with Non-random Missing LabelsICCV 2023 1Actionable Recourse in Linear ClassificationarXiv 2018MedCalc-Bench: Evaluating Large Language Models for Medical CalculationsarXiv 2024Large Language Models are Temporal and Causal Reasoners for Video Question AnsweringarXiv 2023ContactGen: Generative Contact Modeling for Grasp Generationcontactgen-generative-contact-modeling-forDense Pixel-to-Pixel Harmonization via Continuous Image RepresentationarXiv 2023Towards General Low-Light Raw Noise Synthesis and ModelingICCV 2023 1SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video UnderstandingarXiv 2025Towards Interpreting Visual Information Processing in Vision-Language ModelsarXiv 2024Perspective-taking and Pragmatics for Generating Empathetic Responses Focused on Emotion CausesEMNLP 2021 11