All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language ModelsEMNLP 2020 11FreeStyle: Free Lunch for Text-guided Style Transfer using Diffusion ModelsarXiv 2024A Sentence Cloze Dataset for Chinese Machine Reading ComprehensionCOLING 2020 8SSR-Encoder: Encoding Selective Subject Representation for Subject-Driven GenerationCVPR 2024 1Improving the Training of Rectified FlowsarXiv 2024The Dawn of Quantum Natural Language ProcessingarXiv 2021Sequence Modeling with Multiresolution Convolutional MemoryarXiv 2023URSA: Understanding and Verifying Chain-of-thought Reasoning in Multimodal MathematicsarXiv 2025CLIP2Point: Transfer CLIP to Point Cloud Classification with Image-Depth Pre-trainingICCV 2023 1Set Functions for Time Seriesset-functions-for-time-seriesRight for the Wrong Reasons: Diagnosing Syntactic Heuristics in Natural Language Inferenceright-for-the-wrong-reasons-diagnosing-1Temporal Memory Attention for Video Semantic SegmentationarXiv 2021BEND: Benchmarking DNA Language Models on biologically meaningful tasksarXiv 2023Dirichlet Flow Matching with Applications to DNA Sequence DesignarXiv 2024SAiD: Speech-driven Blendshape Facial Animation with DiffusionarXiv 2023Mixture-of-Subspaces in Low-Rank AdaptationarXiv 2024Learning agile and dynamic motor skills for legged robotsarXiv 20194D-DRESS: A 4D Dataset of Real-world Human Clothing with Semantic AnnotationsCVPR 2024 1Sem2NeRF: Converting Single-View Semantic Masks to Neural Radiance FieldsarXiv 2022TLDR: Twin Learning for Dimensionality Reductiontldr-twin-learning-for-dimensionalitySoccerNet 2023 Challenges ResultsarXiv 2023Sibyl: Simple yet Effective Agent Framework for Complex Real-world ReasoningarXiv 2024Wavelet Latent Diffusion (Wala): Billion-Parameter 3D Generative Model with Compact Wavelet EncodingsarXiv 2024UniMuMo: Unified Text, Music and Motion GenerationarXiv 2024R-Tuning: Instructing Large Language Models to Say `I Don't Know'arXiv 2023STAR: A First-Ever Dataset and A Large-Scale Benchmark for Scene Graph Generation in Large-Size Satellite ImageryarXiv 2024GlORIE-SLAM: Globally Optimized RGB-only Implicit Encoding Point Cloud SLAMarXiv 2024MapReader: A Computer Vision Pipeline for the Semantic Exploration of Maps at ScalearXiv 2021R-SCoRe: Revisiting Scene Coordinate Regression for Robust Large-Scale Visual LocalizationCVPR 2025 1Revisiting Rotation Averaging: Uncertainties and Robust LossesCVPR 2023 1TalkToModel: Explaining Machine Learning Models with Interactive Natural Language ConversationsarXiv 2022Monotonic Differentiable Sorting Networksmonotonic-differentiable-sorting-networksAny2Point: Empowering Any-modality Large Models for Efficient 3D UnderstandingarXiv 2024Easy-to-Hard Generalization: Scalable Alignment Beyond Human SupervisionarXiv 2024ESC: Efficient Speech Coding with Cross-Scale Residual Vector Quantized
TransformersarXiv 2024Restore-RWKV: Efficient and Effective Medical Image Restoration with RWKVarXiv 2024Learning to Answer Visual Questions from Web VideosarXiv 2022Evaluating RAG-Fusion with RAGElo: an Automated Elo-based FrameworkarXiv 2024Deep Imitation Learning for Humanoid Loco-manipulation through Human
TeleoperationarXiv 2023Multi-Modal Masked Autoencoders for Medical Vision-and-Language Pre-TrainingarXiv 2022Cluster and Predict Latents Patches for Improved Masked Image ModelingarXiv 2025Theme Transformer: Symbolic Music Generation with Theme-Conditioned
TransformerarXiv 2021Bridging the Gap Between Indexing and Retrieval for Differentiable Search Index with Query GenerationarXiv 2022Theme Transformer: Symbolic Music Generation with Theme-Conditioned
TransformerarXiv 2021Mirror: A Universal Framework for Various Information Extraction TasksarXiv 2023Equivariant Similarity for Vision-Language Foundation ModelsICCV 2023 1Cross-Camera Convolutional Color ConstancyarXiv 2020FastWARC: Optimizing Large-Scale Web Archive AnalyticsarXiv 2021Image Super-Resolution with Text Prompt DiffusionarXiv 2023ICP-Flow: LiDAR Scene Flow Estimation with ICParXiv 2024With Greater Text Comes Greater Necessity: Inference-Time Training Helps Long Text GenerationarXiv 2024Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion RecognitionarXiv 2024ReliTalk: Relightable Talking Portrait Generation from a Single VideoarXiv 2023Stochastic Taylor Derivative Estimator: Efficient amortization for arbitrary differential operatorsarXiv 2024ExposureDiffusion: Learning to Expose for Low-light Image EnhancementICCV 2023 1CKConv: Continuous Kernel Convolution For Sequential Datackconv-continuous-kernel-convolution-for-1ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal ModelsarXiv 2024AIR-Bench: Benchmarking Large Audio-Language Models via Generative ComprehensionarXiv 2024CSKG: The CommonSense Knowledge GrapharXiv 2020Prompting Large Language Models to Tackle the Full Software Development Lifecycle: A Case StudyarXiv 2024On Pitfalls of Test-Time AdaptationarXiv 2023Large Language Models Meet Harry Potter: A Bilingual Dataset for Aligning Dialogue Agents with CharactersarXiv 2022PØDA: Prompt-driven Zero-shot Domain AdaptationarXiv 2022Learning Signed Distance Functions from Noisy 3D Point Clouds via Noise to Noise MappingarXiv 2023TVLT: Textless Vision-Language TransformerarXiv 2022LightGen: Efficient Image Generation through Knowledge Distillation and Direct Preference OptimizationarXiv 2025Matryoshka Multimodal ModelsarXiv 2024Gradient Matching for Domain Generalizationgradient-matching-for-domain-generalization-1Accelerating Online Mapping and Behavior Prediction via Direct BEV Feature AttentionarXiv 2024Learning to Decode Collaboratively with Multiple Language ModelsarXiv 2024Granite GuardianarXiv 2024CenterNet3D: An Anchor Free Object Detector for Point CloudarXiv 2020Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline DataarXiv 2024Debating with More Persuasive LLMs Leads to More Truthful AnswersarXiv 2024Driving with Prior Maps: Unified Vector Prior Encoding for Autonomous Vehicle MappingarXiv 2024AdaPlanner: Adaptive Planning from Feedback with Language Modelsadaplanner-adaptive-planning-from-feedbackMiniGPT-3D: Efficiently Aligning 3D Point Clouds with Large Language Models using 2D PriorsarXiv 2024PathAsst: A Generative Foundation AI Assistant Towards Artificial General Intelligence of PathologyarXiv 2023Learning Graph Embeddings for Compositional Zero-shot LearningCVPR 2021 1WangchanBERTa: Pretraining transformer-based Thai Language ModelsarXiv 2021Reasoning to Learn from Latent ThoughtsarXiv 2025InteractDiffusion: Interaction Control in Text-to-Image Diffusion ModelsCVPR 2024 1A critical look at the evaluation of GNNs under heterophily: Are we really making progress?arXiv 2023ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion RefinementarXiv 2025Sleeper Agents: Training Deceptive LLMs that Persist Through Safety TrainingarXiv 2024Adversarial Generation of Time-Frequency Features with application in audio synthesisadversarial-generation-of-time-frequency-1Performance-aware Approximation of Global Channel Pruning for Multitask CNNsarXiv 2023Advances in Embodied Navigation Using Large Language Models: A SurveyarXiv 2023OneNet: Enhancing Time Series Forecasting Models under Concept Drift by Online Ensemblingonenet-enhancing-time-series-forecastingVision Transformers are Robust LearnersarXiv 2021LLMs in the Imaginarium: Tool Learning through Simulated Trial and ErrorarXiv 2024MeshAvatar: Learning High-quality Triangular Human Avatars from Multi-view VideosarXiv 2024EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model EvaluationarXiv 2024MMLU-CF: A Contamination-free Multi-task Language Understanding BenchmarkarXiv 2024Class-incremental Novel Class DiscoveryarXiv 2022Barack's Wife Hillary: Using Knowledge-Graphs for Fact-Aware Language ModelingarXiv 2019End-to-End Full-Atom Antibody DesignarXiv 2023Weakly Supervised 3D Open-vocabulary Segmentationweakly-supervised-3d-open-vocabularyRecognize Any RegionsarXiv 2023Accelerating Transformer Inference for Translation via Parallel DecodingarXiv 2023A3VLM: Actionable Articulation-Aware Vision Language ModelarXiv 2024FCGEC: Fine-Grained Corpus for Chinese Grammatical Error CorrectionarXiv 2022PivotNet: Vectorized Pivot Learning for End-to-end HD Map ConstructionICCV 2023 1ID-Aligner: Enhancing Identity-Preserving Text-to-Image Generation with Reward Feedback LearningarXiv 2024Any-Precision LLM: Low-Cost Deployment of Multiple, Different-Sized LLMsarXiv 2024FIGR: Few-shot Image Generation with ReptilearXiv 2019Dissecting Adversarial Robustness of Multimodal LM AgentsarXiv 2024CharBERT: Character-aware Pre-trained Language ModelCOLING 2020 8DebSDF: Delving into the Details and Bias of Neural Indoor Scene ReconstructionarXiv 2023Transformers Meet Directed GraphsarXiv 2023ConvLab-3: A Flexible Dialogue System Toolkit Based on a Unified Data FormatarXiv 2022Visualizing Deep Neural Network Decisions: Prediction Difference AnalysisarXiv 2017Contrastive Search Is What You Need For Neural Text GenerationarXiv 2022Generative Visual Prompt: Unifying Distributional Control of Pre-Trained Generative ModelsarXiv 2022Semi-Supervised Low-Resource Style Transfer of Indonesian Informal to Formal Language with Iterative Forward-TranslationarXiv 2020Mesa: A Memory-saving Training Framework for TransformersarXiv 2021Bird's-Eye-View Scene Graph for Vision-Language NavigationICCV 2023 1TartanDrive: A Large-Scale Dataset for Learning Off-Road Dynamics ModelsarXiv 2022Benchmarking Zero-shot Text Classification: Datasets, Evaluation and Entailment Approachbenchmarking-zero-shot-text-classification-1Bad Actor, Good Advisor: Exploring the Role of Large Language Models in Fake News DetectionarXiv 2023FACTUAL: A Benchmark for Faithful and Consistent Textual Scene Graph ParsingarXiv 2023SUR-adapter: Enhancing Text-to-Image Pre-trained Diffusion Models with Large Language ModelsarXiv 2023The Super Weight in Large Language ModelsarXiv 2024Rethinking Transformers Pre-training for Multi-Spectral Satellite ImageryCVPR 2024 1Boundary-Guided Camouflaged Object DetectionarXiv 2022Sinkhorn Distance Minimization for Knowledge DistillationarXiv 2024MuRF: Multi-Baseline Radiance FieldsCVPR 2024 1Learning Discrete Representations via Constrained Clustering for Effective and Efficient Dense RetrievalarXiv 20213D Semantic Segmentation in the Wild: Learning Generalized Models for Adverse-Condition Point CloudsCVPR 2023 1Unsupervised Video Domain Adaptation for Action Recognition: A Disentanglement Perspectiveunsupervised-video-domain-adaptation-forData-efficient Large Vision Models through Sequential AutoregressionarXiv 2024DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot ExecutionarXiv 2024CounTR: Transformer-based Generalised Visual CountingarXiv 2022Mamba4Rec: Towards Efficient Sequential Recommendation with Selective State Space ModelsarXiv 2024Strong Baseline: Multi-UAV Tracking via YOLOv12 with BoT-SORT-ReIDarXiv 2025Swap Attention in Spatiotemporal Diffusions for Text-to-Video GenerationarXiv 2023SinDDM: A Single Image Denoising Diffusion ModelarXiv 2022Benchmarks and Challenges in Pose Estimation for Egocentric Hand Interactions with ObjectsarXiv 2024PowerNorm: Rethinking Batch Normalization in TransformersICML 2020 1Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You ThinkarXiv 2025LM-Critic: Language Models for Unsupervised Grammatical Error CorrectionEMNLP 2021 11Generalized Radiograph Representation Learning via Cross-supervision between Images and Free-text Radiology ReportsarXiv 2021An Empirical Study of Tokenization Strategies for Various Korean NLP TasksAsian Chapter of the Association for Computational Linguistics 2020Collaborative Score Distillation for Consistent Visual SynthesisarXiv 2023Revisiting Zeroth-Order Optimization for Memory-Efficient LLM Fine-Tuning: A BenchmarkarXiv 2024Inspecting and Editing Knowledge Representations in Language ModelsarXiv 2023Opening up ChatGPT: Tracking openness, transparency, and accountability in instruction-tuned text generatorsarXiv 2023Fira: Can We Achieve Full-rank Training of LLMs Under Low-rank Constraint?arXiv 2024DNABERT-S: Pioneering Species Differentiation with Species-Aware DNA EmbeddingsarXiv 2024COCO-LM: Correcting and Contrasting Text Sequences for Language Model PretrainingNeurIPS 2021 12NUDT4MSTAR: A Large Dataset and Benchmark Towards Remote Sensing Object Recognition in the WildarXiv 2025RoboEXP: Action-Conditioned Scene Graph via Interactive Exploration for Robotic ManipulationarXiv 2024RealCompo: Balancing Realism and Compositionality Improves Text-to-Image Diffusion ModelsarXiv 2024MS-DETR: Efficient DETR Training with Mixed SupervisionCVPR 2024 1Referring Camouflaged Object DetectionarXiv 2023TorMentor: Deterministic dynamic-path, data augmentations with fractalsarXiv 2022RACECAR -- The Dataset for High-Speed Autonomous RacingarXiv 2023Star-Searcher: A Complete and Efficient Aerial System for Autonomous
Target Search in Complex Unknown EnvironmentsarXiv 2024PDMX: A Large-Scale Public Domain MusicXML Dataset for Symbolic Music ProcessingarXiv 2024M2TR: Multi-modal Multi-scale Transformers for Deepfake DetectionarXiv 2021Learning to Generate Text-grounded Mask for Open-world Semantic Segmentation from Only Image-Text PairsCVPR 2023 1Exploring Collaboration Mechanisms for LLM Agents: A Social Psychology ViewarXiv 2023SustainBench: Benchmarks for Monitoring the Sustainable Development Goals with Machine LearningarXiv 2021QED: A Framework and Dataset for Explanations in Question AnsweringarXiv 2020Auto White-Balance Correction for Mixed-Illuminant ScenesarXiv 2021DART-Math: Difficulty-Aware Rejection Tuning for Mathematical Problem-Solvingdart-math-difficulty-aware-rejection-tuningFLAME: Free-form Language-based Motion Synthesis & EditingarXiv 2022MultiBooth: Towards Generating All Your Concepts in an Image from TextarXiv 2024Digi-Q: Learning Q-Value Functions for Training Device-Control AgentsarXiv 2025Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D PolicyarXiv 2024SATO: Stable Text-to-Motion FrameworkarXiv 2024Quantune: Post-training Quantization of Convolutional Neural Networks using Extreme Gradient Boosting for Fast DeploymentarXiv 2022BEANS: The Benchmark of Animal SoundsarXiv 2022DExperts: Decoding-Time Controlled Text Generation with Experts and Anti-ExpertsACL 2021 5CoVR-2: Automatic Data Construction for Composed Video RetrievalarXiv 2023MindBridge: A Cross-Subject Brain Decoding FrameworkCVPR 2024 1MQuAKE: Assessing Knowledge Editing in Language Models via Multi-Hop QuestionsarXiv 2023Execution-based Code Generation using Deep Reinforcement LearningarXiv 2023LLoCO: Learning Long Contexts OfflinearXiv 2024A Distributional Approach to Controlled Text Generationa-distributional-approach-to-controlled-textUniDistill: A Universal Cross-Modality Knowledge Distillation Framework for 3D Object Detection in Bird's-Eye ViewCVPR 2023 1Yo'LLaVA: Your Personalized Language and Vision AssistantarXiv 2024Agent Instructs Large Language Models to be General Zero-Shot ReasonersarXiv 2023RNA Secondary Structure Prediction By Learning Unrolled AlgorithmsICLR 2020 1Many Heads Are Better Than One: Improved Scientific Idea Generation by A LLM-Based Multi-Agent SystemarXiv 2024CENet: Toward Concise and Efficient LiDAR Semantic Segmentation for Autonomous DrivingarXiv 2022FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language ModelsarXiv 2023XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language ModelsarXiv 2023Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially FastarXiv 2024Watermarking Images in Self-Supervised Latent SpacesarXiv 2021Mean-Shifted Contrastive Loss for Anomaly Detectionmean-shifted-contrastive-loss-for-anomaly-1Improved Online Conformal Prediction via Strongly Adaptive Online LearningarXiv 2023Unsupervised Prompt Learning for Vision-Language ModelsarXiv 2022Reinforcement Learning on Web Interfaces Using Workflow-Guided Explorationreinforcement-learning-on-web-interfaces-1Vertebra-Focused Landmark Detection for Scoliosis AssessmentarXiv 2020Simple synthetic data reduces sycophancy in large language modelsarXiv 2023Re-IQA: Unsupervised Learning for Image Quality Assessment in the WildCVPR 2023 1EASY: Ensemble Augmented-Shot Y-shaped Learning: State-Of-The-Art Few-Shot Classification with Simple IngredientsarXiv 2022PixelSynth: Generating a 3D-Consistent Experience from a Single ImageICCV 2021 10HiCMAE: Hierarchical Contrastive Masked Autoencoder for Self-Supervised Audio-Visual Emotion RecognitionarXiv 2024