0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

TIMotion: Temporal and Interactive Framework for Efficient Human-Human Motion GenerationCVPR 2025 1CityGPT: Empowering Urban Spatial Cognition of Large Language ModelsarXiv 2024Masked Motion Encoding for Self-Supervised Video Representation LearningCVPR 2023 1Music FaderNets: Controllable Music Generation Based On High-Level Features via Low-Level Feature ModellingarXiv 2020Preference Leakage: A Contamination Problem in LLM-as-a-judgearXiv 2025Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal ModelsarXiv 2024Aligning to Thousands of Preferences via System Message GeneralizationarXiv 2024Scaling Smart: Accelerating Large Language Model Pre-training with Small Model InitializationarXiv 2024Adaptive Human Matting for Dynamic VideosCVPR 2023 1Fast Best-of-N Decoding via Speculative RejectionarXiv 2024Direct Multi-Turn Preference Optimization for Language AgentsarXiv 2024StoryBench: A Multifaceted Benchmark for Continuous Story Visualizationstorybench-a-multifaceted-benchmark-forMixture-of-Domain-Adapters: Decoupling and Injecting Domain Knowledge to Pre-trained Language Models MemoriesarXiv 2023Active Generalized Category DiscoveryCVPR 2024 1Scruples: A Corpus of Community Ethical Judgments on 32,000 Real-Life AnecdotesarXiv 20203D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less HallucinationCVPR 2025 1E-SQL: Direct Schema Linking via Question Enrichment in Text-to-SQLarXiv 2024MG-Verilog: Multi-grained Dataset Towards Enhanced LLM-assisted Verilog GenerationarXiv 2024Large Language Models Must Be Taught to Know What They Don't KnowarXiv 2024Towards Aligned Layout Generation via Diffusion Model with Aesthetic ConstraintsarXiv 2024Rethinking Graph Neural Architecture Search from Message-passingCVPR 2021 1Self-Training with Direct Preference Optimization Improves Chain-of-Thought ReasoningarXiv 2024PersonaRAG: Enhancing Retrieval-Augmented Generation Systems with User-Centric AgentsarXiv 2024XTREME-UP: A User-Centric Scarce-Data Benchmark for Under-Represented LanguagesarXiv 2023Initialization using Update Approximation is a Silver Bullet for Extremely Efficient Low-Rank Fine-TuningarXiv 2024Efficient Evolutionary Search Over Chemical Space with Large Language ModelsarXiv 2024FORA: Fast-Forward Caching in Diffusion Transformer AccelerationarXiv 2024Seismic Arrival-time Picking on Distributed Acoustic Sensing Data using Semi-supervised LearningarXiv 2023From Exploration to Mastery: Enabling LLMs to Master Tools via Self-Driven InteractionsarXiv 2024KoLA: Carefully Benchmarking World Knowledge of Large Language ModelsarXiv 2023Too Large; Data Reduction for Vision-Language Pre-TrainingICCV 2023 1BioBART: Pretraining and Evaluation of A Biomedical Generative Language ModelBioNLP (ACL) 2022 5Adapting Language Models for Zero-shot Learning by Meta-tuning on Dataset and Prompt CollectionsFindings (EMNLP) 2021 11mdCATH: A Large-Scale MD Dataset for Data-Driven Computational BiophysicsarXiv 2024Spectra: Surprising Effectiveness of Pretraining Ternary Language Models at ScalearXiv 2024InterFormer: Real-time Interactive Image SegmentationICCV 2023 1DiffCut: Catalyzing Zero-Shot Semantic Segmentation with Diffusion Features and Recursive Normalized CutarXiv 2024DiverGen: Improving Instance Segmentation by Learning Wider Data Distribution with More Diverse Generative DataCVPR 2024 1VLSBench: Unveiling Visual Leakage in Multimodal SafetyarXiv 2024AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous DrivingarXiv 2024BioCoder: A Benchmark for Bioinformatics Code Generation with Large Language ModelsarXiv 2023VL-PET: Vision-and-Language Parameter-Efficient Tuning via Granularity ControlICCV 2023 1Describing a Knowledge Basedescribing-a-knowledge-base-1Scaling MLPs: A Tale of Inductive Biasscaling-mlps-a-tale-of-inductive-biasDual Associated Encoder for Face RestorationarXiv 2023A Generalized Language Model as the Combination of Skipped n-grams and Modified Kneser-Ney SmoothingarXiv 2014RAG-QA Arena: Evaluating Domain Robustness for Long-form Retrieval Augmented Question AnsweringarXiv 2024LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPTarXiv 2023BAD: Bidirectional Auto-regressive Diffusion for Text-to-Motion GenerationarXiv 2024DsDm: Model-Aware Dataset Selection with DatamodelsarXiv 2024MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model EvaluationarXiv 2023Masked Motion Predictors are Strong 3D Action Representation LearnersICCV 2023 1Sinkformers: Transformers with Doubly Stochastic AttentionarXiv 2021Towards 3D Molecule-Text Interpretation in Language ModelsarXiv 2024DinoSR: Self-Distillation and Online Clustering for Self-supervised Speech Representation Learningdinosr-self-distillation-and-onlineAugmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question AnsweringCVPR 2025 1CuNeRF: Cube-Based Neural Radiance Field for Zero-Shot Medical Image Arbitrary-Scale Super ResolutionICCV 2023 1EmoFace: Audio-driven Emotional 3D Face AnimationarXiv 2024Compressing Features for Learning with Noisy LabelsarXiv 2022DriVLMe: Enhancing LLM-based Autonomous Driving Agents with Embodied and Social ExperiencesarXiv 2024Natural SQL: Making SQL Easier to Infer from Natural Language SpecificationsFindings (EMNLP) 2021 11LLMCarbon: Modeling the end-to-end Carbon Footprint of Large Language ModelsarXiv 2023AgentArk: Distilling Multi-Agent Intelligence into a Single LLM AgentarXiv 2026HalluciDoctor: Mitigating Hallucinatory Toxicity in Visual Instruction DataCVPR 2024 1Hardware-Aware Parallel Prompt Decoding for Memory-Efficient Acceleration of LLM InferencearXiv 2024Hierarchical Sketch Induction for Paraphrase GenerationACL 2022 5FIND: A Function Description Benchmark for Evaluating Interpretability Methodsfind-a-function-description-benchmark-forEmpowering Large Language Models to Set up a Knowledge Retrieval Indexer via Self-LearningarXiv 2024Personality Alignment of Large Language ModelsarXiv 2024Realistic Full-Body Tracking from Sparse Observations via Joint-Level ModelingICCV 2023 1The Alzheimer's Disease Prediction Of Longitudinal Evolution (TADPOLE) Challenge: Results after 1 Year Follow-uparXiv 2020HumanRefiner: Benchmarking Abnormal Human Generation and Refining with Coarse-to-fine Pose-Reversible GuidancearXiv 2024IndicVoices-R: Unlocking a Massive Multilingual Multi-speaker Speech Corpus for Scaling Indian TTSarXiv 2024TarViS: A Unified Approach for Target-based Video SegmentationCVPR 2023 1SKFlow: Learning Optical Flow with Super KernelsarXiv 2022Large-Scale Data Selection for Instruction TuningarXiv 2025What is More Likely to Happen Next? Video-and-Language Future Event PredictionEMNLP 2020 11Hyper-3DG: Text-to-3D Gaussian Generation via HypergrapharXiv 2024Using the Tsetlin Machine to Learn Human-Interpretable Rules for High-Accuracy Text Categorization with Medical ApplicationsarXiv 2018Layout and Task Aware Instruction Prompt for Zero-shot Document Image Question AnsweringarXiv 2023PromptReps: Prompting Large Language Models to Generate Dense and Sparse Representations for Zero-Shot Document RetrievalarXiv 2024ScanTalk: 3D Talking Heads from Unregistered ScansarXiv 2024Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM ReasoningarXiv 2024Localizing Task Information for Improved Model Merging and CompressionarXiv 2024Ewald-based Long-Range Message Passing for Molecular GraphsarXiv 2023Lagrangian PINNs: A causality-conforming solution to failure modes of physics-informed neural networksarXiv 2022VoxAct-B: Voxel-Based Acting and Stabilizing Policy for Bimanual ManipulationarXiv 2024Local-Prompt: Extensible Local Prompts for Few-Shot Out-of-Distribution DetectionarXiv 2024PADA: Example-based Prompt Learning for on-the-fly Adaptation to Unseen DomainsarXiv 2021IndicBART: A Pre-trained Model for Indic Natural Language Generationindicbart-a-pre-trained-model-for-indic-1Emergent Analogical Reasoning in Large Language ModelsarXiv 2022Non-Autoregressive Predictive Coding for Learning Speech Representations from Local DependenciesarXiv 2020AutoLink: Self-supervised Learning of Human Skeletons and Object Outlines by Linking KeypointsarXiv 2022Natural Attack for Pre-trained Models of CodearXiv 2022Collaborative Transformers for Grounded Situation RecognitionCVPR 2022 1Learning Layout and Style Reconfigurable GANs for Controllable Image SynthesisarXiv 2020Unleashing the Potential of the Diffusion Model in Few-shot Semantic SegmentationarXiv 2024Self-Explore: Enhancing Mathematical Reasoning in Language Models with Fine-grained RewardsarXiv 2024I^2R-Net: Intra- and Inter-Human Relation Network for Multi-Person Pose EstimationarXiv 2022AixBench: A Code Generation Benchmark DatasetarXiv 2022Synchronize Dual Hands for Physics-Based Dexterous Guitar PlayingarXiv 2024A Game-Theoretic Framework for Joint Forecasting and PlanningarXiv 2023Multi-View Azimuth Stereo via Tangent Space ConsistencyCVPR 2023 1Self-Supervised Prototypical Transfer Learning for Few-Shot ClassificationarXiv 2020BayesCap: Bayesian Identity Cap for Calibrated Uncertainty in Frozen Neural NetworksarXiv 2022PolarFree: Polarization-based Reflection-free ImagingCVPR 2025 1RDesign: Hierarchical Data-efficient Representation Learning for Tertiary Structure-based RNA DesignarXiv 2023Accurate and Fast Compressed Video CaptioningICCV 2023 1InstructMol: Multi-Modal Integration for Building a Versatile and Reliable Molecular Assistant in Drug DiscoveryarXiv 2023Learning the Distribution of Errors in Stereo Matching for Joint Disparity and Uncertainty EstimationCVPR 2023 1FinCon: A Synthesized LLM Multi-Agent System with Conceptual Verbal Reinforcement for Enhanced Financial Decision MakingarXiv 2024Tool-Augmented Reward ModelingarXiv 2023Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Promptinglanguage-models-don-t-always-say-what-theyMrT5: Dynamic Token Merging for Efficient Byte-level Language ModelsarXiv 2024BERT-QE: Contextualized Query Expansion for Document Re-rankingFindings of the Association for Computational Linguistics 2020Understanding Long Videos with Multimodal Language ModelsarXiv 2024CXR-LLAVA: a multimodal large language model for interpreting chest X-ray imagesarXiv 2023Benchmarking Attribution Methods with Relative Feature ImportancearXiv 2019GyroFlow: Gyroscope-Guided Unsupervised Optical Flow LearningICCV 2021 10Mixture of Attention Heads: Selecting Attention Heads Per TokenarXiv 2022LLM-R2: A Large Language Model Enhanced Rule-based Rewrite System for Boosting Query EfficiencyarXiv 2024Controllable Visual-Tactile SynthesisICCV 2023 1Align on the Fly: Adapting Chatbot Behavior to Established NormsarXiv 2023Task-Specific Skill Localization in Fine-tuned Language ModelsarXiv 2023SafeRAG: Benchmarking Security in Retrieval-Augmented Generation of Large Language ModelarXiv 2025Accelerating Transformers with Spectrum-Preserving Token Mergingaccelerating-transformers-with-spectrumDomainDrop: Suppressing Domain-Sensitive Channels for Domain GeneralizationICCV 2023 1Open-Vocabulary Online Semantic Mapping for SLAMarXiv 2024OUTFOX: LLM-Generated Essay Detection Through In-Context Learning with Adversarially Generated ExamplesarXiv 2023Modifying Large Language Model Post-Training for Diverse Creative WritingarXiv 2025Binarized Diffusion Model for Image Super-ResolutionarXiv 2024StableMoE: Stable Routing Strategy for Mixture of ExpertsACL 2022 5Generalization in diffusion models arises from geometry-adaptive harmonic representationsarXiv 2023mbrs: A Library for Minimum Bayes Risk DecodingarXiv 2024$β$-DPO: Direct Preference Optimization with Dynamic $β$arXiv 2024Meta-DT: Offline Meta-RL as Conditional Sequence Modeling with World Model DisentanglementarXiv 2024Doodle Your 3D: From Abstract Freehand Sketches to Precise 3D ShapesCVPR 2024 1Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language ModelsarXiv 2024Safety Verification of Deep Neural NetworksarXiv 2016MMAD: Multi-label Micro-Action Detection in VideosICCV 2025OpenMEVA: A Benchmark for Evaluating Open-ended Story Generation MetricsACL 2021 5DeepSportradar-v1: Computer Vision Dataset for Sports Understanding with High Quality AnnotationsarXiv 2022VisIT-Bench: A Benchmark for Vision-Language Instruction Following Inspired by Real-World UsearXiv 2023MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language ModelsarXiv 2024The CAMELS project: Cosmology and Astrophysics with MachinE Learning SimulationsarXiv 2020Video Test-Time Adaptation for Action RecognitionCVPR 2023 1VCNet: A Robust Approach to Blind Image InpaintingECCV 2020 8CustomCrafter: Customized Video Generation with Preserving Motion and Concept Composition AbilitiesarXiv 2024Efficient Crowd Counting via Structured Knowledge TransferarXiv 2020xView3-SAR: Detecting Dark Fishing Activity Using Synthetic Aperture Radar ImageryarXiv 2022AutoManual: Constructing Instruction Manuals by LLM Agents via Interactive Environmental LearningarXiv 2024Verify-and-Edit: A Knowledge-Enhanced Chain-of-Thought FrameworkarXiv 2023Three Bricks to Consolidate Watermarks for Large Language ModelsarXiv 2023LSDNet: Trainable Modification of LSD Algorithm for Real-Time Line Segment DetectionarXiv 2022ELFNet: Evidential Local-global Fusion for Stereo MatchingICCV 2023 1Powerful and Flexible: Personalized Text-to-Image Generation via Reinforcement LearningarXiv 2024Knowledge Graph Augmented Network Towards Multiview Representation Learning for Aspect-based Sentiment AnalysisarXiv 2022Bi-LRFusion: Bi-Directional LiDAR-Radar Fusion for 3D Dynamic Object Detectionbi-lrfusion-bi-directional-lidar-radar-fusionAlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable RewardarXiv 2026Can Large Language Models Understand Real-World Complex Instructions?arXiv 2023Outlier Suppression+: Accurate quantization of large language models by equivalent and optimal shifting and scalingarXiv 2023WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model BenchmarkarXiv 2024SBCFormer: Lightweight Network Capable of Full-size ImageNet Classification at 1 FPS on Single Board ComputersarXiv 2023K-MHaS: A Multi-label Hate Speech Detection Dataset in Korean Online News CommentCOLING 2022 10Montessori-Instruct: Generate Influential Training Data Tailored for Student LearningarXiv 2024Domain Adversarial Spatial-Temporal Network: A Transferable Framework for Short-term Traffic Forecasting across CitiesarXiv 2022TVConv: Efficient Translation Variant Convolution for Layout-aware Visual ProcessingCVPR 2022 1A Diverse Corpus for Evaluating and Developing English Math Word Problem Solversa-diverse-corpus-for-evaluating-andPrimeDepth: Efficient Monocular Depth Estimation with a Stable Diffusion PreimagearXiv 2024Clinical Camel: An Open Expert-Level Medical Language Model with Dialogue-Based Knowledge EncodingarXiv 2023Fine-tuned In-Context Learning Transformers are Excellent Tabular Data ClassifiersarXiv 2024Codev-Bench: How Do LLMs Understand Developer-Centric Code Completion?arXiv 2024Attention Back-end for Automatic Speaker Verification with Multiple Enrollment UtterancesarXiv 2021Re-Align: Aligning Vision Language Models via Retrieval-Augmented Direct Preference OptimizationarXiv 2025AutoPEFT: Automatic Configuration Search for Parameter-Efficient Fine-TuningarXiv 2023KNEEL: Knee Anatomical Landmark Localization Using Hourglass NetworksarXiv 2019Synthesize, Diagnose, and Optimize: Towards Fine-Grained Vision-Language UnderstandingarXiv 2023TIM: A Time Interval Machine for Audio-Visual Action RecognitionCVPR 2024 1MidasTouch: Monte-Carlo inference over distributions across sliding toucharXiv 2022CDLM: Cross-Document Language ModelingFindings (EMNLP) 2021 11Hierarchical Modular Network for Video CaptioningCVPR 2022 1Self-supervised Video Representation Learning by Uncovering Spatio-temporal StatisticsarXiv 2020ScaleLong: Towards More Stable Training of Diffusion Model via Scaling Network Long Skip Connectionscalelong-towards-more-stable-training-ofDynamic Sparse No Training: Training-Free Fine-tuning for Sparse LLMsarXiv 2023GIFD: A Generative Gradient Inversion Method with Feature Domain OptimizationICCV 2023 1Retrieval-Augmented Generation-based Relation ExtractionarXiv 2024COCO-DR: Combating Distribution Shifts in Zero-Shot Dense Retrieval with Contrastive and Distributionally Robust LearningarXiv 2022Entropy-based Attention Regularization Frees Unintended Bias Mitigation from ListsFindings (ACL) 2022 5How Much Temporal Long-Term Context is Needed for Action Segmentation?ICCV 2023 1Learning Distortion Invariant Representation for Image Restoration from A Causality PerspectiveCVPR 2023 1Deep Fusion Transformer Network with Weighted Vector-Wise Keypoints Voting for Robust 6D Object Pose EstimationICCV 2023 1VI-Net: Boosting Category-level 6D Object Pose Estimation via Learning Decoupled Rotations on the Spherical RepresentationsICCV 2023 1Defensive Unlearning with Adversarial Training for Robust Concept Erasure in Diffusion ModelsarXiv 2024GarmentTracking: Category-Level Garment Pose TrackingCVPR 2023 1RangeUDF: Semantic Surface Reconstruction from 3D Point CloudsarXiv 2022LLM-FE: Automated Feature Engineering for Tabular Data with LLMs as Evolutionary OptimizersarXiv 2025USR: An Unsupervised and Reference Free Evaluation Metric for Dialog Generationusr-an-unsupervised-and-reference-free-1PISA Experiments: Exploring Physics Post-Training for Video Diffusion Models by Watching Stuff DroparXiv 2025MusiLingo: Bridging Music and Text with Pre-trained Language Models for Music Captioning and Query ResponsearXiv 2023Neural Common Neighbor with Completion for Link PredictionarXiv 2023

Back to Papers