All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Divide and Translate: Compositional First-Order Logic Translation and
Verification for Complex Logical ReasoningarXiv 2024Mitigating Adversarial Vulnerability through Causal Parameter Estimation by Adversarial Double Machine LearningICCV 2023 1Memory-Efficient LLM Training with Online Subspace DescentarXiv 2024Fast Sampling of Diffusion Models via Operator LearningarXiv 2022Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image SequencesarXiv 2024Canary in a Coalmine: Better Membership Inference with Ensembled Adversarial QueriesarXiv 2022Breaking the Curse of Dimensionality: Diffusion Models Efficiently Learn Low-Dimensional DistributionsarXiv 2024Are Large Language Models Good Statisticians?arXiv 2024Spatio-temporal Prompting Network for Robust Video Feature Extractionspatio-temporal-prompting-network-for-robustHuman-centric Scene Understanding for 3D Large-scale Scenarioshuman-centric-scene-understanding-for-3dCan Large Language Models Analyze Graphs like Professionals? A Benchmark, Datasets and ModelsarXiv 2024EgoExo-Fitness: Towards Egocentric and Exocentric Full-Body Action UnderstandingarXiv 2024Difference-aware Knowledge Selection for Knowledge-grounded Conversation GenerationFindings of the Association for Computational Linguistics 2020Empowering Large Language Model Agents through Action LearningarXiv 2024ReCLAP: Improving Zero Shot Audio Classification by Describing SoundsarXiv 2024Are AI-Generated Text Detectors Robust to Adversarial Perturbations?arXiv 2024Exploring Diffusion Time-steps for Unsupervised Representation LearningarXiv 2024Creativity Inspired Zero-Shot Learningcreativity-inspired-zero-shot-learning-1AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video UnderstandingarXiv 2024CRAFT Your Dataset: Task-Specific Synthetic Dataset Generation Through Corpus Retrieval and AugmentationarXiv 2024UPL-SFDA: Uncertainty-aware Pseudo Label Guided Source-Free Domain Adaptation for Medical Image SegmentationarXiv 2023Tele-Knowledge Pre-training for Fault AnalysisarXiv 2022One Prompt is not Enough: Automated Construction of a Mixture-of-Expert PromptsarXiv 2024Reframing Human-AI Collaboration for Generating Free-Text ExplanationsNAACL 2022 7ECTSum: A New Benchmark Dataset For Bullet Point Summarization of Long Earnings Call TranscriptsarXiv 2022Latxa: An Open Language Model and Evaluation Suite for BasquearXiv 2024Finding Blind Spots in Evaluator LLMs with Interpretable ChecklistsarXiv 2024Revisiting Depth Completion from a Stereo Matching Perspective for Cross-domain GeneralizationarXiv 2023FineTuneBench: How well do commercial fine-tuning APIs infuse knowledge into LLMs?arXiv 2024DRew: Dynamically Rewired Message Passing with DelayarXiv 2023Geometric Trajectory Diffusion ModelsarXiv 2024Key-value memory in the brainarXiv 2025Hyperspectral Image Super-Resolution with Spectral Mixup and Heterogeneous DatasetsarXiv 2021Prefix tuning for automated audio captioningarXiv 2023Weakly Supervised Video Representation Learning with Unaligned Text for Sequential VideosCVPR 2023 1Modulation Extraction for LFO-driven Audio EffectsarXiv 2023Teacher Forcing Recovers Reward Functions for Text GenerationarXiv 2022MindMerger: Efficient Boosting LLM Reasoning in non-English LanguagesarXiv 2024RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-FoldarXiv 2024RPEFlow: Multimodal Fusion of RGB-PointCloud-Event for Joint Optical Flow and Scene Flow EstimationICCV 2023 1Learning From Correctness Without Prompting Makes LLM Efficient ReasonerarXiv 2024VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded TextarXiv 2024MSTRE-Net: Multistreaming Acoustic Modeling for Automatic Lyrics TranscriptionarXiv 2021Found in the Middle: How Language Models Use Long Contexts Better via Plug-and-Play Positional EncodingarXiv 2024CATS: Contextually-Aware Thresholding for Sparsity in Large Language ModelsarXiv 2024Distilled Dual-Encoder Model for Vision-Language UnderstandingarXiv 2021Dataset Reset Policy Optimization for RLHFarXiv 2024NASRec: Weight Sharing Neural Architecture Search for Recommender SystemsarXiv 2022Evaluating the Logical Reasoning Ability of ChatGPT and GPT-4arXiv 2023TIGERScore: Towards Building Explainable Metric for All Text Generation TasksarXiv 2023CAB: Comprehensive Attention Benchmarking on Long Sequence ModelingarXiv 2022Finding Moments in Video Collections Using Natural LanguagearXiv 2019LiNeS: Post-training Layer Scaling Prevents Forgetting and Enhances Model MergingarXiv 2024Efficient Integrators for Diffusion Generative ModelsarXiv 2023Interpretable Explanations of Black Boxes by Meaningful Perturbationinterpretable-explanations-of-black-boxes-by-1Why is Winoground Hard? Investigating Failures in Visuolinguistic CompositionalityarXiv 2022Few-shot Fine-tuning vs. In-context Learning: A Fair Comparison and EvaluationarXiv 2023RaVL: Discovering and Mitigating Spurious Correlations in Fine-Tuned Vision-Language ModelsarXiv 2024GraPPa: Grammar-Augmented Pre-Training for Table Semantic ParsingarXiv 2020Hyperbolic Geometric Latent Diffusion Model for Graph GenerationarXiv 2024VLG-Net: Video-Language Graph Matching Network for Video GroundingarXiv 2020L+M-24: Building a Dataset for Language + Molecules @ ACL 2024arXiv 2024LongHeads: Multi-Head Attention is Secretly a Long Context ProcessorarXiv 2024Tailor: Generating and Perturbing Text with Semantic ControlsACL 2022 5GECTurk: Grammatical Error Correction and Detection Dataset for TurkisharXiv 2023PETCI: A Parallel English Translation Dataset of Chinese IdiomsarXiv 2022MultiMath: Bridging Visual and Mathematical Reasoning for Large Language ModelsarXiv 2024GibbsDDRM: A Partially Collapsed Gibbs Sampler for Solving Blind Inverse Problems with Denoising Diffusion RestorationarXiv 2023Selective Residual M-Net for Real Image DenoisingarXiv 2022Model Composition for Multimodal Large Language ModelsarXiv 2024Improving Few-Shot Generalization by Exploring and Exploiting Auxiliary Dataimproving-few-shot-generalization-byNERetrieve: Dataset for Next Generation Named Entity Recognition and RetrievalarXiv 2023Learning Chinese Word Representations From Glyphs Of Characterslearning-chinese-word-representations-from-1Improving Large Language Models in Event Relation Logical PredictionarXiv 2023Bridging the Data Gap between Training and Inference for Unsupervised Neural Machine TranslationACL 2022 5Back to 3D: Few-Shot 3D Keypoint Detection with Back-Projected 2D FeaturesCVPR 2024 1Is Bigger and Deeper Always Better? Probing LLaMA Across Scales and LayersarXiv 2023Point-JEPA: A Joint Embedding Predictive Architecture for Self-Supervised Learning on Point CloudarXiv 2024Explaining Time Series via Contrastive and Locally Sparse PerturbationsarXiv 2024Generative Dense Retrieval: Memory Can Be a BurdenarXiv 2024Replication in Visual Diffusion Models: A Survey and OutlookarXiv 2024TroVE: Inducing Verifiable and Efficient Toolboxes for Solving Programmatic TasksarXiv 2024Aioli: A Unified Optimization Framework for Language Model Data MixingarXiv 2024DetectLLM: Leveraging Log Rank Information for Zero-Shot Detection of Machine-Generated TextarXiv 2023The Need for Speed: Pruning Transformers with One RecipearXiv 2024AutoDroid-V2: Boosting SLM-based GUI Agents via Code GenerationarXiv 2024BiPer: Binary Neural Networks using a Periodic FunctionCVPR 2024 1Diverse Weight Averaging for Out-of-Distribution GeneralizationarXiv 2022Copula Conformal Prediction for Multi-step Time Series ForecastingarXiv 2022GridFormer: Point-Grid Transformer for Surface ReconstructionarXiv 2024PreNAS: Preferred One-Shot Learning Towards Efficient Neural
Architecture SearcharXiv 2023Heterogeneous Graph Contrastive Learning with Meta-path Contexts and Adaptively Weighted Negative SamplesarXiv 2022CokeBERT: Contextual Knowledge Selection and Embedding towards Enhanced Pre-Trained Language ModelsarXiv 2020ValUES: A Framework for Systematic Validation of Uncertainty Estimation in Semantic SegmentationarXiv 2024REAP: A Large-Scale Realistic Adversarial Patch BenchmarkICCV 2023 1Sparse Training via Boosting Pruning Plasticity with Neuroregenerationsparse-training-via-boosting-pruning-1RobustNav: Towards Benchmarking Robustness in Embodied NavigationICCV 2021 10Continuous Speculative Decoding for Autoregressive Image GenerationarXiv 2024DivClust: Controlling Diversity in Deep ClusteringCVPR 2023 1One Perturbation is Enough: On Generating Universal Adversarial Perturbations against Vision-Language Pre-training ModelsICCV 2025Temporally Aligned Audio for Video with AutoregressionarXiv 2024Interpreting Low-level Vision Models with Causal Effect MapsarXiv 2024Complex Temporal Question Answering on Knowledge GraphsarXiv 2021Attentive Mimicking: Better Word Embeddings by Attending to Informative Contextsattentive-mimicking-better-word-embeddings-by-1Generating Hierarchical Explanations on Text Classification via Feature Interaction Detectiongenerating-hierarchical-explanations-on-text-1WANLI: Worker and AI Collaboration for Natural Language Inference Dataset CreationarXiv 2022SC2 Benchmark: Supervised Compression for Split ComputingarXiv 2022DeFTAN-II: Efficient Multichannel Speech Enhancement with Subgroup ProcessingarXiv 2023Neural Networks Fail to Learn Periodic Functions and How to Fix ItNeurIPS 2020 12CoTKR: Chain-of-Thought Enhanced Knowledge Rewriting for Complex Knowledge Graph Question AnsweringarXiv 2024Curriculum-based Asymmetric Multi-task Reinforcement LearningarXiv 2022PROSE: Predicting Operators and Symbolic Expressions using Multimodal TransformersarXiv 20233DMIT: 3D Multi-modal Instruction Tuning for Scene UnderstandingarXiv 2024MG-MotionLLM: A Unified Framework for Motion Comprehension and Generation across Multiple GranularitiesCVPR 2025 1Designing a Dashboard for Transparency and Control of Conversational AIarXiv 2024BiMediX: Bilingual Medical Mixture of Experts LLMarXiv 2024Group channel pruning and spatial attention distilling for object detectionarXiv 2023Correlational Image Modeling for Self-Supervised Visual Pre-TrainingCVPR 2023 1Planning Anything with Rigor: General-Purpose Zero-Shot Planning with LLM-based Formalized ProgrammingarXiv 2024Text-to-Image Diffusion Models can be Easily Backdoored through Multimodal Data PoisoningarXiv 2023Gendered Ambiguous Pronouns Shared Task: Boosting Model Confidence by Evidence PoolingarXiv 2019Multi-resolution Time-Series Transformer for Long-term ForecastingarXiv 2023MLLMs-Augmented Visual-Language Representation LearningarXiv 2023Interpretable Unified Language CheckingarXiv 2023Universal Neurons in GPT2 Language ModelsarXiv 2024Probabilistic Inference in Language Models via Twisted Sequential Monte CarloarXiv 2024TofuEval: Evaluating Hallucinations of LLMs on Topic-Focused Dialogue SummarizationarXiv 2024ZEN 2.0: Continue Training and Adaption for N-gram Enhanced Text EncodersarXiv 2021Finding Inductive Loop Invariants using Large Language ModelsarXiv 2023Upcycling Models under Domain and Category ShiftCVPR 2023 1Think, Act, and Ask: Open-World Interactive Personalized Robot NavigationarXiv 2023MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device ControlarXiv 2024The Third DIHARD Diarization ChallengearXiv 2020GeoLM: Empowering Language Models for Geospatially Grounded Language UnderstandingarXiv 2023TMA: Temporal Motion Aggregation for Event-based Optical FlowICCV 2023 1Rethinking Nearest Neighbors for Visual ClassificationarXiv 2021Evaluating the Moral Beliefs Encoded in LLMsevaluating-the-moral-beliefs-encoded-in-llmsLearning to Discretize Denoising Diffusion ODEsarXiv 2024MovieNet-PS: A Large-Scale Person Search Dataset in the WildarXiv 2021Self-Polish: Enhance Reasoning in Large Language Models via Problem RefinementarXiv 2023A Dataset Perspective on Offline Reinforcement LearningarXiv 2021Do Generated Data Always Help Contrastive Learning?arXiv 2024FineMedLM-o1: Enhancing the Medical Reasoning Ability of LLM from Supervised Fine-Tuning to Test-Time TrainingarXiv 2025Explore, Establish, Exploit: Red Teaming Language Models from ScratcharXiv 2023Objects do not disappear: Video object detection by single-frame object location anticipationICCV 2023 1Denoising MCMC for Accelerating Diffusion-Based Generative ModelsarXiv 2022Unlocking Deterministic Robustness Certification on ImageNetunlocking-deterministic-robustnessExploring the Universal Vulnerability of Prompt-based Learning ParadigmFindings (NAACL) 2022 7Robustness of Graph Neural Networks at ScaleNeurIPS 2021 12Fidelity-Controllable Extreme Image Compression with Generative Adversarial NetworksarXiv 2020On the Evaluation Metrics for Paraphrase GenerationarXiv 2022CATR: Combinatorial-Dependence Audio-Queried Transformer for Audio-Visual Video SegmentationarXiv 2023INSTRUCTIR: A Benchmark for Instruction Following of Information Retrieval ModelsarXiv 2024NSP-BERT: A Prompt-based Few-Shot Learner Through an Original Pre-training Task--Next Sentence PredictionarXiv 2021Answer is All You Need: Instruction-following Text Embedding via Answering the QuestionarXiv 2024LLamol: A Dynamic Multi-Conditional Generative Transformer for De Novo Molecular DesignarXiv 2023AfriQA: Cross-lingual Open-Retrieval Question Answering for African LanguagesarXiv 2023Are Natural Language Inference Models IMPPRESsive? Learning IMPlicature and PRESuppositionare-natural-language-inference-models-1Tailoring Self-Supervision for Supervised LearningarXiv 2022Evaluating LLMs at Detecting Errors in LLM ResponsesarXiv 2024DEUP: Direct Epistemic Uncertainty Predictiondeup-direct-epistemic-uncertainty-prediction-1Interpretable Diffusion via Information DecompositionarXiv 2023KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache SharingarXiv 2024UMIC: An Unreferenced Metric for Image Captioning via Contrastive LearningACL 2021 5KazNERD: Kazakh Named Entity Recognition DatasetLREC 2022 6Did You Read the Instructions? Rethinking the Effectiveness of Task Definitions in Instruction LearningarXiv 2023WebVLN: Vision-and-Language Navigation on WebsitesarXiv 2023Chapter Captor: Text Segmentation in NovelsEMNLP 2020 11Continual evaluation for lifelong learning: Identifying the stability gaparXiv 2022MDCS: More Diverse Experts with Consistency Self-distillation for Long-tailed RecognitionICCV 2023 1Compressing Pre-trained Models of Code into 3 MBarXiv 2022A User-Centric Multi-Intent Benchmark for Evaluating Large Language ModelsarXiv 2024Discffusion: Discriminative Diffusion Models as Few-shot Vision and Language LearnersarXiv 2023Revisiting the Reliability of Psychological Scales on Large Language ModelsarXiv 2023ClimateSet: A Large-Scale Climate Model Dataset for Machine Learningclimateset-a-large-scale-climate-modelKCTS: Knowledge-Constrained Tree Search Decoding with Token-Level Hallucination DetectionarXiv 2023ReviewRobot: Explainable Paper Review Generation based on Knowledge SynthesisINLG (ACL) 2020 12PSUMNet: Unified Modality Part Streams are All You Need for Efficient Pose-based Action RecognitionarXiv 2022Open3DVQA: A Benchmark for Comprehensive Spatial Reasoning with Multimodal Large Language Model in Open SpacearXiv 2025A Large-scale Dataset for Hate Speech Detection on Vietnamese Social Media TextsarXiv 2021ShiftAddViT: Mixture of Multiplication Primitives Towards Efficient Vision Transformershiftaddvit-mixture-of-multiplicationDiversify and Conquer: Diversity-Centric Data Selection with Iterative RefinementarXiv 2024Diffusion Models With Learned Adaptive NoisearXiv 2023deGraphCS: Embedding Variable-based Flow Graph for Neural Code SearcharXiv 2021Investigating Table-to-Text Generation Capabilities of LLMs in Real-World Information Seeking ScenariosarXiv 2023Neural Persistence: A Complexity Measure for Deep Neural Networks Using Algebraic Topologyneural-persistence-a-complexity-measure-for-1SparCL: Sparse Continual Learning on the EdgearXiv 2022Coreset Sampling from Open-Set for Fine-Grained Self-Supervised LearningCVPR 2023 1DittoGym: Learning to Control Soft Shape-Shifting RobotsarXiv 2024Gemstones: A Model Suite for Multi-Faceted Scaling LawsarXiv 2025ResFormer: Scaling ViTs with Multi-Resolution TrainingCVPR 2023 1EVEREST: Efficient Masked Video Autoencoder by Removing Redundant Spatiotemporal TokensarXiv 2022Improving Convergence and Generalization Using Parameter SymmetriesarXiv 2023Evaluating Superhuman Models with Consistency ChecksarXiv 2023Towards Deep Attention in Graph Neural Networks: Problems and RemediesarXiv 2023SPAR: Personalized Content-Based Recommendation via Long Engagement AttentionarXiv 2024Unbiased Recommender Learning from Missing-Not-At-Random Implicit FeedbackarXiv 2019PreAct: Prediction Enhances Agent's Planning AbilityarXiv 2024Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable RewardsarXiv 2025Transformer Fusion with Optimal TransportarXiv 2023