All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Add-it: Training-Free Object Insertion in Images With Pretrained Diffusion ModelsarXiv 2024Large Language Model-based Human-Agent Collaboration for Complex Task SolvingarXiv 2024KMTalk: Speech-Driven 3D Facial Animation with Key Motion EmbeddingarXiv 2024KAN You See It? KANs and Sentinel for Effective and Explainable Crop Field SegmentationarXiv 2024NeRAF: 3D Scene Infused Neural Radiance and Acoustic FieldsarXiv 2024Normalization Layers Are All That Sharpness-Aware Minimization Needsnormalization-layers-are-all-that-sharpnessSPA: 3D Spatial-Awareness Enables Effective Embodied RepresentationarXiv 2024Betrayed by Attention: A Simple yet Effective Approach for Self-supervised Video Object SegmentationarXiv 2023Controllability-Aware Unsupervised Skill DiscoveryarXiv 2023Never Train from Scratch: Fair Comparison of Long-Sequence Models Requires Data-Driven PriorsarXiv 2023UTBoost: Rigorous Evaluation of Coding Agents on SWE-BencharXiv 2025Looped Transformers are Better at Learning Learning AlgorithmsarXiv 2023Attentive Mask CLIPICCV 2023 1Are Emergent Abilities in Large Language Models just In-Context Learning?arXiv 2023Differential Privacy Has Disparate Impact on Model Accuracydifferential-privacy-has-disparate-impact-on-1PoNet: Pooling Network for Efficient Token Mixing in Long Sequencesponet-pooling-network-for-efficient-token-1Scalable Vision Transformers with Hierarchical PoolingICCV 2021 10CiteSum: Citation Text-guided Scientific Extreme Summarization and Domain Adaptation with Limited SupervisionarXiv 2022CodeAttack: Code-Based Adversarial Attacks for Pre-trained Programming Language ModelsarXiv 2022On Calibration of Object Detectors: Pitfalls, Evaluation and BaselinesarXiv 2024Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful PerturbationarXiv 2024Learning to Memorize Entailment and Discourse Relations for Persona-Consistent DialoguesarXiv 2023Neural Refinement for Absolute Pose Regression with Feature SynthesisCVPR 2024 1Does Knowledge Distillation Really Work?NeurIPS 2021 12LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?arXiv 2025KNOD: Domain Knowledge Distilled Tree Decoder for Automated Program RepairarXiv 2023XLSR-Mamba: A Dual-Column Bidirectional State Space Model for Spoofing Attack DetectionarXiv 2024Make Pre-trained Model Reversible: From Parameter to Memory Efficient Fine-Tuningmake-pre-trained-model-reversible-fromHelping Hands: An Object-Aware Ego-Centric Video Recognition ModelICCV 2023 1CO-Bench: Benchmarking Language Model Agents in Algorithm Search for Combinatorial OptimizationarXiv 2025Compose & Embellish: Well-Structured Piano Performance Generation via A Two-Stage ApproacharXiv 2022HUI-Audio-Corpus-German: A high quality TTS datasetarXiv 2021Time Is MattEr: Temporal Self-supervision for Video TransformersarXiv 2022CLR: Channel-wise Lightweight Reprogramming for Continual LearningICCV 2023 1CoMix: A Comprehensive Benchmark for Multi-Task Comic UnderstandingarXiv 2024Open Panoramic SegmentationarXiv 2024Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision TransformersarXiv 2023World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language ModelsarXiv 2023Assessing Language Model Deployment with Risk CardsarXiv 2023Cross-Attention is All You Need: Adapting Pretrained Transformers for Machine TranslationEMNLP 2021 11A Group Symmetric Stochastic Differential Equation Model for Molecule Multi-modal PretrainingarXiv 2023SOC: Semantic-Assisted Object Cluster for Referring Video Object Segmentationsoc-semantic-assisted-object-cluster-for-13DPortraitGAN: Learning One-Quarter Headshot 3D GANs from a Single-View Portrait Dataset with Diverse Body PosesarXiv 2023When to Show a Suggestion? Integrating Human Feedback in AI-Assisted ProgrammingarXiv 2023Optimized Feature Generation for Tabular Data via LLMs with Decision
Tree ReasoningarXiv 2024Multilingual DistilWhisper: Efficient Distillation of Multi-task Speech Models via Language-Specific ExpertsarXiv 2023Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding BridgearXiv 2024UniGeo: Unifying Geometry Logical Reasoning via Reformulating Mathematical ExpressionarXiv 2022LASER: LLM Agent with State-Space Exploration for Web NavigationarXiv 2023MHPP: Exploring the Capabilities and Limitations of Language Models Beyond Basic Code GenerationarXiv 2024EnvBench: A Benchmark for Automated Environment SetuparXiv 2025Tell me about yourself: LLMs are aware of their learned behaviorsarXiv 2025SELF-GUIDE: Better Task-Specific Instruction Following via Self-Synthetic FinetuningarXiv 2024Neural Machine Translation without EmbeddingsNAACL 2021 4Learning from Future: A Novel Self-Training Framework for Semantic SegmentationarXiv 2022MELoRA: Mini-Ensemble Low-Rank Adapters for Parameter-Efficient Fine-TuningarXiv 2024MMTrail: A Multimodal Trailer Video Dataset with Language and Music DescriptionsarXiv 2024Towards Benchmarking and Improving the Temporal Reasoning Capability of Large Language ModelsarXiv 2023BayesDiff: Estimating Pixel-wise Uncertainty in Diffusion via Bayesian InferencearXiv 2023AMOR: A Recipe for Building Adaptable Modular Knowledge Agents Through Process FeedbackarXiv 2024Levin Tree Search with Context ModelsarXiv 2023Can CLIP Help Sound Source Localization?arXiv 2023Polos: Multimodal Metric Learning from Human Feedback for Image CaptioningCVPR 2024 1Evaluating Large Language Models for Generalization and Robustness via Data CompressionarXiv 2024SGD with Large Step Sizes Learns Sparse FeaturesarXiv 2022Personalized Visual Instruction TuningarXiv 2024Seeking Neural Nuggets: Knowledge Transfer in Large Language Models from a Parametric PerspectivearXiv 2023Efficient Adversarial Training in LLMs with Continuous AttacksarXiv 2024Multi-Domain Dialogue Acts and Response Co-Generationmulti-domain-dialogue-acts-and-response-co-1GAMUS: A Geometry-aware Multi-modal Semantic Segmentation Benchmark for Remote Sensing DataarXiv 2023Jailbreaking as a Reward Misspecification ProblemarXiv 2024Fine-tuned Language Models are Continual LearnersarXiv 2022Meta-Learning Initializations for Image Segmentationmeta-learning-initializations-for-image-2Hierarchical Neural Networks for Sequential Sentence Classification in Medical Scientific Abstractshierarchical-neural-networks-for-sequential-1Real-World Remote Sensing Image Dehazing: Benchmark and BaselinearXiv 2025Exploring and Adapting Chinese GPT to Pinyin Input MethodACL 2022 5Refusal-Trained LLMs Are Easily Jailbroken As Browser AgentsarXiv 2024Correcting Diffusion Generation through ResamplingCVPR 2024 1Discovering Temporally-Aware Reinforcement Learning AlgorithmsarXiv 2024DICES Dataset: Diversity in Conversational AI Evaluation for SafetyarXiv 2023PointDC:Unsupervised Semantic Segmentation of 3D Point Clouds via Cross-modal Distillation and Super-Voxel ClusteringarXiv 2023Data-Efficient Contrastive Self-supervised Learning: Most Beneficial Examples for Supervised Learning Contribute the LeastarXiv 2023TRACE the Evidence: Constructing Knowledge-Grounded Reasoning Chains for Retrieval-Augmented GenerationarXiv 2024Detecting Inappropriate Messages on Sensitive Topics that Could Harm a Company's ReputationarXiv 2021S3Eval: A Synthetic, Scalable, Systematic Evaluation Suite for Large Language ModelsarXiv 2023cWDM: Conditional Wavelet Diffusion Models for Cross-Modality 3D Medical Image SynthesisarXiv 2024A Survey on Generative Modeling with Limited Data, Few Shots, and Zero ShotarXiv 2023Open-Vocabulary Semantic Segmentation with Decoupled One-Pass NetworkICCV 2023 1MixQG: Neural Question Generation with Mixed Answer TypesFindings (NAACL) 2022 7SCOPE: Optimizing Key-Value Cache Compression in Long-context GenerationarXiv 2024MultiTabQA: Generating Tabular Answers for Multi-Table Question AnsweringarXiv 2023DataDAM: Efficient Dataset Distillation with Attention Matchingdatadam-efficient-dataset-distillation-withInducing Programmatic Skills for Agentic TasksarXiv 2025CopyRNeRF: Protecting the CopyRight of Neural Radiance FieldsICCV 2023 1On Strengthening and Defending Graph Reconstruction Attack with Markov Chain ApproximationarXiv 2023Interactive White Balancing for Camera-Rendered ImagesarXiv 2020Chain of Natural Language Inference for Reducing Large Language Model Ungrounded HallucinationsarXiv 2023DACBench: A Benchmark Library for Dynamic Algorithm ConfigurationarXiv 2021Tab-CoT: Zero-shot Tabular Chain of ThoughtarXiv 2023Welfare Diplomacy: Benchmarking Language Model CooperationarXiv 2023ML-SIM: A deep neural network for reconstruction of structured illumination microscopy imagesarXiv 2020HyperRouter: Towards Efficient Training and Inference of Sparse Mixture of ExpertsarXiv 2023Multi-Object Hallucination in Vision-Language ModelsarXiv 2024DiET-GS: Diffusion Prior and Event Stream-Assisted Motion Deblurring 3D Gaussian SplattingCVPR 2025 1Spurious Features Everywhere -- Large-Scale Detection of Harmful Spurious Features in ImageNetarXiv 2022Masking Adversarial Damage: Finding Adversarial Saliency for Robust and Sparse NetworkCVPR 2022 1Visual Dependency Transformers: Dependency Tree Emerges from Reversed AttentionCVPR 2023 1Context-Based Trit-Plane Coding for Progressive Image CompressionCVPR 2023 1On the Learning and Learnability of QuasimetricsarXiv 2022EDAPS: Enhanced Domain-Adaptive Panoptic SegmentationICCV 2023 1Source-free Depth for Object Pop-outICCV 2023 1Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy DataarXiv 2024Audio-Visual Class-Incremental LearningICCV 2023 1PyBench: Evaluating LLM Agent on various real-world coding tasksarXiv 2024NeuRI: Diversifying DNN Generation via Inductive Rule InferencearXiv 2023Class Incremental Learning via Likelihood Ratio Based Task PredictionarXiv 2023A Comprehensive Survey on Self-Interpretable Neural NetworksarXiv 2025A Domain-Knowledge-Inspired Music Embedding Space and a Novel Attention Mechanism for Symbolic Music ModelingarXiv 2022VideoStudio: Generating Consistent-Content and Multi-Scene VideosarXiv 2024From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak AttacksarXiv 2024Merging by Matching Models in Task Parameter SubspacesarXiv 2023LaMPilot: An Open Benchmark Dataset for Autonomous Driving with Language Model ProgramsCVPR 2024 1Heterogeneous Multi-task Learning with Expert DiversityarXiv 2021AllClear: A Comprehensive Dataset and Benchmark for Cloud Removal in Satellite ImageryarXiv 2024Learning Diffusion Priors from Observations by Expectation MaximizationarXiv 2024Improving Vietnamese Named Entity Recognition from Speech Using Word Capitalization and Punctuation Recovery ModelsarXiv 2020StepGame: A New Benchmark for Robust Multi-Hop Spatial Reasoning in Textsstepgame-a-new-benchmark-for-robust-multi-hopVictima: Drastically Increasing Address Translation Reach by Leveraging
Underutilized Cache ResourcesarXiv 2023Melanoma Detection using Adversarial Training and Deep Transfer LearningarXiv 2020Does Transformer Interpretability Transfer to RNNs?arXiv 2024Dataset Inference: Ownership Resolution in Machine Learningdataset-inference-ownership-resolution-inLLaMo: Large Language Model-based Molecular Graph AssistantarXiv 2024Conformal Language ModelingarXiv 2023Elucidating The Design Space of Classifier-Guided Diffusion GenerationarXiv 2023MagicID: Hybrid Preference Optimization for ID-Consistent and Dynamic-Preserved Video CustomizationICCV 2025CKGConv: General Graph Convolution with Continuous KernelsarXiv 2024GUESS:GradUally Enriching SyntheSis for Text-Driven Human Motion GenerationarXiv 2024MIO: A Foundation Model on Multimodal TokensarXiv 2024Faster Learned Sparse Retrieval with Block-Max PruningarXiv 2024Improving Generative Visual Dialog by Answering Diverse Questionsimproving-generative-visual-dialog-byNTUA-SLP at IEST 2018: Ensemble of Neural Transfer Methods for Implicit Emotion Classificationntua-slp-at-iest-2018-ensemble-of-neural-1Adaptive Machine Translation with Large Language ModelsarXiv 2023Stop Wasting My Time! Saving Days of ImageNet and BERT Training with Latest Weight AveragingarXiv 2022Multimodal Distillation for Egocentric Action RecognitionICCV 2023 1Unified Pre-training with Pseudo Texts for Text-To-Image Person Re-identificationunified-pre-training-with-pseudo-texts-forOV-VG: A Benchmark for Open-Vocabulary Visual GroundingarXiv 2023Predictable MDP Abstraction for Unsupervised Model-Based RLarXiv 2023To Think or Not to Think: Exploring the Unthinking Vulnerability in Large Reasoning ModelsarXiv 2025Model Stealing Attacks Against Inductive Graph Neural NetworksarXiv 2021LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language ModelsarXiv 2024Object-level Geometric Structure Preserving for Natural Image StitchingarXiv 2024BERT, mBERT, or BiBERT? A Study on Contextualized Embeddings for Neural Machine TranslationEMNLP 2021 11Sampling-Based Accuracy Testing of Posterior Estimators for General InferencearXiv 2023Emergent Visual-Semantic Hierarchies in Image-Text RepresentationsarXiv 2024Query Embedding on Hyper-relational Knowledge Graphsquery-embedding-on-hyper-relational-knowledge-1Learning Action and Reasoning-Centric Image Editing from Videos and SimulationsarXiv 2024Calibrating Factual Knowledge in Pretrained Language ModelsarXiv 2022Revisiting Who's Harry Potter: Towards Targeted Unlearning from a Causal Intervention PerspectivearXiv 2024Look at the Variance! Efficient Black-box Explanations with Sobol-based Sensitivity AnalysisNeurIPS 2021 12Leveraging Locality to Boost Sample Efficiency in Robotic ManipulationarXiv 2024Motion Avatar: Generate Human and Animal Avatars with Arbitrary MotionarXiv 2024Language Modeling on Tabular Data: A Survey of Foundations, Techniques and EvolutionarXiv 2024DiffAR: Denoising Diffusion Autoregressive Model for Raw Speech Waveform GenerationarXiv 2023Complex-valued neural networks for machine learning on non-stationary physical dataarXiv 2019ComposerX: Multi-Agent Symbolic Music Composition with LLMsarXiv 2024Cascade Speculative Drafting for Even Faster LLM InferencearXiv 2023Auxiliary Learning as an Asymmetric Bargaining GamearXiv 2023Corex: Pushing the Boundaries of Complex Reasoning through Multi-Model CollaborationarXiv 2023LANCE: Stress-testing Visual Models by Generating Language-guided Counterfactual Imageslance-stress-testing-visual-models-byDual Focal Loss for CalibrationarXiv 2023RetroBridge: Modeling Retrosynthesis with Markov BridgesarXiv 2023Unraveling Complex Data Diversity in Underwater Acoustic Target
Recognition through Convolution-based Mixture of ExpertsarXiv 2024An End-to-End Reinforcement Learning Approach for Job-Shop Scheduling Problems Based on Constraint ProgrammingarXiv 2023Bootstrapping Language-Guided Navigation Learning with Self-Refining Data FlywheelarXiv 2024Debiased Contrastive Learning of Unsupervised Sentence RepresentationsACL 2022 5Typhoon 2: A Family of Open Text and Multimodal Thai Large Language ModelsarXiv 2024Rethinking Pretraining as a Bridge from ANNs to SNNsarXiv 2022Linking Emergent and Natural Languages via Corpus Transferlinking-emergent-and-natural-languages-viaImages are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language ModelsarXiv 2024Beyond Redundancy: Information-aware Unsupervised Multiplex Graph Structure LearningarXiv 2024GTP-ViT: Efficient Vision Transformers via Graph-based Token PropagationarXiv 2023Diverse Controllable Diffusion Policy with Signal Temporal LogicarXiv 2025Mixed Attention Network for Hyperspectral Image DenoisingarXiv 2023BERTs are Generative In-Context LearnersarXiv 2024Neuron Activation Coverage: Rethinking Out-of-distribution Detection and GeneralizationarXiv 2023Rethinking Data Selection at Scale: Random Selection is Almost All You NeedarXiv 2024Counterfactual Token Generation in Large Language ModelsarXiv 2024Image Clustering via the Principle of Rate Reduction in the Age of Pretrained ModelsarXiv 2023EraseAnything: Enabling Concept Erasure in Rectified Flow TransformersarXiv 2024ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank ResidualsarXiv 2024Observatory: Characterizing Embeddings of Relational TablesarXiv 2023Is In-Context Learning Sufficient for Instruction Following in LLMs?arXiv 2024NormBank: A Knowledge Bank of Situational Social NormsarXiv 2023HallE-Control: Controlling Object Hallucination in Large Multimodal ModelsarXiv 2023Do text-free diffusion models learn discriminative visual representations?arXiv 2023Tutor CoPilot: A Human-AI Approach for Scaling Real-Time ExpertisearXiv 2024DOTIE - Detecting Objects through Temporal Isolation of Events using a Spiking ArchitecturearXiv 2022NVS-Adapter: Plug-and-Play Novel View Synthesis from a Single ImagearXiv 2023Unintentional Unalignment: Likelihood Displacement in Direct Preference OptimizationarXiv 2024Open-Vocabulary Functional 3D Scene Graphs for Real-World Indoor SpacesCVPR 2025 1