All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Learning Truncated Causal History Model for Video RestorationarXiv 2024Re-imagine the Negative Prompt Algorithm: Transform 2D Diffusion into 3D, alleviate Janus problem and BeyondarXiv 2023Conditional DETR for Fast Training ConvergenceICCV 2021 10Towards Understanding Camera Motions in Any VideoarXiv 2025Generative Language Models for Paragraph-Level Question GenerationarXiv 2022Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement LearningarXiv 2025CPGD: Toward Stable Rule-based Reinforcement Learning for Language ModelsarXiv 2025SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial ReasoningarXiv 2025PrimitiveAnything: Human-Crafted 3D Primitive Assembly Generation with Auto-Regressive TransformerarXiv 2025SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RLarXiv 2025Kimina-Prover Preview: Towards Large Formal Reasoning Models with Reinforcement LearningarXiv 2025DeCLIP: Decoupled Learning for Open-Vocabulary Dense PerceptionCVPR 2025 1AnyEdit: Edit Any Knowledge Encoded in Language ModelsarXiv 2025ManiSkill-HAB: A Benchmark for Low-Level Manipulation in Home Rearrangement TasksarXiv 2024STHN: Deep Homography Estimation for UAV Thermal Geo-localization with Satellite ImageryarXiv 2024DynamicRAG: Leveraging Outputs of Large Language Model as Feedback for Dynamic Reranking in Retrieval-Augmented GenerationarXiv 2025Beyond Prompt Engineering: Robust Behavior Control in LLMs via Steering Target AtomsarXiv 2025Twin-2K-500: A dataset for building digital twins of over 2,000 people based on their answers to over 500 questionsarXiv 2025GUI-Actor: Coordinate-Free Visual Grounding for GUI AgentsarXiv 2025WebGen-Bench: Evaluating LLMs on Generating Interactive and Functional Websites from ScratcharXiv 2025Subtractive Mixture Models via Squaring: Representation and LearningarXiv 2023GRAPE: Generalizing Robot Policy via Preference AlignmentarXiv 2024Thinking with Generated ImagesarXiv 2025LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal UnderstandingCVPR 2025 1MKQA: A Linguistically Diverse Benchmark for Multilingual Open Domain Question AnsweringarXiv 2020Llamba: Scaling Distilled Recurrent Models for Efficient Language ProcessingarXiv 2025No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by ThemselvesarXiv 2025Multimodal Autoregressive Pre-training of Large Vision EncodersCVPR 2025 1RM-R1: Reward Modeling as ReasoningarXiv 2025Large Language Models can Strategically Deceive their Users when Put Under PressurearXiv 2023Breaking reCAPTCHAv2arXiv 2024Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language ModelsarXiv 2025Transformer Copilot: Learning from The Mistake Log in LLM Fine-tuningarXiv 2025Training-Free Efficient Video Generation via Dynamic Token CarvingarXiv 2025Learning Occlusion-Robust Vision Transformers for Real-Time UAV Trackinglearning-occlusion-robust-vision-transformersGuided Diffusion Sampling on Function Spaces with Applications to PDEsarXiv 2025Manipulating Large Language Models to Increase Product VisibilityarXiv 2024Certifying LLM Safety against Adversarial PromptingarXiv 2023AnyTop: Character Animation Diffusion with Any TopologyarXiv 2025Cross-Modal Implicit Relation Reasoning and Aligning for Text-to-Image Person RetrievalCVPR 2023 1Imagine360: Immersive 360 Video Generation from Perspective AnchorarXiv 2024ROCKET: Exceptionally fast and accurate time series classification using random convolutional kernelsarXiv 2019Spiking Denoising Diffusion Probabilistic ModelsarXiv 2023GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal ModelingICCV 2025AudioCLIP: Extending CLIP to Image, Text and AudioarXiv 2021Expressive Whole-Body 3D Gaussian AvatararXiv 2024RAGChecker: A Fine-grained Framework for Diagnosing Retrieval-Augmented GenerationarXiv 2024Do LLMs Recognize Your Preferences? Evaluating Personalized Preference Following in LLMsarXiv 2025Shopping Queries Dataset: A Large-Scale ESCI Benchmark for Improving Product SearcharXiv 2022StyleStudio: Text-Driven Style Transfer with Selective Control of Style ElementsCVPR 2025 1Text2midi: Generating Symbolic Music from CaptionsarXiv 2024SPA-RL: Reinforcing LLM Agents via Stepwise Progress AttributionarXiv 2025Refining Generative Process with Discriminator Guidance in Score-based Diffusion ModelsarXiv 2022MonoSplat: Generalizable 3D Gaussian Splatting from Monocular Depth Foundation ModelsCVPR 2025 1SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language ModelsarXiv 2024DyFo: A Training-Free Dynamic Focus Visual Search for Enhancing LMMs in Fine-Grained Visual UnderstandingCVPR 2025 1WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMsarXiv 2024SPECTER: Document-level Representation Learning using Citation-informed Transformersspecter-document-level-representationSciRIFF: A Resource to Enhance Language Model Instruction-Following over Scientific LiteraturearXiv 2024TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and GenerationarXiv 2025MedICaT: A Dataset of Medical Images, Captions, and Textual ReferencesFindings of the Association for Computational Linguistics 2020Absolute Coordinates Make Motion Generation EasyarXiv 2025Large Motion Video Autoencoding with Cross-modal Video VAEICCV 2025ConFIG: Towards Conflict-free Training of Physics Informed Neural NetworksarXiv 2024A-OKVQA: A Benchmark for Visual Question Answering using World KnowledgearXiv 2022Mamba Meets Financial Markets: A Graph-Mamba Approach for Stock Price PredictionarXiv 2024Multi-CPR: A Multi Domain Chinese Dataset for Passage RetrievalarXiv 2022DeepMAD: Mathematical Architecture Design for Deep Convolutional Neural NetworkCVPR 2023 1FunCodec: A Fundamental, Reproducible and Integrable Open-source Toolkit for Neural Speech CodecarXiv 2023Improving Long Document Topic Segmentation Models With Enhanced Coherence ModelingarXiv 2023Federated Full-Parameter Tuning of Billion-Sized Language Models with Communication Cost under 18 KilobytesarXiv 2023Image Restoration with Mean-Reverting Stochastic Differential EquationsarXiv 2023Sample Factory: Egocentric 3D Control from Pixels at 100000 FPS with Asynchronous Reinforcement LearningICML 2020 1BLiMP: The Benchmark of Linguistic Minimal Pairs for Englishblimp-the-benchmark-of-linguistic-minimalCrystal-GFN: sampling crystals with desirable properties and constraintsarXiv 2023ActionPiece: Contextually Tokenizing Action Sequences for Generative RecommendationarXiv 2025BPKD: Boundary Privileged Knowledge Distillation For Semantic SegmentationarXiv 2023Burstormer: Burst Image Restoration and Enhancement TransformerCVPR 2023 1OverThink: Slowdown Attacks on Reasoning LLMsarXiv 2025Unique3D: High-Quality and Efficient 3D Mesh Generation from a Single ImagearXiv 2024Differentially Private Synthetic Data via Foundation Model APIs 2: TextarXiv 2024AriGraph: Learning Knowledge Graph World Models with Episodic Memory for LLM AgentsarXiv 2024HairFastGAN: Realistic and Robust Hair Transfer with a Fast Encoder-Based ApproacharXiv 2024Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data GenerationarXiv 2025Efficient Large Language Models: A SurveyarXiv 2023ABCNet: Real-time Scene Text Spotting with Adaptive Bezier-Curve Networkabcnet-real-time-scene-text-spotting-with-1Med-PRM: Medical Reasoning Models with Stepwise, Guideline-verified Process RewardsarXiv 2025Safety in Large Reasoning Models: A SurveyarXiv 2025Kandinsky: an Improved Text-to-Image Synthesis with Image Prior and Latent DiffusionarXiv 2023AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking HeadarXiv 2023A Methodology for Generative Spelling Correction via Natural Spelling Errors Emulation across Multiple Domains and LanguagesarXiv 2023Docs2KG: Unified Knowledge Graph Construction from Heterogeneous Documents Assisted by Large Language ModelsarXiv 2024Wavelet Diffusion Neural OperatorarXiv 2024Frontiers in Intelligent ColonoscopyarXiv 2024Shifting AI Efficiency From Model-Centric to Data-Centric CompressionarXiv 2025FP4 All the Way: Fully Quantized Training of LLMsarXiv 2025AI4Bharat-IndicNLP Corpus: Monolingual Corpora and Word Embeddings for Indic LanguagesarXiv 2020FLUX-Text: A Simple and Advanced Diffusion Transformer Baseline for Scene Text EditingarXiv 2025K-LoRA: Unlocking Training-Free Fusion of Any Subject and Style LoRAsCVPR 2025 1Activation-Informed Merging of Large Language ModelsarXiv 2025Harnessing the Universal Geometry of EmbeddingsarXiv 2025HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video UnderstandingarXiv 2025LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech SynthesisarXiv 2025Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based AgentsarXiv 2024From Commands to Prompts: LLM-based Semantic File System for AIOSarXiv 2024Hybrid Latent Reasoning via Reinforcement LearningarXiv 2025SliderSpace: Decomposing the Visual Capabilities of Diffusion ModelsICCV 2025node2vec: Scalable Feature Learning for NetworksarXiv 2016Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for ReasoningarXiv 2025NoPe-NeRF: Optimising Neural Radiance Field with No Pose PriorCVPR 2023 1EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language ModelsarXiv 2025xVerify: Efficient Answer Verifier for Reasoning Model EvaluationsarXiv 2025Consistent-Teacher: Towards Reducing Inconsistent Pseudo-targets in Semi-supervised Object Detectionconsistent-teacher-provides-betterThe Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single TransformerICCV 2025CycleNet: Enhancing Time Series Forecasting through Modeling Periodic PatternsarXiv 2024Tamil-Llama: A New Tamil Language Model Based on Llama 2arXiv 2023Attack Prompt Generation for Red Teaming and Defending Large Language ModelsarXiv 2023Sliding Windows Are Not the End: Exploring Full Ranking with Long-Context Large Language ModelsarXiv 2024Unity is Strength: Unifying Convolutional and Transformeral Features for Better Person Re-IdentificationarXiv 2024Efficient Diffusion Transformer Policies with Mixture of Expert Denoisers for Multitask LearningarXiv 2024DynamicCity: Large-Scale 4D Occupancy Generation from Dynamic ScenesarXiv 2024NeuS2: Fast Learning of Neural Implicit Surfaces for Multi-view ReconstructionICCV 2023 1Vision-Language Model for Object Detection and Segmentation: A Review and EvaluationarXiv 2025RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement LearningarXiv 2025CreatiPoster: Towards Editable and Controllable Multi-Layer Graphic Design GenerationarXiv 2025I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion ModelsarXiv 2025Visual Planning: Let's Think Only with ImagesarXiv 2025Gold-YOLO: Efficient Object Detector via Gather-and-Distribute Mechanismgold-yolo-efficient-object-detector-viaMeta-rater: A Multi-dimensional Data Selection Method for Pre-training Language ModelsarXiv 2025Log-Linear AttentionarXiv 2025Contrastive Flow MatchingICCV 2025Unsupervised Visual Chain-of-Thought Reasoning via Preference OptimizationICCV 2025Vision Language Models are BiasedarXiv 2025EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-JudgearXiv 2025ViDoRe Benchmark V2: Raising the Bar for Visual RetrievalarXiv 2025R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPOarXiv 2025EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational ScenariosarXiv 2025Adaptive Hyper-Graph Convolution Network for Skeleton-based Human Action Recognition with Virtual ConnectionsICCV 2025Bring Reason to Vision: Understanding Perception and Reasoning through Model MergingarXiv 2025EchoWorld: Learning Motion-Aware World Models for Echocardiography Probe GuidanceCVPR 2025 1SelfSplat: Pose-Free and 3D Prior-Free Generalizable 3D Gaussian SplattingCVPR 2025 1OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal LearningICCV 2025SongMASS: Automatic Song Writing with Pre-training and Alignment ConstraintarXiv 2020CLaMP: Contrastive Language-Music Pre-training for Cross-Modal Symbolic Music Information RetrievalarXiv 2023MusicAgent: An AI Agent for Music Understanding and Generation with Large Language ModelsarXiv 2023Improving Synthetic Image Detection Towards Generalization: An Image Transformation PerspectivearXiv 2024AR-Net: A simple Auto-Regressive Neural Network for time-seriesarXiv 2019Are Sixteen Heads Really Better than One?are-sixteen-heads-really-better-than-one-1EnvPool: A Highly Parallel Reinforcement Learning Environment Execution EnginearXiv 2022CREAM: Consistency Regularized Self-Rewarding Language ModelsarXiv 2024ToolGen: Unified Tool Retrieval and Calling via GenerationarXiv 2024A Survey of Reasoning with Foundation ModelsarXiv 2023BEDLAM: A Synthetic Dataset of Bodies Exhibiting Detailed Lifelike Animated Motionbedlam-a-synthetic-dataset-of-bodiesSLURP: A Spoken Language Understanding Resource Packageslurp-a-spoken-language-understandingPrivacyLens: Evaluating Privacy Norm Awareness of Language Models in ActionarXiv 2024Interpreting Object-level Foundation Models via Visual Precision SearchCVPR 2025 1PMC-Patients: A Large-scale Dataset of Patient Summaries and Relations for Benchmarking Retrieval-based Clinical Decision Support SystemsarXiv 2022Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networksfaster-r-cnn-towards-real-time-object-1A Dynamic LLM-Powered Agent Network for Task-Oriented Agent CollaborationarXiv 2023Fast R-CNNfast-r-cnn-1SiT: Self-supervised vIsion TransformerarXiv 2021Zero-shot Image-to-Image TranslationarXiv 2023CoWs on Pasture: Baselines and Benchmarks for Language-Driven Zero-Shot Object NavigationCVPR 2023 1OASim: an Open and Adaptive Simulator based on Neural Rendering for Autonomous DrivingarXiv 2024Atom of Thoughts for Markov LLM Test-Time ScalingarXiv 2025LoRA-Ensemble: Efficient Uncertainty Modelling for Self-attention NetworksarXiv 2024BlenderGym: Benchmarking Foundational Model Systems for Graphics EditingCVPR 2025 1Towards Green AI in Fine-tuning Large Language Models via Adaptive BackpropagationarXiv 2023AttnLRP: Attention-Aware Layer-Wise Relevance Propagation for TransformersarXiv 2024UniSeg: A Unified Multi-Modal LiDAR Segmentation Network and the OpenPCSeg CodebaseICCV 2023 1A Close Look at Decomposition-based XAI-Methods for Transformer Language ModelsarXiv 2025Provable Dynamic Fusion for Low-Quality Multimodal DataarXiv 2023MonoDGP: Monocular 3D Object Detection with Decoupled-Query and Geometry-Error PriorsCVPR 2025 1Enabling Large Language Models to Generate Text with CitationsarXiv 2023MassSpecGym: A benchmark for the discovery and identification of moleculesarXiv 2024Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language ModelsarXiv 2024TALLRec: An Effective and Efficient Tuning Framework to Align Large Language Model with RecommendationarXiv 2023Ignore This Title and HackAPrompt: Exposing Systemic Vulnerabilities of LLMs through a Global Scale Prompt Hacking CompetitionarXiv 2023ID-Blau: Image Deblurring by Implicit Diffusion-based reBLurring AUgmentationCVPR 2024 1Fast and Robust Early-Exiting Framework for Autoregressive Language Models with Synchronized Parallel DecodingarXiv 2023PlantDoc: A Dataset for Visual Plant Disease DetectionarXiv 2019GNNExplainer: Generating Explanations for Graph Neural Networksgnnexplainer-generating-explanations-forGIFT-Eval: A Benchmark For General Time Series Forecasting Model EvaluationarXiv 2024ReXTime: A Benchmark Suite for Reasoning-Across-Time in VideosarXiv 2024TIES-Merging: Resolving Interference When Merging ModelsNeurIPS 2023 11$\textit{Revelio}$: Interpreting and leveraging semantic information in diffusion modelsarXiv 2024FaithEval: Can Your Language Model Stay Faithful to Context, Even If "The Moon is Made of Marshmallows"arXiv 2024Probabilistically Masked Language Model Capable of Autoregressive Generation in Arbitrary Word Orderprobabilistically-masked-language-model-1CAME: Confidence-guided Adaptive Memory Efficient OptimizationarXiv 2023TinyBERT: Distilling BERT for Natural Language UnderstandingFindings of the Association for Computational Linguistics 2020Scaling Retrieval-Based Language Models with a Trillion-Token DatastorearXiv 2024Token Contrast for Weakly-Supervised Semantic SegmentationCVPR 2023 1Efficient Transformers with Dynamic Token PoolingarXiv 2022Florence-2: Advancing a Unified Representation for a Variety of Vision TasksCVPR 2024 1Adapting Language Models to Compress ContextsarXiv 2023AppBench: Planning of Multiple APIs from Various APPs for Complex User InstructionarXiv 2024The T05 System for The VoiceMOS Challenge 2024: Transfer Learning from Deep Image Classifier to Naturalness MOS Prediction of High-Quality Synthetic SpeecharXiv 2024LongRAG: A Dual-Perspective Retrieval-Augmented Generation Paradigm for Long-Context Question AnsweringarXiv 2024Continual Test-Time Domain AdaptationCVPR 2022 1FusionVision: A comprehensive approach of 3D object reconstruction and segmentation from RGB-D cameras using YOLO and fast segment anythingarXiv 2024