0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

Automatic Intrinsic Reward Shaping for Exploration in Deep Reinforcement LearningarXiv 2023PaperBench: Evaluating AI's Ability to Replicate AI ResearcharXiv 2025Point-E: A System for Generating 3D Point Clouds from Complex PromptsarXiv 2022A Holistic Approach to Undesired Content Detection in the Real WorldarXiv 2022Jukebox: A Generative Model for Musicjukebox-a-generative-model-for-musicGeoUDF: Surface Reconstruction from 3D Point Clouds via Geometry-guided Distance RepresentationICCV 2023 1GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via CipherarXiv 2023Zero-Shot Text-to-Image GenerationarXiv 2021Consistency ModelsarXiv 2023BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language ModelsarXiv 2024Roboflow 100: A Rich, Multi-Domain Object Detection BenchmarkarXiv 2022BlendSQL: A Scalable Dialect for Unifying Hybrid Question Answering in Relational AlgebraarXiv 2024LISA: Layerwise Importance Sampling for Memory-Efficient Large Language Model Fine-TuningarXiv 2024MolDiff: Addressing the Atom-Bond Inconsistency Problem in 3D Molecule Diffusion GenerationarXiv 2023DocDiff: Document Enhancement via Residual Diffusion ModelsarXiv 2023DreamDiffusion: Generating High-Quality Images from Brain EEG SignalsarXiv 2023GFM-RAG: Graph Foundation Model for Retrieval Augmented GenerationarXiv 2025Helios: Real Real-Time Long Video Generation ModelarXiv 2026PromptDresser: Improving the Quality and Controllability of Virtual Try-On via Generative Textual Prompt and Prompt-aware MaskICCV 2025Parametric Retrieval Augmented GenerationarXiv 2025FaceForensics++: Learning to Detect Manipulated Facial ImagesarXiv 2019SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language ModelsarXiv 2024Unified Human-Scene Interaction via Prompted Chain-of-ContactsarXiv 2023PointLLM: Empowering Large Language Models to Understand Point CloudsarXiv 2023Efficient Part-level 3D Object Generation via Dual Volume PackingarXiv 2025A Survey on Large Language Model based Autonomous AgentsarXiv 2023Learning to Generate Instruction Tuning Datasets for Zero-Shot Task AdaptationarXiv 2024PP-LCNet: A Lightweight CPU Convolutional Neural NetworkarXiv 2021Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion HeadarXiv 2024StyleShot: A Snapshot on Any StylearXiv 2024Delving into Inter-Image Invariance for Unsupervised Visual RepresentationsarXiv 2020Self-supervised Learning for Human Activity Recognition Using 700,000 Person-days of Wearable DataarXiv 2022Beyond Next-Token: Next-X Prediction for Autoregressive Visual GenerationarXiv 2025FlowAR: Scale-wise Autoregressive Image Generation Meets Flow MatchingarXiv 2024Analyzing and Improving the Image Quality of StyleGANanalyzing-and-improving-the-image-quality-of-1RVT-2: Learning Precise Manipulation from Few DemonstrationsarXiv 2024Efficient Geometry-aware 3D Generative Adversarial NetworksCVPR 2022 1SpatialBot: Precise Spatial Understanding with Vision Language ModelsarXiv 2024Direct Discriminative Optimization: Your Likelihood-Based Visual Generative Model is Secretly a GAN Discriminatordirect-discriminative-optimization-yourOptimizing Large Language Model Training Using FP4 QuantizationarXiv 2025CoherentGS: Sparse Novel View Synthesis with Coherent 3D GaussiansarXiv 2024Real-Time Video Generation with Pyramid Attention BroadcastarXiv 2024DSP: Dynamic Sequence Parallelism for Multi-Dimensional TransformersarXiv 2024G-Eval: NLG Evaluation using GPT-4 with Better Human AlignmentarXiv 2023Can LLMs Follow Simple Rules?arXiv 2023NeuroNCAP: Photorealistic Closed-loop Safety Testing for Autonomous DrivingarXiv 2024S*: Test Time Scaling for Code GenerationarXiv 2025Steering Llama 2 via Contrastive Activation AdditionarXiv 2023M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language RepresentationarXiv 2024LightThinker: Thinking Step-by-Step CompressionarXiv 2025Contextualize Me -- The Case for Context in Reinforcement LearningarXiv 2022OSUM: Advancing Open Speech Understanding Models with Limited Resources in AcademiaarXiv 2025LLM-PySC2: Starcraft II learning environment for Large Language ModelsarXiv 2024Assemblage: Automatic Binary Dataset Construction for Machine LearningarXiv 2024PEM: Prototype-based Efficient MaskFormer for Image SegmentationCVPR 2024 1AudioBench: A Universal Benchmark for Audio Large Language ModelsarXiv 2024Stabilizing Deep Q-Learning with ConvNets and Vision Transformers under Data AugmentationNeurIPS 2021 12Depth Any Panoramas: A Foundation Model for Panoramic Depth EstimationarXiv 2025OmniControl: Control Any Joint at Any Time for Human Motion GenerationarXiv 2023InfiniteVGGT: Visual Geometry Grounded Transformer for Endless StreamsarXiv 2026GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal GenerationarXiv 2025Around the World in 80 Timesteps: A Generative Approach to Global Visual GeolocationCVPR 2025 1SEAL: Synergistic Co-Evolution of Agents and Learning EnvironmentsarXiv 2026UXAgent: An LLM Agent-Based Usability Testing Framework for Web DesignarXiv 2025ControlLight: Towards Controllable, Consistent, and Generalizable Low-Light EnhancementarXiv 2026Better speech synthesis through scalingarXiv 2023V2X-Radar: A Multi-modal Dataset with 4D Radar for Cooperative PerceptionarXiv 2024Leveraging Temporal Contextualization for Video Action RecognitionarXiv 2024NEFTune: Noisy Embeddings Improve Instruction FinetuningarXiv 2023Towards Light-weight and Real-time Line Segment DetectionarXiv 2021Fine-Grained Head Pose Estimation Without KeypointsarXiv 2017Prithvi-EO-2.0: A Versatile Multi-Temporal Foundation Model for Earth Observation ApplicationsarXiv 2024DEFAME: Dynamic Evidence-based FAct-checking with Multimodal ExpertsarXiv 2024Multi-SWE-bench: A Multilingual Benchmark for Issue ResolvingarXiv 2025Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language ModelsarXiv 2023vHeat: Building Vision Models upon Heat ConductionarXiv 2024InstructIR: High-Quality Image Restoration Following Human InstructionsarXiv 2024Model-Based Image Signal Processors via Learnable DictionariesarXiv 2022Vript: A Video Is Worth Thousands of WordsarXiv 2024LoRA-Pro: Are Low-Rank Adapters Properly Optimized?arXiv 2024ENIGMA-51: Towards a Fine-Grained Understanding of Human-Object Interactions in Industrial ScenariosarXiv 2023Molecular Sets (MOSES): A Benchmarking Platform for Molecular Generation ModelsarXiv 2018Predicting Many Properties of a Quantum System from Very Few MeasurementsarXiv 2020CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent EvaluationarXiv 2024ProbPose: A Probabilistic Approach to 2D Human Pose EstimationCVPR 2025 1Scaling up Masked Diffusion Models on TextarXiv 2024Hello Edge: Keyword Spotting on MicrocontrollersarXiv 2017JDocQA: Japanese Document Question Answering Dataset for Generative Language ModelsarXiv 2024RiNALMo: General-Purpose RNA Language Models Can Generalize Well on Structure Prediction TasksarXiv 2024Expanding Language-Image Pretrained Models for General Video RecognitionarXiv 2022SliceGPT: Compress Large Language Models by Deleting Rows and ColumnsarXiv 2024MotionDiffuse: Text-Driven Human Motion Generation with Diffusion ModelarXiv 2022A Length-Extrapolatable TransformerarXiv 2022From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction TuningarXiv 2023Generalizable End-to-End Deep Learning Frameworks for Real-Time Attitude Estimation Using 6DoF Inertial Measurement UnitsarXiv 2023Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4VarXiv 2023UniScene: Unified Occupancy-centric Driving Scene GenerationCVPR 2025 1YourMT3+: Multi-instrument Music Transcription with Enhanced Transformer Architectures and Cross-dataset Stem AugmentationarXiv 2024MM-REACT: Prompting ChatGPT for Multimodal Reasoning and ActionarXiv 2023VEM: Environment-Free Exploration for Training GUI Agent with Value Environment ModelarXiv 2025FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion SynthesisarXiv 2025GLIPv2: Unifying Localization and Vision-Language UnderstandingarXiv 2022LaDI-VTON: Latent Diffusion Textual-Inversion Enhanced Virtual Try-OnarXiv 2023Cost-Effective Hyperparameter Optimization for Large Language Model Generation InferencearXiv 2023One-Minute Video Generation with Test-Time TrainingCVPR 2025 1Benchmarking and Defending Against Indirect Prompt Injection Attacks on Large Language ModelsarXiv 2023ClimaX: A foundation model for weather and climatearXiv 2023DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-InferencearXiv 2024FeatUp: A Model-Agnostic Framework for Features at Any ResolutionarXiv 2024A Survey on the Optimization of Large Language Model-based AgentsarXiv 2025RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human expertsarXiv 2024Meta Prompting for AI SystemsarXiv 2023Text4Seg: Reimagining Image Segmentation as Text GenerationarXiv 2024Progress measures for grokking via mechanistic interpretabilityarXiv 2023Human-in-the-loop Embodied Intelligence with Interactive Simulation Environment for Surgical Robot LearningarXiv 2023Exploring Large Language Model based Intelligent Agents: Definitions, Methods, and ProspectsarXiv 2024Foam-Agent: A Large Language Model-Based Multi-Agent Framework for Automating Computational Fluid Dynamics WorkflowsarXiv 2025MixFormer: End-to-End Tracking with Iterative Mixed Attentionmixformer-end-to-end-tracking-with-iterativeMobileVLM V2: Faster and Stronger Baseline for Vision Language ModelarXiv 2024Learnability Enhancement for Low-light Raw Denoising: Where Paired Real Data Meets Noise ModelingarXiv 2022AdaptThink: Reasoning Models Can Learn When to ThinkarXiv 2025DiffEditor: Boosting Accuracy and Flexibility on Diffusion-based Image EditingCVPR 2024 1Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language ModelsarXiv 2023GLaMM: Pixel Grounding Large Multimodal ModelCVPR 2024 1CREPE: A Convolutional Representation for Pitch EstimationarXiv 2018Image as Set of PointsarXiv 2023In-Context Imitation Learning via Next-Token PredictionarXiv 2024SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory TreeICCV 2025MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and ThoroughlyarXiv 2025Multimodal Whole Slide Foundation Model for PathologyarXiv 2024Benchmarking Vision, Language, & Action Models on Robotic Learning TasksarXiv 2024P-Adapters: Robustly Extracting Factual Information from Language Models with Diverse Promptsp-adapters-robustly-extracting-factualNoteLLM-2: Multimodal Large Representation Models for RecommendationarXiv 2024G3: An Effective and Adaptive Framework for Worldwide Geolocalization Using Large Multi-Modality ModelsarXiv 2024Masked Completion via Structured Diffusion with White-Box TransformersarXiv 2024The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models via Visual Information SteeringarXiv 2025Matryoshka Diffusion ModelsarXiv 2023Diffusion Probabilistic Models for 3D Point Cloud GenerationCVPR 2021 1TwiBot-22: Towards Graph-Based Twitter Bot DetectionarXiv 2022Learning to Reason without External RewardsarXiv 2025Ferret: Refer and Ground Anything Anywhere at Any GranularityarXiv 2023Cut Your Losses in Large-Vocabulary Language ModelsarXiv 2024Grokking at the Edge of Numerical StabilityarXiv 2025Code Graph Model (CGM): A Graph-Integrated Large Language Model for Repository-Level Software Engineering TasksarXiv 2025Re-thinking Temporal Search for Long-Form Video UnderstandingCVPR 2025 1Invisible Gas Detection: An RGB-Thermal Cross Attention Network and A New BenchmarkarXiv 2024Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language GenerationarXiv 2023OverLoCK: An Overview-first-Look-Closely-next ConvNet with Context-Mixing Dynamic KernelsCVPR 2025 1HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and GenerationICCV 2025Prompt-to-LeaderboardarXiv 2025EasyTPP: Towards Open Benchmarking Temporal Point ProcessesarXiv 2023UFM: A Simple Path towards Unified Dense Correspondence with FlowarXiv 2025SeerAttention-R: Sparse Attention Adaptation for Long ReasoningarXiv 2025AbstentionBench: Reasoning LLMs Fail on Unanswerable QuestionsarXiv 2025Slow Perception: Let's Perceive Geometric Figures Step-by-steparXiv 2024Discovering Language Model Behaviors with Model-Written EvaluationsarXiv 2022StructRAG: Boosting Knowledge Intensive Reasoning of LLMs via Inference-time Hybrid Information StructurizationarXiv 2024CAD-MLLM: Unifying Multimodality-Conditioned CAD Generation With MLLMarXiv 2024Animatable and Relightable Gaussians for High-fidelity Human Avatar ModelingarXiv 2023Learning Molecular Representation in a CellarXiv 2024Compressing Context to Enhance Inference Efficiency of Large Language ModelsarXiv 2023VidToMe: Video Token Merging for Zero-Shot Video EditingCVPR 2024 1Attentive Eraser: Unleashing Diffusion Model's Object Removal Potential via Self-Attention Redirection GuidancearXiv 2024DiffStyler: Diffusion-based Localized Image Style TransferarXiv 2024VibeCheck: Discover and Quantify Qualitative Differences in Large Language ModelsarXiv 2024SyncDreamer: Generating Multiview-consistent Images from a Single-view ImagearXiv 2023GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual GenerationarXiv 2024Mora: Enabling Generalist Video Generation via A Multi-Agent FrameworkarXiv 2024HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden StatesarXiv 2025GenAI Content Detection Task 3: Cross-Domain Machine-Generated Text Detection ChallengearXiv 2025HM-RAG: Hierarchical Multi-Agent Multimodal Retrieval Augmented GenerationarXiv 2025KramaBench: A Benchmark for AI Systems on Data-to-Insight Pipelines over Data LakesarXiv 2025Are large language models superhuman chemists?arXiv 2024Video-RAG: Visually-aligned Retrieval-Augmented Long Video ComprehensionarXiv 2024From Poses to Identity: Training-Free Person Re-Identification via Feature CentralizationCVPR 2025 1Mixed-Type Tabular Data Synthesis with Score-based Diffusion in Latent SpacearXiv 2023Multimodal Chain-of-Thought Reasoning in Language ModelsarXiv 2023Recurrent Relational Networksrecurrent-relational-networks-1Consistent Video-to-Video Transfer Using Synthetic DatasetarXiv 2023DynamicVis: An Efficient and General Visual Foundation Model for Remote Sensing Image UnderstandingarXiv 2025TweedieMix: Improving Multi-Concept Fusion for Diffusion-based Image/Video GenerationarXiv 2024Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference OptimizationarXiv 2025KwaiAgents: Generalized Information-seeking Agent System with Large Language ModelsarXiv 2023MoRA: High-Rank Updating for Parameter-Efficient Fine-TuningarXiv 2024Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case GeneralizationarXiv 2019VisionTS: Visual Masked Autoencoders Are Free-Lunch Zero-Shot Time Series ForecastersarXiv 2024PD-GAN: Probabilistic Diverse GAN for Image InpaintingCVPR 2021 1MixVPR: Feature Mixing for Visual Place RecognitionarXiv 2023LLM-Powered GUI Agents in Phone Automation: Surveying Progress and ProspectsarXiv 2025NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied TasksarXiv 202594% on CIFAR-10 in 3.29 Seconds on a Single GPUarXiv 2024TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming VideosarXiv 2025APISR: Anime Production Inspired Real-World Anime Super-ResolutionCVPR 2024 1AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination EvaluationarXiv 2023LLM Agents Making Agent ToolsarXiv 2025Denoising as Adaptation: Noise-Space Domain Adaptation for Image RestorationarXiv 2024A Sober Look at Progress in Language Model Reasoning: Pitfalls and Paths to ReproducibilityarXiv 2025Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRsarXiv 2025VideoICL: Confidence-based Iterative In-context Learning for Out-of-Distribution Video UnderstandingCVPR 2025 1MatchTime: Towards Automatic Soccer Game Commentary GenerationarXiv 2024

Back to Papers