All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
WeatherGS: 3D Scene Reconstruction in Adverse Weather Conditions via Gaussian SplattingarXiv 2024MCP Safety Audit: LLMs with the Model Context Protocol Allow Major Security ExploitsarXiv 2025GRM: Large Gaussian Reconstruction Model for Efficient 3D Reconstruction and GenerationarXiv 2024On the Reliability of Watermarks for Large Language ModelsarXiv 2023A Survey on Large Language Models for Code GenerationarXiv 2024Accurate Leukocyte Detection Based on Deformable-DETR and Multi-Level Feature Fusion for Aiding Diagnosis of Blood DiseasesarXiv 2024Compression-Aware One-Step Diffusion Model for JPEG Artifact RemovalICCV 2025Mask3D: Mask Transformer for 3D Semantic Instance SegmentationarXiv 2022DistiLLM-2: A Contrastive Approach Boosts the Distillation of LLMsarXiv 2025Deep Learning and Foundation Models for Weather Prediction: A SurveyarXiv 2025Large Language Model Guided Tree-of-ThoughtarXiv 2023Run, Don't Walk: Chasing Higher FLOPS for Faster Neural NetworksCVPR 2023 1You Only Look at Once for Real-time and Generic Multi-TaskarXiv 2023Raindrop Clarity: A Dual-Focused Dataset for Day and Night Raindrop RemovalarXiv 2024Improved Techniques for Optimization-Based Jailbreaking on Large Language ModelsarXiv 2024R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy OptimizationarXiv 2025GaLore: Memory-Efficient LLM Training by Gradient Low-Rank ProjectionarXiv 2024OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement LearningarXiv 2025Recommendation as Language Processing (RLP): A Unified Pretrain, Personalized Prompt & Predict Paradigm (P5)arXiv 2022Dome-DETR: DETR with Density-Oriented Feature-Query Manipulation for Efficient Tiny Object DetectionarXiv 2025VM-UNet: Vision Mamba UNet for Medical Image SegmentationarXiv 2024TVQA+: Spatio-Temporal Grounding for Video Question Answeringtvqa-spatio-temporal-grounding-for-video-1Efficient Reasoning Models: A SurveyarXiv 2025MatterGen: a generative model for inorganic materials designarXiv 2023AlphaMaze: Enhancing Large Language Models' Spatial Intelligence via GRPOarXiv 2025Repetition Improves Language Model EmbeddingsarXiv 2024Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and ActionarXiv 2023ConsistentID: Portrait Generation with Multimodal Fine-Grained Identity PreservingarXiv 2024MambaMIL: Enhancing Long Sequence Modeling with Sequence Reordering in Computational PathologyarXiv 2024MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language ModelsarXiv 2023MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language ModelsarXiv 2024CAD-Assistant: Tool-Augmented VLLMs as Generic CAD Task SolversarXiv 2024Towards Generalist Robot Policies: What Matters in Building Vision-Language-Action ModelsarXiv 2024Articulate-Anything: Automatic Modeling of Articulated Objects via a Vision-Language Foundation ModelarXiv 2024Spiking Transformer with Spatial-Temporal AttentionCVPR 2025 1RAG Foundry: A Framework for Enhancing LLMs for Retrieval Augmented GenerationarXiv 2024Video Depth without Video ModelsCVPR 2025 1SatlasPretrain: A Large-Scale Dataset for Remote Sensing Image UnderstandingICCV 2023 1s3: You Don't Need That Much Data to Train a Search Agent via RLarXiv 2025InstantStyle: Free Lunch towards Style-Preserving in Text-to-Image GenerationarXiv 2024Text-to-CAD Generation Through Infusing Visual Feedback in Large Language ModelsarXiv 2025DiscoveryBench: Towards Data-Driven Discovery with Large Language ModelsarXiv 2024Sequoia: Scalable, Robust, and Hardware-aware Speculative DecodingarXiv 2024Easi3R: Estimating Disentangled Motion from DUSt3R Without TrainingICCV 2025The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed TextarXiv 2025MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought ReasoningarXiv 2025Fact-Checking the Output of Large Language Models via Token-Level Uncertainty QuantificationarXiv 2024FLAIR #1: semantic segmentation and domain adaptation datasetarXiv 2022Flash-LLM: Enabling Cost-Effective and Highly-Efficient Large Generative Model Inference with Unstructured SparsityarXiv 2023Reshape Dimensions Network for Speaker Recognitionreshape-dimensions-network-for-speakerReferring to Any PersonICCV 2025VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought ReasoningarXiv 2025VisualCloze: A Universal Image Generation Framework via Visual In-Context LearningICCV 2025T-Rex2: Towards Generic Object Detection via Text-Visual Prompt SynergyarXiv 2024MineWorld: a Real-Time and Open-Source Interactive World Model on MinecraftarXiv 2025Auto-RAG: Autonomous Retrieval-Augmented Generation for Large Language ModelsarXiv 2024LLaMA-Omni: Seamless Speech Interaction with Large Language ModelsarXiv 2024Multi-News: a Large-Scale Multi-Document Summarization Dataset and Abstractive Hierarchical Modelmulti-news-a-large-scale-multi-document-1Zero-Shot Learners for Natural Language Understanding via a Unified Multiple Choice PerspectivearXiv 2022EvolveGCN: Evolving Graph Convolutional Networks for Dynamic GraphsarXiv 2019Follow Anything: Open-set detection, tracking, and following in real-timearXiv 2023Programming Refusal with Conditional Activation SteeringarXiv 2024OpenScholar: Synthesizing Scientific Literature with Retrieval-augmented LMsarXiv 2024Motion-Guided Latent Diffusion for Temporally Consistent Real-world Video Super-resolutionarXiv 2023PINNacle: A Comprehensive Benchmark of Physics-Informed Neural Networks for Solving PDEsarXiv 2023MoC: Mixtures of Text Chunking Learners for Retrieval-Augmented Generation SystemarXiv 2025Meta-Chunking: Learning Text Segmentation and Semantic Completion via Logical PerceptionarXiv 2024StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video GenerationarXiv 2024GaussTR: Foundation Model-Aligned Gaussian Transformer for Self-Supervised 3D Spatial UnderstandingCVPR 2025 1SeaS: Few-shot Industrial Anomaly Image Generation with Separation and Sharing Fine-tuningICCV 2025Matte Anything: Interactive Natural Image Matting with Segment Anything ModelsarXiv 2023Mask-Adapter: The Devil is in the Masks for Open-Vocabulary SegmentationCVPR 2025 1AnomalyNCD: Towards Novel Anomaly Class Discovery in Industrial ScenariosCVPR 2025 1CSC-SQL: Corrective Self-Consistency in Text-to-SQL via Reinforcement LearningarXiv 2025MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their MixarXiv 2025MV-VTON: Multi-View Virtual Try-On with Diffusion ModelsarXiv 2024SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model CompressionarXiv 2024SEC-bench: Automated Benchmarking of LLM Agents on Real-World Software Security TasksarXiv 2025VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame SelectionCVPR 2025 1HyperagentsarXiv 2026Affordance-based Robot Manipulation with Flow MatchingarXiv 2024TrustLLM: Trustworthiness in Large Language ModelsarXiv 2024Distilling LLM Agent into Small Models with Retrieval and Code ToolsarXiv 2025Prisma: An Open Source Toolkit for Mechanistic Interpretability in Vision and VideoarXiv 2025Learnable Item Tokenization for Generative RecommendationarXiv 2024AgentKit: Structured LLM Reasoning with Dynamic GraphsarXiv 2024SQL-R1: Training Natural Language to SQL Reasoning Model By Reinforcement LearningarXiv 2025Hume: Introducing System-2 Thinking in Visual-Language-Action ModelarXiv 2025Watermarking Autoregressive Image GenerationarXiv 2025RealPDEBench: A Benchmark for Complex Physical Systems with Real-World DataarXiv 2026Stereo4D: Learning How Things Move in 3D from Internet Stereo VideosCVPR 2025 1OpenR: An Open Source Framework for Advanced Reasoning with Large Language ModelsarXiv 2024AgentReview: Exploring Peer Review Dynamics with LLM AgentsarXiv 2024Qwen3-Coder-Next Technical ReportarXiv 2026VILA-M3: Enhancing Vision-Language Models with Medical Expert KnowledgeCVPR 2025 1TRACER: Trace-Based Adaptive Cost-Efficient Routing for LLM ClassificationarXiv 2026Real2Render2Real: Scaling Robot Data Without Dynamics Simulation or Robot HardwarearXiv 2025BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in ChinesearXiv 2025SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object ManipulationarXiv 2025Story-Adapter: A Training-free Iterative Framework for Long Story VisualizationarXiv 2024A DeNoising FPN With Transformer R-CNN for Tiny Object DetectionarXiv 2024Streaming Video Understanding and Multi-round Interaction with Memory-enhanced KnowledgearXiv 2025OpenGame: Open Agentic Coding for GamesarXiv 2026SIDA: Social Media Image Deepfake Detection, Localization and Explanation with Large Multimodal ModelCVPR 2025 1VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video UnderstandingarXiv 2024Predictive Data Selection: The Data That Predicts Is the Data That TeachesarXiv 2025AgentBoard: An Analytical Evaluation Board of Multi-turn LLM AgentsarXiv 2024C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Modelsc-eval-a-multi-level-multi-discipline-chineseSpotting LLMs With Binoculars: Zero-Shot Detection of Machine-Generated TextarXiv 2024MASLab: A Unified and Comprehensive Codebase for LLM-based Multi-Agent SystemsarXiv 2025Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement LearningarXiv 2025Bayesian Prompt Flow Learning for Zero-Shot Anomaly DetectionCVPR 2025 1FM-Fusion: Instance-aware Semantic Mapping Boosted by Vision-Language Foundation ModelsarXiv 2024Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language ModelsarXiv 2024Scaling Diffusion Language Models via Adaptation from Autoregressive ModelsarXiv 2024GraphGPT: Graph Instruction Tuning for Large Language ModelsarXiv 2023EasyRec: Simple yet Effective Language Models for RecommendationarXiv 2024Rethinking Space-Time Networks with Improved Memory Coverage for Efficient Video Object SegmentationNeurIPS 2021 12CascadePSP: Toward Class-Agnostic and Very High-Resolution Segmentation via Global and Local Refinementcascadepsp-toward-class-agnostic-and-very-1Astraios: Parameter-Efficient Instruction Tuning Code Large Language ModelsarXiv 2024Plan-and-Solve Prompting: Improving Zero-Shot Chain-of-Thought Reasoning by Large Language ModelsarXiv 2023PersonaLLM: Investigating the Ability of Large Language Models to Express Personality TraitsarXiv 2023Transformer Interpretability Beyond Attention VisualizationCVPR 2021 1Revealing Key Details to See Differences: A Novel Prototypical Perspective for Skeleton-based Action RecognitionCVPR 2025 1SpatialTracker: Tracking Any 2D Pixels in 3D SpaceCVPR 2024 1The Many Faces of Robustness: A Critical Analysis of Out-of-Distribution GeneralizationICCV 2021 10TokenSkip: Controllable Chain-of-Thought Compression in LLMsarXiv 2025Democratizing Neural Machine Translation with OPUS-MTarXiv 2022HyenaDNA: Long-Range Genomic Sequence Modeling at Single Nucleotide ResolutionNeurIPS 2023 11Simple linear attention language models balance the recall-throughput tradeoffarXiv 2024mAIstro: an open-source multi-agentic system for automated end-to-end development of radiomics and deep learning models for medical imagingarXiv 2025Continuous Diffusion Model for Language ModelingarXiv 2025Score-based Generative Modeling of Graphs via the System of Stochastic Differential EquationsarXiv 2022Audio-visual Controlled Video Diffusion with Masked Selective State Spaces Modeling for Natural Talking Head GenerationICCV 2025DaGAN++: Depth-Aware Generative Adversarial Network for Talking Head Video GenerationarXiv 2023A Survey of Large Language Models in Finance (FinLLMs)arXiv 2024EquiBind: Geometric Deep Learning for Drug Binding Structure PredictionarXiv 2022Rotation-Invariant Transformer for Point Cloud MatchingCVPR 2023 1CLLMs: Consistency Large Language ModelsarXiv 2024AANet: Adaptive Aggregation Network for Efficient Stereo Matchingaanet-adaptive-aggregation-network-for-1Real-Time Bidding by Reinforcement Learning in Display AdvertisingarXiv 2017Towards Assessing and Benchmarking Risk-Return Tradeoff of Off-Policy EvaluationarXiv 2023Bridging the Vision-Brain Gap with an Uncertainty-Aware Blur Priorbridging-the-vision-brain-gap-with-anLLM Inference Unveiled: Survey and Roofline Model InsightsarXiv 2024Unlocking Efficient Long-to-Short LLM Reasoning with Model MergingarXiv 2025Phased Consistency ModelsarXiv 2024Optimal Counterfactual Explanations for Scorecard modellingarXiv 2021Invertible Diffusion Models for Compressed SensingarXiv 2024DexGrasp Anything: Towards Universal Robotic Dexterous Grasping with Physics AwarenessCVPR 2025 1Expanding Scene Graph Boundaries: Fully Open-vocabulary Scene Graph Generation via Visual-Concept Alignment and RetentionarXiv 2023Go-with-the-Flow: Motion-Controllable Video Diffusion Models Using Real-Time Warped NoiseCVPR 2025 1From Sparse to Soft Mixtures of ExpertsarXiv 2023Transformers learn in-context by gradient descentarXiv 2022SemiVL: Semi-Supervised Semantic Segmentation with Vision-Language GuidancearXiv 2023Deep Reinforcement Learning at the Edge of the Statistical PrecipiceNeurIPS 2021 12Latent Space Super-Resolution for Higher-Resolution Image Generation with Diffusion ModelsCVPR 2025 1Super-Resolution Neural OperatorCVPR 2023 1Look Twice Before You Answer: Memory-Space Visual Retracing for Hallucination Mitigation in Multimodal Large Language ModelsarXiv 2024MobileNeRF: Exploiting the Polygon Rasterization Pipeline for Efficient Neural Field Rendering on Mobile ArchitecturesCVPR 2023 1AutoMind: Adaptive Knowledgeable Agent for Automated Data SciencearXiv 2025PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified FrameworkarXiv 2025Matryoshka Query Transformer for Large Vision-Language ModelsarXiv 2024TIPS: Text-Image Pretraining with Spatial AwarenessarXiv 2024Tracr: Compiled Transformers as a Laboratory for Interpretabilitytracr-compiled-transformers-as-a-laboratoryProactive Agents for Multi-Turn Text-to-Image Generation Under UncertaintyarXiv 2024Do generative video models understand physical principles?arXiv 2025Large Language Models as OptimizersarXiv 2023Efficient and Modular Implicit Differentiationefficient-and-modular-implicit-1DynIBaR: Neural Dynamic Image-Based RenderingCVPR 2023 1NeuroClips: Towards High-fidelity and Smooth fMRI-to-Video ReconstructionarXiv 2024CodeSearchNet Challenge: Evaluating the State of Semantic Code SearcharXiv 2019Large Language Model-Powered Smart Contract Vulnerability Detection: New PerspectivesarXiv 2023Harmful Fine-tuning Attacks and Defenses for Large Language Models: A SurveyarXiv 2024GLIGEN: Open-Set Grounded Text-to-Image GenerationCVPR 2023 1Goedel-Prover: A Frontier Model for Open-Source Automated Theorem ProvingarXiv 2025Three scenarios for continual learningarXiv 2019InstaFlow: One Step is Enough for High-Quality Diffusion-Based Text-to-Image GenerationarXiv 2023Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language TasksarXiv 2022MegaLoc: One Retrieval to Place Them AllarXiv 2025Real-time 3D-aware Portrait Video Relightingreal-time-3d-aware-portrait-video-relightingIn-context Autoencoder for Context Compression in a Large Language ModelarXiv 2023Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical FeedbackarXiv 2025InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward ModelarXiv 2025DualFocus: Integrating Macro and Micro Perspectives in Multi-modal Large Language ModelsarXiv 2024ShareGPT4V: Improving Large Multi-Modal Models with Better CaptionsarXiv 2023RobustSplat: Decoupling Densification and Dynamics for Transient-Free 3DGSICCV 2025SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative PipelinearXiv 2025DexGarmentLab: Dexterous Garment Manipulation Environment with Generalizable PolicyarXiv 2025Are Random Decompositions all we need in High Dimensional Bayesian Optimisation?arXiv 2023Iterative Geometry Encoding Volume for Stereo MatchingCVPR 2023 1O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?arXiv 2024Deep Learning Based Assessment of Synthetic Speech NaturalnessarXiv 2021Visual News: Benchmark and Challenges in News Image CaptioningEMNLP 2021 11HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at ScalearXiv 2024DISC-LawLLM: Fine-tuning Large Language Models for Intelligent Legal ServicesarXiv 2023Effective Pre-Training of Audio Transformers for Sound Event DetectionarXiv 2024Searching for Best Practices in Retrieval-Augmented GenerationarXiv 2024HuatuoGPT, towards Taming Language Model to Be a DoctorarXiv 2023CoD, Towards an Interpretable Medical Agent using Chain of DiagnosisarXiv 2024Huatuo-26M, a Large-scale Chinese Medical QA DatasetarXiv 2023