All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Compact 3D Scene Representation via Self-Organizing Gaussian GridsarXiv 2023LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language ModelsarXiv 2025WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World ModelarXiv 2025ChatTime: A Unified Multimodal Time Series Foundation Model Bridging Numerical and Textual DataarXiv 2024Deja Vu: Contextual Sparsity for Efficient LLMs at Inference TimearXiv 2023FlexLLM: A System for Co-Serving Large Language Model Inference and Parameter-Efficient FinetuningarXiv 2024Multimodal Federated Learning via Contrastive Representation EnsemblearXiv 2023JaxMARL: Multi-Agent RL Environments and Algorithms in JAXarXiv 2023FLERT: Document-Level Features for Named Entity RecognitionarXiv 2020Cross-modal Information Flow in Multimodal Large Language ModelsCVPR 2025 1Securing AI Agents with Information-Flow ControlarXiv 2025FaceDancer: Pose- and Occlusion-Aware High Fidelity Face SwappingarXiv 2022FATE-LLM: A Industrial Grade Federated Learning Framework for Large Language ModelsarXiv 2023R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal FormalizationarXiv 2025A Simple Baseline for Spoken Language to Sign Language Translation with 3D AvatarsarXiv 2024LLaVA-KD: A Framework of Distilling Multimodal Large Language ModelsarXiv 2024Multi-Agent System for Comprehensive Soccer UnderstandingarXiv 2025SegEarth-R1: Geospatial Pixel Reasoning via Large Language ModelarXiv 2025MaterialMVP: Illumination-Invariant Material Generation via Multi-view PBR DiffusionICCV 2025HiMTok: Learning Hierarchical Mask Tokens for Image Segmentation with Large Multimodal ModelICCV 2025Make LoRA Great Again: Boosting LoRA with Adaptive Singular Values and Mixture-of-Experts Optimization AlignmentarXiv 2025The Stable Signature: Rooting Watermarks in Latent Diffusion ModelsICCV 2023 1SONAR: Sentence-Level Multimodal and Language-Agnostic RepresentationsarXiv 2023UnCommon Objects in 3DCVPR 2025 1The Road Less ScheduledarXiv 2024Robust Dynamic Radiance FieldsCVPR 2023 1SLIP: Self-supervision meets Language-Image Pre-trainingarXiv 2021Libri-Light: A Benchmark for ASR with Limited or No SupervisionarXiv 2019Information Flow Routes: Automatically Interpreting Language Models at ScalearXiv 2024Memory MosaicsarXiv 2024A Distributed Data-Parallel PyTorch Implementation of the Distributed Shampoo Optimizer for Training Neural Networks At-ScalearXiv 2023MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use CasesarXiv 2024FlowLLM: Flow Matching for Material Generation with Large Language Models as Base DistributionsarXiv 2024emg2qwerty: A Large Dataset with Baselines for Touch Typing using Surface ElectromyographyarXiv 2024MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPOarXiv 2025SketchAgent: Language-Driven Sequential Sketch GenerationCVPR 2025 1Ego4D: Around the World in 3,000 Hours of Egocentric VideoCVPR 2022 1EARS: An Anechoic Fullband Speech Dataset Benchmarked for Speech Enhancement and DereverberationarXiv 2024VideoCutLER: Surprisingly Simple Unsupervised Video Instance SegmentationCVPR 2024 1CRAG -- Comprehensive RAG BenchmarkarXiv 2024Unsupervised pretraining transfers well across languagesarXiv 2020Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Predictionlearning-audio-visual-speech-representationUnsupervised Dense Information Retrieval with Contrastive LearningarXiv 2021From Audio to Photoreal Embodiment: Synthesizing Humans in ConversationsCVPR 2024 1MMM: Generative Masked Motion ModelCVPR 2024 1MVGenMaster: Scaling Multi-View Generation from Any Image via 3D Priors Enhanced Diffusion ModelCVPR 2025 1FLAIR: VLM with Fine-grained Language-informed Image RepresentationsCVPR 2025 1HARDVS: Revisiting Human Activity Recognition with Dynamic Vision SensorsarXiv 2022WikiWeb2M: A Page-Level Multimodal Wikipedia DatasetarXiv 2023One-shot Empirical Privacy Estimation for Federated LearningarXiv 2023WIT: Wikipedia-based Image Text Dataset for Multimodal Multilingual Machine LearningarXiv 2021Wave-U-Net: A Multi-Scale Neural Network for End-to-End Audio Source SeparationarXiv 2018Parsel: Algorithmic Reasoning with Language Models by Composing DecompositionsarXiv 2022RepoQA: Evaluating Long Context Code UnderstandingarXiv 2024Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model TutorsarXiv 2024LaMI-DETR: Open-Vocabulary Detection with Language Model InstructionarXiv 2024MEDITRON-70B: Scaling Medical Pretraining for Large Language ModelsarXiv 2023Real-time and Continuous Turn-taking Prediction Using Voice Activity ProjectionarXiv 2024Lotus: Diffusion-based Visual Foundation Model for High-quality Dense PredictionarXiv 2024Agent-E: From Autonomous Web Navigation to Foundational Design Principles in Agentic SystemsarXiv 2024MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMsarXiv 2025PICARD: Parsing Incrementally for Constrained Auto-Regressive Decoding from Language ModelsEMNLP 2021 11NanoFlow: Towards Optimal Large Language Model Serving ThroughputarXiv 2024SAT-HMR: Real-Time Multi-Person 3D Mesh Estimation via Scale-Adaptive TokensCVPR 2025 1Automated Deep Learning: Neural Architecture Search Is Not the EndarXiv 2021Generalized Interpolating Discrete DiffusionarXiv 2025SciMON: Scientific Inspiration Machines Optimized for NoveltyarXiv 2023mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and VideoarXiv 2023mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connectionsarXiv 2022GrootVL: Tree Topology is All You Need in State Space ModelarXiv 2024Spherical Transformer for LiDAR-based 3D RecognitionCVPR 2023 1XLand-MiniGrid: Scalable Meta-Reinforcement Learning Environments in JAXarXiv 2023LLaMA-VID: An Image is Worth 2 Tokens in Large Language ModelsarXiv 2023Leveraging Online Olympiad-Level Math Problems for LLMs Training and Contamination-Resistant EvaluationarXiv 2025EMO: Earth Mover Distance Optimization for Auto-Regressive Language ModelingarXiv 2023Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language ModelsarXiv 2024ATOM3D: Tasks On Molecules in Three Dimensionsatom3d-tasks-on-molecules-in-three-dimensionsGenEval: An Object-Focused Framework for Evaluating Text-to-Image AlignmentNeurIPS 2023 11Inductive Entity Representations from Text via Link PredictionarXiv 2020More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning ModelsarXiv 2025SkillBlender: Towards Versatile Humanoid Whole-Body Loco-Manipulation via Skill BlendingarXiv 2025PraNet: Parallel Reverse Attention Network for Polyp SegmentationarXiv 2020TaskCraft: Automated Generation of Agentic TasksarXiv 2025ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical ReasoningarXiv 2025Tent: Fully Test-time Adaptation by Entropy Minimizationtent-fully-test-time-adaptation-by-entropyJanus-Pro: Unified Multimodal Understanding and Generation with Data and Model ScalingarXiv 2025Competition-Level Code Generation with AlphaCodecompetition-level-code-generation-withDeepSeek-Prover-V1.5: Harnessing Proof Assistant Feedback for Reinforcement Learning and Monte-Carlo Tree SearcharXiv 2024TEMPO: Prompt-based Generative Pre-trained Transformer for Time Series ForecastingarXiv 2023TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference OptimizationarXiv 2024Token Merging for Fast Stable DiffusionarXiv 2023Attention-Challenging Multiple Instance Learning for Whole Slide Image ClassificationarXiv 2023HybridNets: End-to-End Perception Networkhybridnets-end-to-end-perception-networkGenerative AI for Autonomous Driving: Frontiers and OpportunitiesarXiv 2025Operationalizing a Threat Model for Red-Teaming Large Language Models (LLMs)arXiv 2024Moroccan Dialect -Darija- Open DatasetarXiv 2021MotionLCM: Real-time Controllable Motion Generation via Latent Consistency ModelarXiv 2024AsyncDiff: Parallelizing Diffusion Models by Asynchronous DenoisingarXiv 2024Exploring Temporally-Aware Features for Point TrackingCVPR 2025 1ViperGPT: Visual Inference via Python Execution for ReasoningICCV 2023 1You Only Need 90K Parameters to Adapt Light: A Light Weight Transformer for Image Enhancement and Exposure CorrectionarXiv 2022Large Language Model Can Transcribe Speech in Multi-Talker Scenarios with Versatile InstructionsarXiv 2024Fixing the Double Penalty in Data-Driven Weather Forecasting Through a Modified Spherical Harmonic Loss FunctionarXiv 2025Improving the Stability and Efficiency of Diffusion Models for Content Consistent Super-ResolutionarXiv 2023lambeq: An Efficient High-Level Python Library for Quantum NLParXiv 2021Semantic Understanding of Scenes through the ADE20K DatasetarXiv 2016Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?arXiv 2025Sufficient Context: A New Lens on Retrieval Augmented Generation SystemsarXiv 2024X-ARES: A Comprehensive Framework for Assessing Audio Encoder PerformancearXiv 2025HYDRA: A Hyper Agent for Dynamic Compositional Visual ReasoningarXiv 20243D Convex Splatting: Radiance Field Rendering with 3D Smooth ConvexesCVPR 2025 1Opportunities and Risks of LLMs for Scalable Deliberation with PolisarXiv 2023MLE-Dojo: Interactive Environments for Empowering LLM Agents in Machine Learning EngineeringarXiv 2025EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement LearningarXiv 2025CLUE: A Chinese Language Understanding Evaluation BenchmarkCOLING 2020 8Photorealistic Style Transfer via Wavelet Transformsphotorealistic-style-transfer-via-wavelet-1StarGAN v2: Diverse Image Synthesis for Multiple Domainsstargan-v2-diverse-image-synthesis-for-1Attention Distillation: A Unified Approach to Visual Characteristics TransferCVPR 2025 1GlotLID: Language Identification for Low-Resource LanguagesarXiv 2023CityFlow: A Multi-Agent Reinforcement Learning Environment for Large Scale City Traffic ScenarioarXiv 2019GeoQA: A Geometric Question Answering Benchmark Towards Multimodal Numerical ReasoningFindings (ACL) 2021 8Change-Agent: Towards Interactive Comprehensive Remote Sensing Change Interpretation and AnalysisarXiv 2024A Survey on Video Diffusion ModelsarXiv 2023Toward reliable signals decoding for electroencephalogram: A benchmark study to EEGNeXarXiv 2022AniDoc: Animation Creation Made EasierCVPR 2025 1CrossFormer: A Versatile Vision Transformer Hinging on Cross-scale Attentioncrossformer-a-versatile-vision-transformer-1On the Expressive Power of Geometric Graph Neural NetworksarXiv 2023Multi-modal Molecule Structure-text Model for Text-based Retrieval and EditingarXiv 2022Compositional Chain-of-Thought Prompting for Large Multimodal ModelsCVPR 2024 1RankZephyr: Effective and Robust Zero-Shot Listwise Reranking is a Breeze!arXiv 2023CRAB: Cross-environment Agent Benchmark for Multimodal Language Model AgentsarXiv 2024T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoTarXiv 2025NExtLong: Toward Effective Long-Context Training without Long DocumentsarXiv 2025Visual Spatial ReasoningarXiv 2022Fluctuation-based Adaptive Structured Pruning for Large Language ModelsarXiv 2023dKV-Cache: The Cache for Diffusion Language ModelsarXiv 2025RL Tango: Reinforcing Generator and Verifier Together for Language ReasoningarXiv 2025SMPLer-X: Scaling Up Expressive Human Pose and Shape Estimationsmpler-x-scaling-up-expressive-human-pose-andLLMOPT: Learning to Define and Solve General Optimization Problems from ScratcharXiv 2024HumanRig: Learning Automatic Rigging for Humanoid Character in a Large Scale DatasetCVPR 2025 1Designing a Better Asymmetric VQGAN for StableDiffusionarXiv 2023X-Dyna: Expressive Dynamic Human Image AnimationCVPR 2025 1Test3R: Learning to Reconstruct 3D at Test TimearXiv 2025Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video ReasoningarXiv 2025ARM: Adaptive Reasoning ModelarXiv 2025FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence InferencearXiv 2025Agent-R: Training Language Model Agents to Reflect via Iterative Self-TrainingarXiv 2025Towards Trustworthy Retrieval Augmented Generation for Large Language Models: A SurveyarXiv 2025BEHAVIOR Robot Suite: Streamlining Real-World Whole-Body Manipulation for Everyday Household ActivitiesarXiv 2025The GAN is dead; long live the GAN! A Modern GAN BaselinearXiv 2025A Minimalist Approach to LLM Reasoning: from Rejection Sampling to ReinforcearXiv 2025Enhancing Autonomous Driving Systems with On-Board Deployed Large Language ModelsarXiv 2025ALE-Bench: A Benchmark for Long-Horizon Objective-Driven Algorithm EngineeringarXiv 2025SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM ReasoningarXiv 2025Tevatron 2.0: Unified Document Retrieval Toolkit across Scale, Language, and ModalityarXiv 2025SocioVerse: A World Model for Social Simulation Powered by LLM Agents and A Pool of 10 Million Real-World UsersarXiv 2025Towards the TopMost: A Topic Modeling System ToolkitarXiv 2023Quartet: Native FP4 Training Can Be Optimal for Large Language ModelsarXiv 2025LM-Nav: Robotic Navigation with Large Pre-Trained Models of Language, Vision, and ActionarXiv 2022UIEC^2-Net: CNN-based Underwater Image Enhancement Using Two Color SpacearXiv 2021Tokenize Image Patches: Global Context Fusion for Effective Haze Removal in Large ImagesCVPR 2025 1SelfCodeAlign: Self-Alignment for Code GenerationarXiv 2024An Empirical Study of Qwen3 QuantizationarXiv 2025CivRealm: A Learning and Reasoning Odyssey in Civilization for Decision-Making AgentsarXiv 2024Spike-driven Transformer V2: Meta Spiking Neural Network Architecture Inspiring the Design of Next-generation Neuromorphic ChipsarXiv 2024PLeak: Prompt Leaking Attacks against Large Language Model ApplicationsarXiv 2024PDE-Transformer: Efficient and Versatile Transformers for Physics SimulationsarXiv 2025MetaUAS: Universal Anomaly Segmentation with One-Prompt Meta-LearningarXiv 2025FinRL-DeepSeek: LLM-Infused Risk-Sensitive Reinforcement Learning for Trading AgentsarXiv 2025Sylber: Syllabic Embedding Representation of Speech from Raw AudioarXiv 2024A Token is Worth over 1,000 Tokens: Efficient Knowledge Distillation through Low-Rank ClonearXiv 2025BusterX: MLLM-Powered AI-Generated Video Forgery Detection and ExplanationarXiv 2025Scaling Computer-Use Grounding via User Interface Decomposition and SynthesisarXiv 2025Rex-Thinker: Grounded Object Referring via Chain-of-Thought ReasoningarXiv 2025Streaming Video Question-Answering with In-context Video KV-Cache RetrievalarXiv 2025AerialMegaDepth: Learning Aerial-Ground Reconstruction and View SynthesisCVPR 2025 1BDD100K: A Diverse Driving Dataset for Heterogeneous Multitask Learningbdd100k-a-diverse-driving-dataset-forLight-A-Video: Training-free Video Relighting via Progressive Light FusionarXiv 2025Towards General-Purpose Model-Free Reinforcement LearningarXiv 2025Bayes' Rays: Uncertainty Quantification for Neural Radiance FieldsCVPR 2024 1Tina: Tiny Reasoning Models via LoRAarXiv 2025Rotation Equivariant CNNs for Digital PathologyarXiv 2018MedXpertQA: Benchmarking Expert-Level Medical Reasoning and UnderstandingarXiv 2025Stochastic Batch Acquisition: A Simple Baseline for Deep Active LearningarXiv 2021JudgeLM: Fine-tuned Large Language Models are Scalable JudgesarXiv 2023OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization DataarXiv 2025Diffusion Feedback Helps CLIP See BetterarXiv 2024SegVol: Universal and Interactive Volumetric Medical Image SegmentationarXiv 2023KITTI-360: A Novel Dataset and Benchmarks for Urban Scene Understanding in 2D and 3DarXiv 2021GTA: A Geometry-Aware Attention Mechanism for Multi-View TransformersarXiv 2023Convolutional Occupancy NetworksECCV 2020 8Transformers Can Do Bayesian Inferencetransformers-can-do-bayesian-inferenceRepairLLaMA: Efficient Representations and Fine-Tuned Adapters for Program RepairarXiv 2023BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language ModelsarXiv 2025Thinking vs. Doing: Agents that Reason by Scaling Test-Time InteractionarXiv 2025BitVLA: 1-bit Vision-Language-Action Models for Robotics ManipulationarXiv 2025Solving Inequality Proofs with Large Language ModelsarXiv 2025Rankify: A Comprehensive Python Toolkit for Retrieval, Re-Ranking, and Retrieval-Augmented GenerationarXiv 2025Don't be lazy: CompleteP enables compute-efficient deep transformersarXiv 2025AraGPT2: Pre-Trained Transformer for Arabic Language GenerationEACL (WANLP) 2021 4