0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

LWGANet: A Lightweight Group Attention Backbone for Remote Sensing Visual TasksarXiv 2025LEGNet: Lightweight Edge-Gaussian Driven Network for Low-Quality Remote Sensing Image Object DetectionarXiv 2025PIGEON: Predicting Image GeolocationsCVPR 2024 1GaussianEditor: Swift and Controllable 3D Editing with Gaussian SplattingCVPR 2024 1Multimodal OCR: Parse Anything from DocumentsarXiv 2026Causal World Modeling for Robot ControlarXiv 2026R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement LearningarXiv 2025Multi-Objective Reinforcement Learning Based on Decomposition: A Taxonomy and FrameworkarXiv 2023Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary SegmentationICCV 2025Next Token Prediction Towards Multimodal Intelligence: A Comprehensive SurveyarXiv 2024TidyBot++: An Open-Source Holonomic Mobile Manipulator for Robot LearningarXiv 2024SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song GenerationarXiv 2025Frequency Dynamic Convolution for Dense Image PredictionCVPR 2025 1SciAtlas: A Computable Atlas of Science for Knowledge-Grounded AI ResearcharXiv 2026SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software EvolutionarXiv 2025Towards Better Instruction Following Language Models for Chinese: Investigating the Impact of Training Data and EvaluationarXiv 2023One Diffusion to Generate Them AllCVPR 2025 1MambaAD: Exploring State Space Models for Multi-class Unsupervised Anomaly DetectionarXiv 2024Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based AgentsarXiv 2024Gaussian Mixture Flow Matching ModelsarXiv 2025PyReason: Software for Open World Temporal LogicarXiv 2023World Model on Million-Length Video And Language With Blockwise RingAttentionarXiv 2024RSMamba: Remote Sensing Image Classification with State Space ModelarXiv 2024GEM: Empowering MLLM for Grounded ECG Understanding with Time Series and ImagesarXiv 2025SkateFormer: Skeletal-Temporal Transformer for Human Action RecognitionarXiv 2024Generative Medical SegmentationarXiv 2024Learning High-Frequency Continuous Action Chunks in Latent SpacearXiv 2026Spreadsheet-RL: Advancing Large Language Model Agents on Realistic Spreadsheet Tasks via Reinforcement LearningarXiv 2026OLMoTrace: Tracing Language Model Outputs Back to Trillions of Training TokensarXiv 2025Utonia: Toward One Encoder for All Point CloudsarXiv 2026BioMistral: A Collection of Open-Source Pretrained Large Language Models for Medical DomainsarXiv 2024OLinear: A Linear Model for Time Series Forecasting in Orthogonally Transformed DomainarXiv 2025FairFace: Face Attribute Dataset for Balanced Race, Gender, and AgearXiv 2019Towards Next-Generation LLM-based Recommender Systems: A Survey and BeyondarXiv 2024Generalized Trajectory Scoring for End-to-end Multimodal PlanningarXiv 2025Distributional Soft Actor-Critic with Three RefinementsarXiv 2023FLowHigh: Towards Efficient and High-Quality Audio Super-Resolution with Single-Step Flow MatchingarXiv 2025Towards Flexible Blind JPEG Artifacts RemovalICCV 2021 10Swin-UMamba: Mamba-based UNet with ImageNet-based pretrainingarXiv 2024Kolmogorov-Arnold TransformerarXiv 2024Physics-Informed Diffusion ModelsarXiv 2024LLMs Get Lost In Multi-Turn ConversationarXiv 2025Citrus: Leveraging Expert Cognitive Pathways in a Medical Language Model for Advanced Medical Decision SupportarXiv 2025EXP-Bench: Can AI Conduct AI Research Experiments?arXiv 2025Distill Any Depth: Distillation Creates a Stronger Monocular Depth EstimatorarXiv 2025DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AIarXiv 2025Planning with Diffusion for Flexible Behavior SynthesisarXiv 2022ACEBench: Who Wins the Match Point in Tool Learning?arXiv 2025SparseGPT: Massive Language Models Can Be Accurately Pruned in One-ShotarXiv 2023RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for RoboticsarXiv 2025Long-CLIP: Unlocking the Long-Text Capability of CLIParXiv 2024InCharacter: Evaluating Personality Fidelity in Role-Playing Agents through Psychological InterviewsarXiv 2023ChatHaruhi: Reviving Anime Character in Reality via Large Language ModelarXiv 2023Interpretability, Then What? Editing Machine Learning Models to Reflect Human Knowledge and ValuesarXiv 2022MindSearch: Mimicking Human Minds Elicits Deep AI SearcherarXiv 2024SimpleMem: Efficient Lifelong Memory for LLM AgentsarXiv 2026Seamless Human Motion Composition with Blended Positional EncodingsCVPR 2024 1Biomedical knowledge graph-optimized prompt generation for large language modelsarXiv 2023ECA-Net: Efficient Channel Attention for Deep Convolutional Neural Networkseca-net-efficient-channel-attention-for-deep-1SKEP: Sentiment Knowledge Enhanced Pre-training for Sentiment Analysisskep-sentiment-knowledge-enhanced-pre-1Mambular: A Sequential Model for Tabular Deep LearningarXiv 2024Low-bit Model Quantization for Deep Neural Networks: A SurveyarXiv 2025Jumanji: a Diverse Suite of Scalable Reinforcement Learning Environments in JAXarXiv 2023GeoDream: Disentangling 2D and Geometric Priors for High-Fidelity and Consistent 3D GenerationarXiv 2023Autoregressive Video Generation without Vector QuantizationarXiv 2024Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic ReasoningarXiv 2025EVA-CLIP-18B: Scaling CLIP to 18 Billion ParametersarXiv 2024EVA-CLIP: Improved Training Techniques for CLIP at ScalearXiv 2023Unifying Flow, Stereo and Depth EstimationarXiv 2022TransFuser: Imitation with Transformer-Based Sensor Fusion for Autonomous DrivingarXiv 2022MemForest: An Efficient Agent Memory System with Hierarchical Temporal IndexingarXiv 2026Auto-PyTorch Tabular: Multi-Fidelity MetaLearning for Efficient and Robust AutoDLarXiv 2020Director3D: Real-world Camera Trajectory and 3D Scene Generation from TextarXiv 2024Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept SpacearXiv 2025OpenFE: Automated Feature Generation with Expert-level PerformancearXiv 2022HeartMuLa: A Family of Open Sourced Music Foundation ModelsarXiv 2026Wider or Deeper? Scaling LLM Inference-Time Compute with Adaptive Branching Tree SearcharXiv 2025SAM 3D Body: Robust Full-Body Human Mesh RecoveryarXiv 2026Motion-X: A Large-scale 3D Expressive Whole-body Human Motion DatasetNeurIPS 2023 11Grounding DINO 1.5: Advance the "Edge" of Open-Set Object DetectionarXiv 2024Think-on-Graph: Deep and Responsible Reasoning of Large Language Model on Knowledge GrapharXiv 2023Exploring CLIP for Assessing the Look and Feel of ImagesarXiv 2022Tiny Time Mixers (TTMs): Fast Pre-trained Models for Enhanced Zero/Few-Shot Forecasting of Multivariate Time SeriesarXiv 2024TSMixer: Lightweight MLP-Mixer Model for Multivariate Time Series ForecastingarXiv 2023A Large Encoder-Decoder Family of Foundation Models For Chemical LanguagearXiv 2024Large-Scale Chemical Language Representations Capture Molecular Structure and PropertiesarXiv 2021Superposition Yields Robust Neural ScalingarXiv 2025Cold Diffusion: Inverting Arbitrary Image Transforms Without Noisecold-diffusion-inverting-arbitrary-imageLearning to Fly in SecondsarXiv 2023OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video GenerationarXiv 2025DoctorAgent-RL: A Multi-Agent Collaborative Reinforcement Learning System for Multi-Turn Clinical DialoguearXiv 2025Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System CollaborationarXiv 2025Cartridges: Lightweight and general-purpose long context representations via self-studyarXiv 2025Text-to-LoRA: Instant Transformer AdaptionarXiv 2025SAM: State-Adaptive Memory for Long-Horizon Reasoning AgentarXiv 2026CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended DiscoveryarXiv 2026MDPBench: A Benchmark for Multilingual Document Parsing in Real-World ScenariosarXiv 2026R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement LearningarXiv 2025Continuous Sign Language Recognition with Correlation NetworkCVPR 2023 1VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language ModelsarXiv 2023RDEIC: Accelerating Diffusion-Based Extreme Image Compression with Relay Residual DiffusionarXiv 2024Qiskit Machine Learning: an open-source library for quantum machine learning tasks at scale on quantum hardware and classical simulatorsarXiv 2025Primus: Enforcing Attention Usage for 3D Medical Image SegmentationarXiv 2025Degradation-Guided One-Step Image Super-Resolution with Diffusion PriorsarXiv 2024A Knowledge-enhanced Pathology Vision-language Foundation Model for Cancer DiagnosisarXiv 2024DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video DiffusionarXiv 2024HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion TransformerarXiv 2025MotionLab: Unified Human Motion Generation and Editing via the Motion-Condition-Motion ParadigmICCV 2025Compression Represents Intelligence LinearlyarXiv 2024Marigold-DC: Zero-Shot Monocular Depth Completion with Guided DiffusionarXiv 2024Bytes Are All You Need: Transformers Operating Directly On File BytesarXiv 2023Compositional Generalization and Natural Language Variation: Can a Semantic Parsing Approach Handle Both?ACL 2021 5The MultiBERTs: BERT Reproductions for Robustness Analysisthe-multiberts-bert-reproductions-for-1Latent Retrieval for Weakly Supervised Open Domain Question Answeringlatent-retrieval-for-weakly-supervised-openSparse, Dense, and Attentional Representations for Text RetrievalarXiv 2020QUEST: A Retrieval Dataset of Entity-Seeking Queries with Implicit Set OperationsarXiv 2023CANINE: Pre-training an Efficient Tokenization-Free Encoder for Language RepresentationarXiv 2021REALM: Retrieval-Augmented Language Model Pre-TrainingarXiv 2020SpineNet: Learning Scale-Permuted Backbone for Recognition and Localizationspinenet-learning-scale-permuted-backbone-for-1MobileNetV4 -- Universal Models for the Mobile EcosystemarXiv 2024MobileBERT: a Compact Task-Agnostic BERT for Resource-Limited Devicesmobilebert-a-compact-task-agnostic-bert-for-1VideoGLUE: Video General Understanding Evaluation of Foundation ModelsarXiv 2023Spatiotemporal Contrastive Video Representation LearningCVPR 2021 14M: Massively Multimodal Masked Modeling4m-massively-multimodal-masked-modelingIntPhys 2: Benchmarking Intuitive Physics Understanding In Complex Synthetic EnvironmentsarXiv 2025Representation Learning with Large Language Models for RecommendationarXiv 2023XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory ModelarXiv 2022Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video GenerationarXiv 2024A Comprehensive Survey on 3D Content GenerationarXiv 2024Scaling 4D RepresentationsarXiv 2024AnyLoc: Towards Universal Visual Place RecognitionarXiv 2023Convolutional Kolmogorov-Arnold NetworksarXiv 2024rerankers: A Lightweight Python Library to Unify Ranking MethodsarXiv 2024Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree SearcharXiv 2024Generic Attention-model Explainability for Interpreting Bi-Modal and Encoder-Decoder TransformersICCV 2021 10Patho-R1: A Multimodal Reinforcement Learning-Based Pathology Expert ReasonerarXiv 2025Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language ModelsarXiv 2026Language Agent Tree Search Unifies Reasoning Acting and Planning in Language ModelsarXiv 2023Benchmarking Neural Network Robustness to Common Corruptions and Perturbationsbenchmarking-neural-network-robustness-to-1Natural Adversarial ExamplesCVPR 2021 1How to Train Your HiPPO: State Space Models with Generalized Orthogonal Basis ProjectionsarXiv 2022LegalBench: A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Modelslegalbench-a-collaboratively-built-benchmarkAnti-Self-Distillation for Reasoning RL via Pointwise Mutual InformationarXiv 2026SwiftFormer: Efficient Additive Attention for Transformer-based Real-time Mobile Vision ApplicationsICCV 2023 1Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video GenerationarXiv 2026Towards Foundation Models for Mixed Integer Linear ProgrammingarXiv 2024Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time ExecutionarXiv 2026HighSync: High-Quality Lip Synchronization via Latent Diffusion ModelsarXiv 2026MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion DecodingarXiv 2026Video Models Can Reason with Verifiable RewardsarXiv 2026On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language ModelsarXiv 2026Motion 3-to-4: 3D Motion Reconstruction for 4D SynthesisarXiv 2026SkyReels-V3 Technique ReportarXiv 2026ReFinED: An Efficient Zero-shot-capable Approach to End-to-End Entity Linkingrefined-an-efficient-zero-shot-capableHY-WU (Part I): An Extensible Functional Neural Memory Framework and An Instantiation in Text-Guided Image EditingarXiv 2026Break the Sequential Dependency of LLM Inference Using Lookahead DecodingarXiv 2024Have Faith in Faithfulness: Going Beyond Circuit Overlap When Finding Model MechanismsarXiv 2024AudioLDM: Text-to-Audio Generation with Latent Diffusion ModelsarXiv 2023GMFlow: Learning Optical Flow via Global MatchingCVPR 2022 1A Comprehensive Survey of Deep Research: Systems, Methodologies, and ApplicationsarXiv 2025PaperBanana: Automating Academic Illustration for AI ScientistsarXiv 2026Text-guided Sparse Voxel Pruning for Efficient 3D Visual GroundingCVPR 2025 1A Survey on 3D Gaussian SplattingarXiv 2024Adversarial Diffusion Compression for Real-World Image Super-ResolutionCVPR 2025 1R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token RoutingarXiv 2025WritingBench: A Comprehensive Benchmark for Generative WritingarXiv 2025HoliTom: Holistic Token Merging for Fast Video Large Language ModelsarXiv 2025SurveyForge: On the Outline Heuristics, Memory-Driven Generation, and Multi-dimensional Evaluation for Automated Survey WritingarXiv 20254D LangSplat: 4D Language Gaussian Splatting via Multimodal Large Language ModelsCVPR 2025 1Improving Alignment and Robustness with Circuit BreakersarXiv 2024A Generalization of Transformer Networks to GraphsarXiv 2020WeatherBench 2: A benchmark for the next generation of data-driven global weather modelsarXiv 2023FIT: Far-reaching Interleaved TransformersarXiv 2023Investigating Efficiently Extending Transformers for Long Input SummarizationarXiv 2022mT5: A massively multilingual pre-trained text-to-text transformerNAACL 2021 4MAXIM: Multi-Axis MLP for Image ProcessingCVPR 2022 1MAGVIT: Masked Generative Video TransformerCVPR 2023 1Long-form factuality in large language modelsarXiv 2024On the Practicality of Deterministic Epistemic Uncertaintyon-the-practicality-of-deterministic-1Null-text Inversion for Editing Real Images using Guided Diffusion ModelsCVPR 2023 1Nerfies: Deformable Neural Radiance FieldsICCV 2021 10A Survey on Inference Engines for Large Language Models: Perspectives on Optimization and EfficiencyarXiv 2025Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent SystemsarXiv 2025UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion TransformerarXiv 2025SurveyX: Academic Survey Automation via Large Language ModelsarXiv 2025DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing ReasoningarXiv 2025TopoBench: A Framework for Benchmarking Topological Deep LearningarXiv 2024NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language ModelsarXiv 2024GaussianObject: High-Quality 3D Object Reconstruction from Four Views with Gaussian SplattingarXiv 2024Track Anything: Segment Anything Meets VideosarXiv 2023Higher Layers Need More LoRA ExpertsarXiv 2024StyleTalk: One-shot Talking Head Generation with Controllable Speaking StylesarXiv 2023CMB: A Comprehensive Medical Benchmark in ChinesearXiv 2023Large Language Model-Based Agents for Software Engineering: A SurveyarXiv 2024HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at ScalearXiv 2024Data Engineering for Scaling Language Models to 128K ContextarXiv 2024StableAnimator: High-Quality Identity-Preserving Human Image AnimationCVPR 2025 1Fashionable Modelling with FluxarXiv 2018SciBERT: A Pretrained Language Model for Scientific Textscibert-a-pretrained-language-model-forIs Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy OptimizationarXiv 2022

Back to Papers