All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Black-Box On-Policy Distillation of Large Language ModelsarXiv 2025SWIFT:A Scalable lightWeight Infrastructure for Fine-TuningarXiv 2024Pixal3D: Pixel-Aligned 3D Generation from ImagesarXiv 2026Ray: A Distributed Framework for Emerging AI ApplicationsarXiv 2017Asymmetric Flow ModelsarXiv 2026AI-Trader: Benchmarking Autonomous Agents in Real-Time Financial MarketsarXiv 2025AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI CollaborationarXiv 2026RoboBrain 2.5: Depth in Sight, Time in MindarXiv 2026SAM 3D: 3Dfy Anything in ImagesarXiv 2025Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI AutomationarXiv 2025Qwen3-VL Technical ReportarXiv 2025FlashInfer: Efficient and Customizable Attention Engine for LLM Inference ServingarXiv 2025BitsFusion: 1.99 bits Weight Quantization of Diffusion ModelarXiv 2024MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal InteractionarXiv 2026Gradio: Hassle-Free Sharing and Testing of ML Models in the WildarXiv 2019MobileNets: Efficient Convolutional Neural Networks for Mobile Vision ApplicationsarXiv 2017TF.Learn: TensorFlow's High-level Module for Distributed Machine LearningarXiv 2016All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language ModelsarXiv 2026Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic SimulationarXiv 2026Code as Agent HarnessarXiv 2026Geometric Context Transformer for Streaming 3D ReconstructionarXiv 2026Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and RecipearXiv 2026OverFlow: Putting flows on top of neural transducers for better TTSarXiv 2022Stable Audio 3arXiv 2026Segment AnythingICCV 2023 1SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe PropagationarXiv 2026Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic ManipulationarXiv 2025EliGen: Entity-Level Controlled Image Generation with Regional AttentionarXiv 2025SuperLocalMemory V3: Information-Geometric Foundations for Zero-LLM Enterprise Agent MemoryarXiv 2026An Empirical Study of Mamba-based Language ModelsarXiv 2024SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse TasksarXiv 2026PhysX-Omni: Unified Simulation-Ready Physical 3D Generation for Rigid, Deformable, and Articulated ObjectsarXiv 2026AI for Auto-Research: Roadmap & User GuidearXiv 2026World Model for Robot Learning: A Comprehensive SurveyarXiv 2026Memento-Skills: Let Agents Design AgentsarXiv 2026Scikit-learn: Machine Learning in PythonarXiv 2012PPTAgent: Generating and Evaluating Presentations Beyond Text-to-SlidesarXiv 2025VGGT: Visual Geometry Grounded TransformerCVPR 2025 1ASI-Evolve: AI Accelerates AIarXiv 2026RiT: Vanilla Diffusion Transformers Suffice in Representation SpacearXiv 2026The Faiss libraryarXiv 2024Hunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets GenerationarXiv 2025WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model EvaluationarXiv 2026Hunyuan3D 2.5: Towards High-Fidelity 3D Assets Generation with Ultimate DetailsarXiv 2025MedGemma Technical ReportarXiv 2025WavFlow: Audio Generation in Waveform SpacearXiv 2026Qwen2.5 Technical ReportarXiv 2024Qwen2 Technical ReportarXiv 2024Partial FC: Training 10 Million Identities on a Single MachinearXiv 2020garak: A Framework for Security Probing Large Language ModelsarXiv 2024Data Formulator 2: Iterative Creation of Data Visualizations, with AI Transforming Data Along the WayarXiv 2024EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic ExperiencearXiv 2026OmniParser for Pure Vision Based GUI AgentarXiv 2024MemEvolve: Meta-Evolution of Agent Memory SystemsarXiv 2025Continual Harness: Online Adaptation for Self-Improving Foundation AgentsarXiv 2026Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus InteractionarXiv 2026VLANeXt: Recipes for Building Strong VLA ModelsarXiv 2026MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive, and MCP-Augmented EnvironmentsarXiv 2025InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit FieldsarXiv 2026Alpha-R1: Alpha Screening with LLM Reasoning via Reinforcement LearningarXiv 2025In-Place Test-Time TrainingarXiv 2026Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and GenerationarXiv 2026Learning Transferable Visual Models From Natural Language SupervisionarXiv 2021Self-Distilled Agentic Reinforcement LearningarXiv 2026RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist PoliciesarXiv 2026KernelBlaster: Continual Cross-Task CUDA Optimization via Memory-Augmented In-Context Reinforcement LearningarXiv 2026Masked Depth Modeling for Spatial PerceptionarXiv 2026SimToolReal: An Object-Centric Policy for Zero-Shot Dexterous Tool ManipulationarXiv 2026Aligning Multimodal LLM with Human Preference: A SurveyarXiv 2025Smooth Exploration for Robotic Reinforcement LearningarXiv 2020Dolphin: Document Image Parsing via Heterogeneous Anchor PromptingarXiv 2025CAMEL: Communicative Agents for "Mind" Exploration of Large Language Model SocietyNeurIPS 2023 11FashionChameleon: Towards Real-Time and Interactive Human-Garment Video CustomizationarXiv 2026Vision Transformers Need RegistersarXiv 2023Evaluating and Aligning CodeLLMs on Human PreferencearXiv 2024Paper2Code: Automating Code Generation from Scientific Papers in Machine LearningarXiv 20252 OLMo 2 FuriousarXiv 2024olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language ModelsarXiv 2025SkyReels-V2: Infinite-length Film Generative ModelarXiv 2025AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map DistillationarXiv 2026Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative CriteriaarXiv 2026PaTH Attention: Position Encoding via Accumulating Householder TransformationsarXiv 2025AWQ: Activation-aware Weight Quantization for LLM Compression and AccelerationarXiv 2023Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and RestorationarXiv 2024Llama-Nemotron: Efficient Reasoning ModelsarXiv 2025Domino: Eliminating Communication in LLM Training via Generic Tensor Slicing and OverlappingarXiv 2024Transformer Explainer: Learning LLM Transformers with Interactive Visual Explanation and ExperimentationarXiv 2024SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify ArchitecturearXiv 2026AI-Researcher: Autonomous Scientific InnovationarXiv 2025Qwen Technical ReportarXiv 2023SmolVLM: Redefining small and efficient multimodal modelsarXiv 2025VisualPRM: An Effective Process Reward Model for Multimodal ReasoningarXiv 2025gsplat: An Open-Source Library for Gaussian SplattingarXiv 2024Packing Input Frame Context in Next-Frame Prediction Models for Video GenerationarXiv 2025MambaOut: Do We Really Need Mamba for Vision?CVPR 2025 1RT-DETRv2: Improved Baseline with Bag-of-Freebies for Real-Time Detection TransformerarXiv 2024DETRs Beat YOLOs on Real-time Object DetectionCVPR 2024 1DenseNets Reloaded: Paradigm Shift Beyond ResNets and ViTsarXiv 2024Enhancing Financial Sentiment Analysis via Retrieval Augmented Large Language ModelsarXiv 2023FinGPT: Instruction Tuning Benchmark for Open-Source Large Language Models in Financial DatasetsarXiv 2023Depth Anything V2arXiv 2024MNN: A Universal and Efficient Inference EnginearXiv 2020AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language ReasoningarXiv 2025Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy OptimizationarXiv 2026Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement LearningarXiv 2025Vidi: Large Multimodal Models for Video Understanding and EditingarXiv 2025Step1X-Edit: A Practical Framework for General Image EditingarXiv 2025FLUX.1 Kontext: Flow Matching for In-Context Image Generation and
Editing in Latent SpacearXiv 2025Hunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR MaterialarXiv 2025ColBERT-Zero: To Pre-train Or Not To Pre-train ColBERT modelsarXiv 2026OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning DatasetarXiv 2024SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion ModelsarXiv 2024SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit TrainingarXiv 2025SageAttention2++: A More Efficient Implementation of SageAttention2arXiv 2025AI-native Memory 2.0: Second MearXiv 2025LLaVA-OneVision: Easy Visual Task TransferarXiv 2024An Empirical Study of Scaling Instruct-Tuned Large Multimodal ModelsarXiv 2023Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object DetectionarXiv 2023Deep Temporal Graph ClusteringarXiv 2023Fast Video Generation with Sliding Tile AttentionarXiv 2025Recursive Language ModelsarXiv 2025TTRL: Test-Time Reinforcement LearningarXiv 2025LangGPT: Rethinking Structured Reusable Prompt Design Framework for LLMs from the Programming LanguagearXiv 2024Mastering Diverse Domains through World ModelsarXiv 2023Bigger, Better, Faster: Human-level Atari with human-level efficiencyarXiv 2023Rethinking FID: Towards a Better Evaluation Metric for Image GenerationCVPR 2024 1Supervised Contrastive LearningNeurIPS 2020 12Self-attention Does Not Need $O(n^2)$ MemoryarXiv 2021How Much Knowledge Can You Pack Into the Parameters of a Language Model?EMNLP 2020 11Autoregressive Diffusion Modelsautoregressive-diffusion-models-1TrueTeacher: Learning Factual Consistency Evaluation with Large Language ModelsarXiv 2023RegNeRF: Regularizing Neural Radiance Fields for View Synthesis from Sparse InputsCVPR 2022 1In-domain representation learning for remote sensingarXiv 2019Meta Pseudo LabelsCVPR 2021 1VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and TextNeurIPS 2021 12TabNet: Attentive Interpretable Tabular LearningarXiv 2019AutoML-Zero: Evolving Machine Learning Algorithms From ScratcharXiv 2020Scale Efficiently: Insights from Pre-training and Fine-tuning TransformersarXiv 2021Beyond 512 Tokens: Siamese Multi-depth Transformer-based Hierarchical Encoder for Long-Form Document MatchingarXiv 2020Primer: Searching for Efficient Transformers for Language ModelingarXiv 2021Do Transformer Modifications Transfer Across Implementations and Applications?EMNLP 2021 11Instruction-Following Evaluation for Large Language ModelsarXiv 2023StructFormer: Joint Unsupervised Induction of Dependency and Constituency Structure from Masked Language Modelingstructformer-joint-unsupervised-induction-ofWhat Do Compressed Deep Neural Networks Forget?arXiv 2019Region-Aware Pretraining for Open-Vocabulary Object Detection with Vision TransformersCVPR 2023 1Invariant Slot Attention: Object Discovery with Slot-Centric Reference FramesarXiv 2023DSelect-k: Differentiable Selection in the Mixture of Experts with Applications to Multi-Task LearningNeurIPS 2021 12Sample, Scrutinize and Scale: Effective Inference-Time Search by Scaling VerificationarXiv 2025Measuring Compositional Generalization: A Comprehensive Method on Realistic DataICLR 2020 1TableRAG: Million-Token Table Understanding with Language ModelsarXiv 2024Socratic Models: Composing Zero-Shot Multimodal Reasoning with LanguagearXiv 2022Sequential Attention for Feature SelectionarXiv 2022Screen2Words: Automatic Mobile UI Summarization with Multimodal LearningarXiv 2021Continuous Thought MachinesarXiv 2025Mooncake: A KVCache-centric Disaggregated Architecture for LLM ServingarXiv 2024Symbolic Learning Enables Self-Evolving AgentsarXiv 2024Code-as-Room: Generating 3D Rooms from Top-Down View Images via Agentic Code SynthesisarXiv 2026Aligning Language Models with Offline Learning from Human FeedbackarXiv 2023Stable and low-precision training for large-scale vision-language modelsNeurIPS 2023 11LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMsarXiv 2026Exploring Plain Vision Transformer Backbones for Object DetectionarXiv 2022MViTv2: Improved Multiscale Vision Transformers for Classification and DetectionCVPR 2022 1Continuous Surface Embeddingscontinuous-surface-embeddingsBitNet b1.58 2B4T Technical ReportarXiv 2025OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task AutomationarXiv 2025Flow-GRPO: Training Flow Matching Models via Online RLarXiv 2025MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to PosttrainingarXiv 2025REAL-M: Towards Speech Separation on Real MixturesarXiv 2021MetricGAN+: An Improved Version of MetricGAN for Speech EnhancementarXiv 2021Timers and Such: A Practical Benchmark for Spoken Language Understanding with NumbersarXiv 2021Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian DialectarXiv 2024Attention is All You Need in Speech SeparationarXiv 2020FinRobot: AI Agent for Equity Research and Valuation with Large Language ModelsarXiv 2024GPT-4 Technical Reportgpt-4-technical-reportDeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code IntelligencearXiv 2024Scalable Diffusion Models with TransformersICCV 2023 1Efficient Guided Generation for Large Language ModelsarXiv 2023Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling LibraryarXiv 2025InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal ModelsarXiv 2025Human Gaussian Splatting: Real-time Rendering of Animatable AvatarsCVPR 2024 1Generative Agents: Interactive Simulacra of Human BehaviorarXiv 2023Adding Conditional Control to Text-to-Image Diffusion ModelsICCV 2023 1LTX-2: Efficient Joint Audio-Visual Foundation ModelarXiv 2026AutoAgent: A Fully-Automated and Zero-Code Framework for LLM AgentsarXiv 2025Adaptive In-conversation Team Building for Language Model AgentsarXiv 2024Flow Matching Guide and CodearXiv 2024Multi-Agent Collaboration via Cross-Team OrchestrationarXiv 2024XGBoost: A Scalable Tree Boosting SystemarXiv 2016PyRIT: A Framework for Security Risk Identification and Red Teaming in Generative AI SystemarXiv 2024LivePortrait: Efficient Portrait Animation with Stitching and Retargeting ControlarXiv 2024Depth Pro: Sharp Monocular Metric Depth in Less Than a SecondarXiv 2024RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V TrustworthinessCVPR 2025 1KAG: Boosting LLMs in Professional Domains via Knowledge Augmented GenerationarXiv 2024Orthrus: Memory-Efficient Parallel Token Generation via Dual-View DiffusionarXiv 2026A decoder-only foundation model for time-series forecastingarXiv 2023Semi-Parametric Neural Image SynthesisarXiv 2022Self Forcing: Bridging the Train-Test Gap in Autoregressive Video DiffusionarXiv 2025DeepFilterNet: Perceptually Motivated Real-Time Speech EnhancementarXiv 2023Arcee's MergeKit: A Toolkit for Merging Large Language ModelsarXiv 2024Perception Encoder: The best visual embeddings are not at the output of the networkarXiv 2025