All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Implicit Language Models are RNNs: Balancing Parallelization and ExpressivityarXiv 2025PromptBench: A Unified Library for Evaluation of Large Language ModelsarXiv 2023Video Diffusion Alignment via Reward GradientsarXiv 2024Test-time Adaptation with Slot-Centric ModelsarXiv 2022MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?arXiv 2024Once-for-All: Train One Network and Specialize it for Efficient DeploymentarXiv 2019SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language ModelsarXiv 2022MosaicBERT: A Bidirectional Encoder Optimized for Fast Pretrainingmosaicbert-a-bidirectional-encoder-optimizedVid2Avatar: 3D Avatar Reconstruction from Videos in the Wild via Self-supervised Scene DecompositionCVPR 2023 1DIN-SQL: Decomposed In-Context Learning of Text-to-SQL with Self-Correctiondin-sql-decomposed-in-context-learning-ofTFMQ-DM: Temporal Feature Maintenance Quantization for Diffusion ModelsCVPR 2024 1StyleBooth: Image Style Editing with Multimodal InstructionarXiv 2024RTSeg: Real-time Semantic Segmentation Comparative StudyarXiv 2018PortaSpeech: Portable and High-Quality Generative Text-to-SpeechNeurIPS 2021 12Evaluating Verifiability in Generative Search EnginesarXiv 2023Dense Text-to-Image Generation with Attention ModulationICCV 2023 1Better Synthetic Data by Retrieving and Transforming Existing DatasetsarXiv 2024Portuguese Named Entity Recognition using BERT-CRFarXiv 2019CheXmask: a large-scale dataset of anatomical segmentation masks for multi-center chest x-ray imagesarXiv 2023LN3Diff: Scalable Latent Neural Fields Diffusion for Speedy 3D GenerationarXiv 2024SAM2MOT: A Novel Paradigm of Multi-Object Tracking by SegmentationarXiv 2025Compact Language Models via Pruning and Knowledge DistillationarXiv 2024ONE-PEACE: Exploring One General Representation Model Toward Unlimited ModalitiesarXiv 2023Neuralangelo: High-Fidelity Neural Surface Reconstructionneuralangelo-high-fidelity-neural-surface#InsTag: Instruction Tagging for Analyzing Supervised Fine-tuning of Large Language ModelsarXiv 2023Semantic Image Synthesis with Spatially-Adaptive Normalizationsemantic-image-synthesis-with-spatially-1OK-Robot: What Really Matters in Integrating Open-Knowledge Models for RoboticsarXiv 2024Natural Language Understanding with Distributed RepresentationarXiv 2015Text2LIVE: Text-Driven Layered Image and Video EditingarXiv 2022WaveFlow: A Compact Flow-based Model for Raw AudioICML 2020 1VT-ADL: A Vision Transformer Network for Image Anomaly Detection and LocalizationarXiv 2021Galactica: A Large Language Model for Sciencegalactica-a-large-language-model-for-scienceSelf-rewarding correction for mathematical reasoningarXiv 2025WHAC: World-grounded Humans and CamerasarXiv 2024NeuRBF: A Neural Fields Representation with Adaptive Radial Basis Functionsneurbf-a-neural-fields-representation-withDita: Scaling Diffusion Transformer for Generalist Vision-Language-Action PolicyICCV 2025Diffusion Transformer PolicyarXiv 2024MULAN: Multitask Universal Lesion Analysis Network for Joint Lesion Detection, Tagging, and SegmentationarXiv 2019GET: Group Event Transformer for Event-Based Visionget-group-event-transformer-for-event-basedImproved Techniques for Training GANsimproved-techniques-for-training-gans-1Neural MMO: A Massively Multiagent Game Environment for Training and Evaluating Intelligent AgentsarXiv 2019ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction TuningarXiv 2024Bidirectionally Deformable Motion Modulation For Video-based Human Pose TransferICCV 2023 1Gemini vs GPT-4V: A Preliminary Comparison and Combination of Vision-Language Models Through Qualitative CasesarXiv 2023TALL: Thumbnail Layout for Deepfake Video DetectionICCV 2023 1V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position EncodingICCV 2025MFQE 2.0: A New Approach for Multi-frame Quality Enhancement on Compressed VideoarXiv 2019GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and EditingarXiv 2025Early Exit or Not: Resource-Efficient Blind Quality Enhancement for Compressed ImagesECCV 2020 8UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormerarXiv 2022Hebbian Learning based Orthogonal Projection for Continual Learning of Spiking Neural NetworksarXiv 2024Lemur: Harmonizing Natural Language and Code for Language AgentsarXiv 2023Range Membership Inference AttacksarXiv 2024SMPConv: Self-moving Point Representations for Continuous ConvolutionCVPR 2023 1Magnitude: A Fast, Efficient Universal Vector Embedding Utility Packagemagnitude-a-fast-efficient-universal-vector-1Is Your LLM Secretly a World Model of the Internet? Model-Based Planning for Web AgentsarXiv 2024Towards Debiasing Sentence Representationstowards-debiasing-sentence-representationsParameter-efficient Multi-task Fine-tuning for Transformers via Shared HypernetworksACL 2021 5ClassDiffusion: More Aligned Personalization Tuning with Explicit Class GuidancearXiv 2024EmoTalk: Speech-Driven Emotional Disentanglement for 3D Face AnimationICCV 2023 1Kimi K2.5: Visual Agentic IntelligencearXiv 2026ContentVec: An Improved Self-Supervised Speech Representation by Disentangling SpeakersarXiv 2022Baichuan-Audio: A Unified Framework for End-to-End Speech InteractionarXiv 2025AutoCoder: Enhancing Code Large Language Model with \textsc{AIEV-Instruct}arXiv 2024EvTexture: Event-driven Texture Enhancement for Video Super-ResolutionarXiv 2024Reading Wikipedia to Answer Open-Domain Questionsreading-wikipedia-to-answer-open-domain-1Learning Video Representations from Large Language ModelsCVPR 2023 1On Calibration of Modern Neural Networkson-calibration-of-modern-neural-networks-1LightenDiffusion: Unsupervised Low-Light Image Enhancement with Latent-Retinex Diffusion ModelsarXiv 2024Streaming Deep Reinforcement Learning Finally WorksarXiv 2024NExT-Chat: An LMM for Chat, Detection and SegmentationarXiv 2023LawGPT: A Chinese Legal Knowledge-Enhanced Large Language ModelarXiv 2024Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video UnderstandingCVPR 2024 1StoryMaker: Towards Holistic Consistent Characters in Text-to-image GenerationarXiv 2024Agentic Reasoning for Large Language ModelsarXiv 2026BlenderBot 3: a deployed conversational agent that continually learns to responsibly engagearXiv 2022Pyramidal Flow Matching for Efficient Video Generative ModelingarXiv 2024An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual InversionarXiv 2022ROSCOE: A Suite of Metrics for Scoring Step-by-Step ReasoningarXiv 2022Scaling Text-to-Image Diffusion Transformers with Representation AutoencodersarXiv 2026Low-code LLM: Graphical User Interface over Large Language ModelsarXiv 2023Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation ModelsarXiv 2023The ML.ENERGY Benchmark: Toward Automated Inference Energy Measurement and OptimizationarXiv 2025Pay Attention to Evolution: Time Series Forecasting with Deep Graph-Evolution LearningarXiv 2020On-Device Language Models: A Comprehensive ReviewarXiv 2024Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems2026ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence2026Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization2026The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence2026Trust Region Q Adjoint Matching2026FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies2026CollectionLoRA: Collecting 50 Effects in 1 LoRA via Multi-Teacher On-Policy Distillation2026Unified Panoramic Geometry Estimation via Multi-View Foundation Models2026LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding2026AgensFlow: A Coordination-Policy Substrate for Multi-Agent Systems2026Benchmarks are Not Enough: RAMP for Runtime Assessing of Agentic Models in Production Systems2026Agyn: An Open-Source Platform for AI Agents with Scalable On-Demand Execution, Agent Definition as a Code, and Zero-Trust Access2026Laguna M.1/XS.2 Technical Report2026SkillGrad: Optimizing Agent Skills Like Gradient Descent2026VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild2026SmartDirector: Keyframe-Conditioned Cinematic Video Generation with Narrative Pacing Control2026The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages2026Data-Efficient On-Policy Distillation for Automatic Speech Recognition2026OR-Space: A Full-Lifecycle Workspace Benchmark for Industrial Optimization Agents2026Pruning and Distilling Mixture-of-Experts into Dense Language Models2026HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs2026DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes2026Models That Know How Evaluations Are Designed Score Safer2026AlphaTransit: Learning to Design City-scale Transit Routes2026MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems2026BIRDNet: Mining and Encoding Boolean Implication Knowledge Graphs as Interpretable Deep Neural Networks2026CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning2026Learn from Weaknesses: Automated Domain Specialization for Small Computer-Use Agents2026SIA: Self Improving AI with Harness & Weight Updates2026AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios2026ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation2026Parallax: Parameterized Local Linear Attention for Language Modeling2026OmniRetrieval: Unified Retrieval across Heterogeneous Knowledge Sources2026GrepSeek: Training Search Agents for Direct Corpus Interaction2026Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation2026Xetrieval: Mechanistically Explaining Dense Retrieval2026Thinking Before Constraining: A Unified Decoding Framework for Large Language Models2026VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies2026REPOT: Recoverable Program-of-Thought via Checkpoint Repair2026When Does LeJEPA Learn a World Model?2026Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation2026Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration2026PEFT-Arena: Understanding Parameter-Efficient Finetuning from a Stability-Plasticity Perspective2026TabPFN-3: Technical Report2026Token-Level Generalization in LoRA Adapter Backdoors: Attack Characterization and Behavioral Detection2026How LoRA Remembers? A Parametric Memory Law for LLM Finetuning2026SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones?2026OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants2026Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning2026Self-Improving Language Models with Bidirectional Evolutionary Search2026OpenSkillEval: Automatically Auditing the Open Skill Ecosystem for LLM Agents2026WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction2026Recovering Policy-Induced Errors: Benchmarking and Trajectory Synthesis for Robust GUI Agents2026LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents2026Verifiable Rewards Beyond Math and Code: Lightweight Corpus-Grounded Process Supervision for Factual Question Answering2026Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding2026Adapting Multilingual Embedding Models to Turkish via Cross-Lingual Tokenizer Surgery and Offline Distillation2026LoMo: Local Modality Substitution for Deeper Vision-Language Fusion2026Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments2026Prompt Injection as Role Confusion2026Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases2026Draft-OPD: On-Policy Distillation for Speculative Draft Models2026SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search2026Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?2026Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs2026LLM Anonymization Against Agentic Re-Identification2026Speculative Pipeline Decoding: Higher-Accuracy Drafting with Hidden Latency via Pipeline Parallelism2026dMoE: dLLMs with Learnable Block Experts2026MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft2026From Prompt Injection to Persistent Control: Defending Agentic Harness Against Trojan Backdoors2026SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes2026COLLEAGUE.SKILL: Automated AI Skill Generation via Expert Knowledge Distillation2026DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization2026LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards2026VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion2026VLM3: Vision Language Models Are Native 3D Learners2026Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO2026MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding2026RayDer: Scalable Self-Supervised Novel View Synthesis from Real-World Video2026LVSA: Training-Free Sparse Attention for Long Video Diffusion2026How can embedding models bind concepts?2026CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware Rewards2026Masking Stale Observations Helps Search Agents -- Until It Doesn't: A Regime Map and Its Mechanism2026FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search2026OCC-RAG: Optimal Cognitive Core for Faithful Question Answering2026BraveGuard: From Open-World Threats to Safer Computer-Use Agents2026BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution2026HarnessForge: Joint Harness and Policy Evolution for Adaptive Agent Systems2026MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?2026OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents2026TVIR: Building Deep Research Agents Towards Text-Visual Interleaved Report Generation2026Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses2026K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts2026SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction2026A Multi-AI-agent Framework Enabling End-to-end Finite Element Analysis for Solid Mechanics Problems2026MindZero: Learning Online Mental Reasoning With Zero Annotations2026Strong Stochastic Flow Maps2026Joint Agent Memory and Exploration Learning via Novelty Signals2026TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL2026MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation2026Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling2026Scalable Inference-Time Annealing with Surrogate Likelihood Estimators2026Semi-Supervised Noise Adaptation: Transferring Knowledge from Noise Domain2026Measuring the Symmetry--Data Exchange Rate2026Decentralized Instruction Tuning: Conflict-Aware Splitting and Weight Merging2026Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation2026Economy of Minds: Emerging Multi-Agent Intelligence with Economic Interactions2026WebRISE: Requirement-Induced State Evaluation for MLLM-Generated Web Artifacts2026World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning2026Value-Aware Stochastic KV Cache Eviction for Reasoning Models2026Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill2026Large Language Models Hack Rewards, and Society2026Can Generalist Agents Automate Data Curation?2026Frames2LoRA: Parametric Video Internalization for Vision-Language Models2026Stateful Visual Encoders for Vision-Language Models2026