0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

Battle of the Backbones: A Large-Scale Comparison of Pretrained Models across Computer Vision TasksNeurIPS 2023 11Vision as LoRAarXiv 2025LinFusion: 1 GPU, 1 Minute, 16K ImagearXiv 2024RemoteSAM: Towards Segment Anything for Earth ObservationarXiv 2025Think or Not? Exploring Thinking Efficiency in Large Reasoning Models via an Information-Theoretic LensarXiv 2025On the Design of KL-Regularized Policy Gradient Algorithms for LLM ReasoningarXiv 2025ParaTransCNN: Parallelized TransCNN Encoder for Medical Image SegmentationarXiv 2024ARS-DETR: Aspect Ratio-Sensitive Detection Transformer for Aerial Oriented Object DetectionarXiv 2023HaSa: Hardness and Structure-Aware Contrastive Knowledge Graph EmbeddingarXiv 2023Exploring Hallucination of Large Multimodal Models in Video Understanding: Benchmark, Analysis and MitigationarXiv 2025FireFlow: Fast Inversion of Rectified Flow for Image Semantic EditingarXiv 2024Find Any Part in 3DICCV 2025UniTalker: Scaling up Audio-Driven 3D Facial Animation through A Unified ModelarXiv 2024ChemVLM: Exploring the Power of Multimodal Large Language Models in Chemistry AreaarXiv 2024Feat2GS: Probing Visual Foundation Models with Gaussian SplattingCVPR 2025 1Baichuan-M1: Pushing the Medical Capability of Large Language ModelsarXiv 2025GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal ReasoningarXiv 2025OBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documentsobelics-an-open-web-scale-filtered-dataset-ofBlock Pruning For Faster TransformersEMNLP 2021 11Jack of All Trades, Master of Some, a Multi-Purpose Transformer AgentarXiv 2024Scaling Data-Constrained Language Modelsscaling-data-constrained-language-modelsQuery-Dependent Prompt Evaluation and Optimization with Offline Inverse RLarXiv 2023Natural Synthetic Anomalies for Self-Supervised Anomaly Detection and LocalizationarXiv 2021MOSEL: 950,000 Hours of Speech Data for Open-Source Speech Foundation Model Training on EU LanguagesarXiv 2024FELM: Benchmarking Factuality Evaluation of Large Language ModelsNeurIPS 2023 11What Makes Good Data for Alignment? A Comprehensive Study of Automatic Data Selection in Instruction TuningarXiv 2023CodeI/O: Condensing Reasoning Patterns via Code Input-Output PredictionarXiv 2025A Survey on Multimodal Benchmarks: In the Era of Large AI ModelsarXiv 2024R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement LearningarXiv 2025UFT: Unifying Supervised and Reinforcement Fine-TuningarXiv 2025Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language ModelsarXiv 2025Dimple: Discrete Diffusion Multimodal Large Language Model with Parallel DecodingarXiv 2025G3Reg: Pyramid Graph-based Global Registration using Gaussian Ellipsoid ModelarXiv 2023DS-1000: A Natural and Reliable Benchmark for Data Science Code GenerationarXiv 2022Beyond Autoregression: Discrete Diffusion for Complex Reasoning and PlanningarXiv 2024SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory SynthesisarXiv 2025A Reparameterized Discrete Diffusion Model for Text GenerationarXiv 2023Training-Free Long-Context Scaling of Large Language ModelsarXiv 2024LLMRec: Large Language Models with Graph Augmentation for RecommendationarXiv 2023LightGCL: Simple Yet Effective Graph Contrastive Learning for RecommendationarXiv 2023HiGPT: Heterogeneous Graph Language ModelarXiv 2024DiffKG: Knowledge Graph Diffusion Model for RecommendationarXiv 2023GraphEdit: Large Language Models for Graph Structure LearningarXiv 2024Disentangled Contrastive Collaborative FilteringarXiv 2023N-LTP: An Open-source Neural Language Technology Platform for ChineseEMNLP (ACL) 2021 11GoLLIE: Annotation Guidelines improve Zero-Shot Information-ExtractionarXiv 2023Putting the Object Back into Video Object SegmentationCVPR 2024 1The Curse of Conditions: Analyzing and Improving Optimal Transport for Conditional Flow-Based GenerationICCV 2025Pre-training without Natural ImagesarXiv 2021Piccolo2: General Text Embedding with Multi-task Hybrid Loss TrainingarXiv 2024Improving Diffusion Models for Inverse Problems using Manifold ConstraintsarXiv 2022Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language ModelsarXiv 2023HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language ModelarXiv 2024RoI Tanh-polar Transformer Network for Face Parsing in the WildarXiv 2021ChatMusician: Understanding and Generating Music Intrinsically with LLMarXiv 2024DeTeCtive: Detecting AI-generated Text via Multi-Level Contrastive LearningarXiv 2024Structured Pruning for Deep Convolutional Neural Networks: A surveyarXiv 2023Distill Visual Chart Reasoning Ability from LLMs to MLLMsarXiv 2024SPBERT: An Efficient Pre-training BERT on SPARQL Queries for Question Answering over Knowledge GraphsarXiv 2021KV Cache Compression, But What Must We Give in Return? A Comprehensive Benchmark of Long Context Capable ApproachesarXiv 2024Rethinking Temporal Fusion with a Unified Gradient Descent View for 3D Semantic Occupancy PredictionCVPR 2025 1V2A-Mapper: A Lightweight Solution for Vision-to-Audio Generation by Connecting Foundation ModelsarXiv 2023Aligning AI With Shared Human ValuesarXiv 2020How Close is ChatGPT to Human Experts? Comparison Corpus, Evaluation, and DetectionarXiv 2023AGTGAN: Unpaired Image Translation for Photographic Ancient Character GenerationarXiv 2023MSDS: A Large-Scale Chinese Signature and Token Digit String Dataset for Handwriting VerificationarXiv 2022OWL: A Large Language Model for IT OperationsarXiv 2023HiPPO: Recurrent Memory with Optimal Polynomial ProjectionsNeurIPS 2020 12Effectively Modeling Time Series with Simple Discrete State SpacesarXiv 2023Hyena Hierarchy: Towards Larger Convolutional Language ModelsarXiv 2023Automating the Enterprise with Foundation ModelsarXiv 2024V3D: Video Diffusion Models are Effective 3D GeneratorsarXiv 2024HalluciDet: Hallucinating RGB Modality for Person Detection Through Privileged InformationarXiv 2023On Measuring Faithfulness or Self-consistency of Natural Language ExplanationsarXiv 2023Latent Alignment and Variational Attentionlatent-alignment-and-variational-attention-1Image-to-Markup Generation with Coarse-to-Fine Attentionimage-to-markup-generation-with-coarse-to-1Neural Linguistic Steganographyneural-linguistic-steganography-1Coevolving with the Other You: Fine-Tuning LLM with Sequential Cooperative Multi-Agent Reinforcement LearningarXiv 2024Robot Utility Models: General Policies for Zero-Shot Deployment in New EnvironmentsarXiv 2024Mamba or RWKV: Exploring High-Quality and High-Efficiency Segment Anything ModelarXiv 2024Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction TuningCVPR 2025 1CAFe: Unifying Representation and Generation with Contrastive-Autoregressive FinetuningarXiv 2025xRAG: Extreme Context Compression for Retrieval-augmented Generation with One TokenarXiv 2024SAPIEN: A SimulAted Part-based Interactive ENvironmentsapien-a-simulated-part-based-interactive-1mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic DataarXiv 2025Semi-Supervised Semantic Segmentation Using Unreliable Pseudo-LabelsCVPR 2022 1Reconstructive Visual Instruction TuningarXiv 2024HNeRV: A Hybrid Neural Representation for VideosCVPR 2023 1CALF: Aligning LLMs for Time Series Forecasting via Cross-modal Fine-TuningarXiv 2024Benchmarking Large Language Models on Answering and Explaining Challenging Medical QuestionsarXiv 2024Sequential Predictive Conformal Inference for Time SeriesarXiv 2022LLMs4OL: Large Language Models for Ontology LearningarXiv 2023UniTR: A Unified and Efficient Multi-Modal Transformer for Bird's-Eye-View RepresentationICCV 2023 1Multi-Agent Large Language Models for Conversational Task-SolvingarXiv 2024VideoMultiAgents: A Multi-Agent Framework for Video Question AnsweringarXiv 2025PolyMath: Evaluating Mathematical Reasoning in Multilingual ContextsarXiv 2025Reinforcing Video Reasoning with Focused ThinkingarXiv 2025Gaussian Process Priors for Systems of Linear Partial Differential Equations with Constant CoefficientsarXiv 2022Prot2Text: Multimodal Protein's Function Generation with GNNs and TransformersarXiv 2023(Mis)Fitting: A Survey of Scaling LawsarXiv 2025Unified Generative Adversarial Networks for Controllable Image-to-Image TranslationarXiv 2019EnCodecMAE: Leveraging neural codecs for universal audio representation learningarXiv 2023VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal GroundingarXiv 2024TRACE: Temporal Grounding Video LLM via Causal Event ModelingarXiv 2024H-Packer: Holographic Rotationally Equivariant Convolutional Neural Network for Protein Side-Chain PackingarXiv 2023InstantCharacter: Personalize Any Characters with a Scalable Diffusion Transformer FrameworkarXiv 2025Magic123: One Image to High-Quality 3D Object Generation Using Both 2D and 3D Diffusion PriorsarXiv 2023AnimateLCM: Computation-Efficient Personalized Style Video Generation without Personalized Video DataarXiv 2024DiffusionEdge: Diffusion Probabilistic Model for Crisp Edge DetectionarXiv 2024ManiGaussian: Dynamic Gaussian Splatting for Multi-task Robotic ManipulationarXiv 2024FindVehicle and VehicleFinder: A NER dataset for natural language-based vehicle retrieval and a keyword-based cross-modal vehicle retrieval systemarXiv 2023ART: Automatic Red-teaming for Text-to-Image Models to Protect Benign UsersarXiv 2024CODA-Prompt: COntinual Decomposed Attention-based Prompting for Rehearsal-Free Continual LearningCVPR 2023 1ConvSearch-R1: Enhancing Query Reformulation for Conversational Search with Reasoning via Reinforcement LearningarXiv 2025Toward Convolutional Blind Denoising of Real Photographstoward-convolutional-blind-denoising-of-real-1GSLB: The Graph Structure Learning Benchmarkgslb-the-graph-structure-learning-benchmarkHazyDet: Open-source Benchmark for Drone-view Object Detection with Depth-cues in Hazy ScenesarXiv 2024Playable Game GenerationarXiv 2024Equivariant Hypergraph Diffusion Neural OperatorsarXiv 2022GECToR -- Grammatical Error Correction: Tag, Not Rewritegector-grammatical-error-correction-tag-not-1LoopSplat: Loop Closure by Registering 3D Gaussian SplatsarXiv 2024A Unified Continual Learning Framework with General Parameter-Efficient TuningICCV 2023 1Bilex Rx: Lexical Data Augmentation for Massively Multilingual Machine TranslationarXiv 2023TableFormer: Robust Transformer Modeling for Table-Text EncodingACL 2022 5Learning Vision from Models Rivals Learning Vision from DataCVPR 2024 1Sharpness-Aware Minimization for Efficiently Improving Generalizationsharpness-aware-minimization-for-efficientlyOvercoming Catastrophic Forgetting in Zero-Shot Cross-Lingual GenerationarXiv 2022General-purpose, long-context autoregressive modeling with Perceiver ARarXiv 2022Pix2Struct: Screenshot Parsing as Pretraining for Visual Language UnderstandingarXiv 2022Decoding-based RegressionarXiv 2025MNIST-C: A Robustness Benchmark for Computer VisionarXiv 2019AI Choreographer: Music Conditioned 3D Dance Generation with AIST++ICCV 2021 10OmniGlue: Generalizable Feature Matching with Foundation Model GuidanceCVPR 2024 1MaskGIT: Masked Generative Image TransformerCVPR 2022 1Long Range Arena: A Benchmark for Efficient TransformersarXiv 2020LEAF: A Learnable Frontend for Audio ClassificationarXiv 2021Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual ConceptsCVPR 2021 1Fantasia3D: Disentangling Geometry and Appearance for High-quality Text-to-3D Content CreationICCV 2023 1Revisiting Realistic Test-Time Training: Sequential Inference and Adaptation by Anchored ClusteringarXiv 2022Hydra: Bidirectional State Space Models Through Generalized Matrix MixersarXiv 2024Knowledge Graph Based Synthetic Corpus Generation for Knowledge-Enhanced Language Model Pre-trainingNAACL 2021 4The Flan Collection: Designing Data and Methods for Effective Instruction TuningarXiv 2023Deduplicating Training Data Makes Language Models BetterACL 2022 5PolyMaX: General Dense Prediction with Mask TransformerarXiv 2023Language Model CascadesarXiv 2022Big Bird: Transformers for Longer SequencesNeurIPS 2020 12Big Transfer (BiT): General Visual Representation LearningECCV 2020 8ALBERT: A Lite BERT for Self-supervised Learning of Language RepresentationsICLR 2020 1AugMix: A Simple Data Processing Method to Improve Robustness and UncertaintyICLR 2020 1Simplified and Generalized Masked Diffusion for Discrete DataarXiv 2024Beyond Aesthetics: Cultural Competence in Text-to-Image ModelsarXiv 2024Long-Form Speech Generation with Spoken Language ModelsarXiv 2024Style Aligned Image Generation via Shared AttentionCVPR 2024 1Asynchronous Local-SGD Training for Language ModelingarXiv 2024SPIQA: A Dataset for Multimodal Question Answering on Scientific PapersarXiv 2024High-Fidelity Image Generation With Fewer LabelsarXiv 2019Beyond Prompts: Dynamic Conversational Benchmarking of Large Language ModelsarXiv 2024Evaluation of LLMs on Syntax-Aware Code Fill-in-the-Middle TasksarXiv 2024Inverse Reinforcement Learning without Reinforcement LearningarXiv 2023Chinese Spelling Correction as Rephrasing Language ModelarXiv 2023Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language ModelsarXiv 20253DAffordSplat: Efficient Affordance Reasoning with 3D GaussiansarXiv 2025APHQ-ViT: Post-Training Quantization with Average Perturbation Hessian Based Reconstruction for Vision TransformersCVPR 2025 1AdaLog: Post-Training Quantization for Vision Transformers with Adaptive Logarithm QuantizerarXiv 2024Retrieval is Accurate GenerationarXiv 2024EigenPlaces: Training Viewpoint Robust Models for Visual Place RecognitionICCV 2023 1FooDI-ML: a large multi-language dataset of food, drinks and groceries images and descriptionsarXiv 2021Unsupervised Representation Learning by Predicting Image Rotationsunsupervised-representation-learning-by-2MuLD: The Multitask Long Document BenchmarkLREC 2022 6AGBD: A Global-scale Biomass DatasetarXiv 2024Large Language Models meet Collaborative Filtering: An Efficient All-round LLM-based Recommender SystemarXiv 2024ColorVideoVDP: A visual difference predictor for image, video and display distortionsarXiv 2024On Uni-Modal Feature Learning in Supervised Multi-Modal LearningarXiv 2023Learning GFlowNets from partial episodes for improved convergence and stabilityarXiv 2022MedAgents: Large Language Models as Collaborators for Zero-shot Medical ReasoningarXiv 2023Masked Autoencoder for Self-Supervised Pre-training on Lidar Point CloudsarXiv 2022NeuRAD: Neural Rendering for Autonomous DrivingCVPR 2024 1Dataset Distillation by Matching Training TrajectoriesCVPR 2022 1LLM-based speaker diarization correction: A generalizable approacharXiv 2024WideRange4D: Enabling High-Quality 4D Reconstruction with Wide-Range Movements and ScenesarXiv 2025Token-Budget-Aware LLM ReasoningarXiv 2024SCGC : Self-Supervised Contrastive Graph ClusteringarXiv 2022TM2D: Bimodality Driven 3D Dance Generation via Music-Text IntegrationICCV 2023 1AnySat: One Earth Observation Model for Many Resolutions, Scales, and ModalitiesCVPR 2025 1Harnessing the Power of Large Language Models for Natural Language to First-Order Logic TranslationarXiv 2023StdGEN: Semantic-Decomposed 3D Character Generation from Single ImagesCVPR 2025 1Infogent: An Agent-Based Framework for Web Information AggregationarXiv 2024CoRNStack: High-Quality Contrastive Data for Better Code Retrieval and RerankingarXiv 2024Reconstructing Animatable Categories from VideosCVPR 2023 1SLCA: Slow Learner with Classifier Alignment for Continual Learning on a Pre-trained ModelICCV 2023 1Speaking Style Conversion in the Waveform Domain Using Discrete Self-Supervised UnitsarXiv 2022Toward AI-Driven Digital Organism: Multiscale Foundation Models for Predicting, Simulating and Programming Biology at All LevelsarXiv 2024MoPS: Modular Story Premise Synthesis for Open-Ended Automatic Story GenerationarXiv 2024LIMO: Less is More for ReasoningarXiv 2025Alignment for HonestyarXiv 2023LILO: Learning Interpretable Libraries by Compressing and Documenting CodearXiv 2023On the Impacts of Contexts on Repository-Level Code GenerationarXiv 2024Synthehicle: Multi-Vehicle Multi-Camera Tracking in Virtual CitiesarXiv 2022The Vault: A Comprehensive Multilingual Dataset for Advancing Code Understanding and GenerationarXiv 2023AgileCoder: Dynamic Collaborative Agents for Software Development based on Agile MethodologyarXiv 2024

Back to Papers