All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
SparseFlex: High-Resolution and Arbitrary-Topology 3D Shape ModelingICCV 2025CoBa: Convergence Balancer for Multitask Finetuning of Large Language ModelsarXiv 2024MEAL V2: Boosting Vanilla ResNet-50 to 80%+ Top-1 Accuracy on ImageNet without TricksarXiv 2020OMG: Occlusion-friendly Personalized Multi-concept Generation in Diffusion ModelsarXiv 2024BiomedGPT: A Generalist Vision-Language Foundation Model for Diverse Biomedical TasksarXiv 2023Multi-label Cluster Discrimination for Visual Representation LearningarXiv 2024BERT4Rec: Sequential Recommendation with Bidirectional Encoder Representations from TransformerarXiv 2019Revisiting Pre-Trained Models for Chinese Natural Language ProcessingFindings of the Association for Computational Linguistics 2020Evaluating the Performance of Large Language Models on GAOKAO BenchmarkarXiv 2023Diffusion Model-Based Image Editing: A SurveyarXiv 2024MobileStyleGAN: A Lightweight Convolutional Neural Network for High-Fidelity Image SynthesisarXiv 2021Investigating Training Objectives for Generative Speech EnhancementarXiv 2024DiffusionLight: Light Probes for Free by Painting a Chrome BallCVPR 2024 1The Inside Story: Towards Better Understanding of Machine Translation Neural Evaluation MetricsarXiv 2023ModelScope Text-to-Video Technical ReportarXiv 2023Pluralistic Image Completionpluralistic-image-completion-1SkyReels-A2: Compose Anything in Video Diffusion TransformersarXiv 2025CFG-Zero*: Improved Classifier-Free Guidance for Flow Matching ModelsarXiv 2025Matting AnythingarXiv 2023Diffusion-GAN: Training GANs with DiffusionarXiv 2022Third Time's the Charm? Image and Video Editing with StyleGAN3arXiv 2022ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree SearcharXiv 2024Musika! Fast Infinite Waveform Music GenerationarXiv 2022D-Bot: Database Diagnosis System using Large Language ModelsarXiv 2023SoftGPT: Learn Goal-oriented Soft Object Manipulation Skills by Generative Pre-trained Heterogeneous Graph TransformerarXiv 2023Spatial Self-Distillation for Object Detection with Inaccurate Bounding BoxesICCV 2023 1CityDreamer: Compositional Generative Model of Unbounded 3D CitiesCVPR 2024 1A Semantic Invariant Robust Watermark for Large Language ModelsarXiv 2023ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation SystemsarXiv 2023Recurrent Neural Network RegularizationarXiv 2014DeepMesh: Auto-Regressive Artist-mesh Creation with Reinforcement LearningICCV 2025SiLK -- Simple Learned KeypointsarXiv 2023Scene Text Recognition with Permuted Autoregressive Sequence ModelsarXiv 2022Enhanced Deep Residual Networks for Single Image Super-ResolutionarXiv 2017Buffer of Thoughts: Thought-Augmented Reasoning with Large Language ModelsarXiv 2024PMC-LLaMA: Towards Building Open-source Language Models for MedicinearXiv 2023Q-TOD: A Query-driven Task-oriented Dialogue SystemarXiv 2022RepoCoder: Repository-Level Code Completion Through Iterative Retrieval and GenerationarXiv 2023Supervision Exists Everywhere: A Data Efficient Contrastive Language-Image Pre-training Paradigmsupervision-exists-everywhere-a-dataVPTQ: Extreme Low-bit Vector Post-Training Quantization for Large Language ModelsarXiv 2024TidyBot: Personalized Robot Assistance with Large Language ModelsarXiv 2023MobiLlama: Towards Accurate and Lightweight Fully Transparent GPTarXiv 2024AgentGym: Evolving Large Language Model-based Agents across Diverse EnvironmentsarXiv 2024On Scaling Up 3D Gaussian Splatting TrainingarXiv 2024Self-Supervised Learning with Swin TransformersarXiv 2021KISS-Matcher: Fast and Robust Point Cloud Registration RevisitedarXiv 2024DAGs with NO TEARS: Continuous Optimization for Structure Learningdags-with-no-tears-continuous-optimization-1End-to-end Lane Shape Prediction with TransformersarXiv 2020QA-GNN: Reasoning with Language Models and Knowledge Graphs for Question AnsweringNAACL 2021 4SUMix: Mixup with Semantic and Uncertain InformationarXiv 2024SynCity: Training-Free Generation of 3D WorldsarXiv 2025End-to-End Referring Video Object Segmentation with Multimodal TransformersCVPR 2022 1RecurrentGemma: Moving Past Transformers for Efficient Open Language ModelsarXiv 2024Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall SpacesCVPR 2025 1The Temporal Opportunist: Self-Supervised Multi-Frame Monocular DepthCVPR 2021 1CSL: A Large-scale Chinese Scientific Literature DatasetCOLING 2022 10SceneDreamer: Unbounded 3D Scene Generation from 2D Image CollectionsarXiv 2023Dynamic Head: Unifying Object Detection Heads with AttentionsCVPR 2021 1XTREME-R: Towards More Challenging and Nuanced Multilingual EvaluationEMNLP 2021 11Hard Prompts Made Easy: Gradient-Based Discrete Optimization for Prompt Tuning and Discoveryhard-prompts-made-easy-gradient-basedDocRED: A Large-Scale Document-Level Relation Extraction Datasetdocred-a-large-scale-document-level-relation-1Interpretability Beyond Feature Attribution: Quantitative Testing with Concept Activation Vectors (TCAV)interpretability-beyond-feature-attribution-1PyMAF-X: Towards Well-aligned Full-body Model Regression from Monocular ImagesarXiv 2022BlendedMVS: A Large-scale Dataset for Generalized Multi-view Stereo Networksblendedmvs-a-large-scale-dataset-for-1Instruction Distillation Makes Large Language Models Efficient Zero-shot RankersarXiv 2023NAS-Bench-201: Extending the Scope of Reproducible Neural Architecture
SearcharXiv 2020Flash Diffusion: Accelerating Any Conditional Diffusion Model for Few Steps Image GenerationarXiv 2024A Commute in Data: The comma2k19 DatasetarXiv 20182017 Robotic Instrument Segmentation ChallengearXiv 2019AgentLite: A Lightweight Library for Building and Advancing Task-Oriented LLM Agent SystemarXiv 2024How to Fine-Tune BERT for Text Classification?arXiv 2019AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing TasksarXiv 2024Large Selective Kernel Network for Remote Sensing Object DetectionICCV 2023 1Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech SynthesisarXiv 2025Segment Any Point Cloud Sequences by Distilling Vision Foundation ModelsNeurIPS 2023 11MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual TokensarXiv 2024Towards Zero-Shot Scale-Aware Monocular Depth EstimationICCV 2023 1SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language ModelsarXiv 2023BioMedLM: A 2.7B Parameter Language Model Trained On Biomedical TextarXiv 2024Masked Autoencoders that ListenarXiv 2022Fast and Robust Iterative Closest PointarXiv 2020Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image SynthesisarXiv 2023Small-Text: Active Learning for Text Classification in Pythonsmall-text-active-learning-for-textIndoNLU: Benchmark and Resources for Evaluating Indonesian Natural Language UnderstandingAsian Chapter of the Association for Computational Linguistics 2020FinBERT: A Pretrained Language Model for Financial CommunicationsarXiv 2020A Comprehensive Survey of Scientific Large Language Models and Their Applications in Scientific DiscoveryarXiv 2024DocBank: A Benchmark Dataset for Document Layout AnalysisCOLING 2020 8Platypus: Quick, Cheap, and Powerful Refinement of LLMsarXiv 2023Large Language Models for Data Annotation and Synthesis: A SurveyarXiv 20246D Rotation Representation For Unconstrained Head Pose EstimationarXiv 2022TableGPT2: A Large Multimodal Model with Tabular Data IntegrationarXiv 2024HelloMeme: Integrating Spatial Knitting Attentions to Embed High-Level and Fidelity-Rich Conditions in Diffusion ModelsarXiv 2024Glyph-ByT5-v2: A Strong Aesthetic Baseline for Accurate Multilingual Visual Text RenderingarXiv 2024SC-GS: Sparse-Controlled Gaussian Splatting for Editable Dynamic ScenesCVPR 2024 13D-VLA: A 3D Vision-Language-Action Generative World ModelarXiv 2024Towards Metrical Reconstruction of Human FacesarXiv 2022R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT ModelarXiv 2025Graph Contrastive Learning with AugmentationsNeurIPS 2020 12nnDetection: A Self-configuring Method for Medical Object DetectionarXiv 2021MIGC++: Advanced Multi-Instance Generation Controller for Image SynthesisarXiv 2024Deep Face Restoration: A SurveyarXiv 2022Deep White-Balance EditingarXiv 2020A General Gaussian Heatmap Label Assignment for Arbitrary-Oriented Object DetectionarXiv 2021TaBERT: Pretraining for Joint Understanding of Textual and Tabular DataarXiv 2020Feature 3DGS: Supercharging 3D Gaussian Splatting to Enable Distilled Feature FieldsCVPR 2024 1Self-Supervised Learning of 3D Human Pose using Multi-view Geometryself-supervised-learning-of-3d-human-pose-1MultiMAE: Multi-modal Multi-task Masked AutoencodersarXiv 2022Aligning and Prompting Everything All at Once for Universal Visual
PerceptionarXiv 2023On Bringing Robots HomearXiv 2023Learning Dense Representations of Phrases at ScaleACL 2021 5NeX: Real-time View Synthesis with Neural Basis ExpansionCVPR 2021 1img2pose: Face Alignment and Detection via 6DoF, Face Pose EstimationCVPR 2021 1TheAgentCompany: Benchmarking LLM Agents on Consequential Real World TasksarXiv 2024Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional TokenizationarXiv 2024HoloPart: Generative 3D Part Amodal SegmentationarXiv 2025Taming Rectified Flow for Inversion and EditingarXiv 2024InstanceDiffusion: Instance-level Control for Image GenerationCVPR 2024 1EmbodiedSAM: Online Segment Any 3D Thing in Real TimearXiv 2024BERTweet: A pre-trained language model for English TweetsEMNLP 2020 11GPS-Gaussian: Generalizable Pixel-wise 3D Gaussian Splatting for Real-time Human Novel View SynthesisCVPR 2024 1Tokenize Anything via PromptingarXiv 2023MoCoGAN: Decomposing Motion and Content for Video Generationmocogan-decomposing-motion-and-content-for-1EVA3D: Compositional 3D Human Generation from 2D Image CollectionsarXiv 2022Giraffe: Adventures in Expanding Context Lengths in LLMsarXiv 2023Improving Statistical Fidelity for Neural Image Compression with Implicit Local Likelihood ModelsarXiv 2023Amortized Planning with Large-Scale Transformers: A Case Study on ChessarXiv 2024CURL: Contrastive Unsupervised Representations for Reinforcement LearningarXiv 2020DocBERT: BERT for Document ClassificationarXiv 2019SGD-X: A Benchmark for Robust Generalization in Schema-Guided Dialogue SystemsarXiv 2021Look Once to Hear: Target Speech Hearing with Noisy ExamplesarXiv 2024Kani: A Lightweight and Highly Hackable Framework for Building Language Model ApplicationsarXiv 2023Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video UnderstandingarXiv 2025Generating Images from Captions with AttentionarXiv 2015Rethinking Network Design and Local Geometry in Point Cloud: A Simple
Residual MLP FrameworkarXiv 2022UniAudio: An Audio Foundation Model Toward Universal Audio GenerationarXiv 2023HairCLIP: Design Your Hair by Text and Reference ImageCVPR 2022 1DreamGaussian4D: Generative 4D Gaussian SplattingarXiv 2023Parameter-Efficient Fine-Tuning for Pre-Trained Vision Models: A Survey and BenchmarkarXiv 2024CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windowscswin-transformer-a-general-vision-1Scaling and Benchmarking Self-Supervised Visual Representation Learningscaling-and-benchmarking-self-supervised-1Fast FullSubNet: Accelerate Full-band and Sub-band Fusion Model for Single-channel Speech EnhancementarXiv 2022Eliciting Latent Predictions from Transformers with the Tuned LensarXiv 2023Transfer Learning in Biomedical Natural Language Processing: An Evaluation of BERT and ELMo on Ten Benchmarking Datasetstransfer-learning-in-biomedical-natural-1Reconstructing Humans with a Biomechanically Accurate SkeletonCVPR 2025 1DiffIR: Efficient Diffusion Model for Image RestorationICCV 2023 1Towards Foundation Models for Knowledge Graph ReasoningarXiv 2023Inversion-Based Style Transfer with Diffusion ModelsCVPR 2023 1Self-Play Preference Optimization for Language Model AlignmentarXiv 2024Blended Diffusion for Text-driven Editing of Natural ImagesCVPR 2022 1Groma: Localized Visual Tokenization for Grounding Multimodal Large Language ModelsarXiv 2024Next-ViT: Next Generation Vision Transformer for Efficient Deployment in Realistic Industrial ScenariosarXiv 2022CLIP-Adapter: Better Vision-Language Models with Feature AdaptersarXiv 2021WenetSpeech: A 10000+ Hours Multi-domain Mandarin Corpus for Speech RecognitionarXiv 2021Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End EngineeringarXiv 2024Long Text Generation via Adversarial Training with Leaked InformationarXiv 2017MAGE: MAsked Generative Encoder to Unify Representation Learning and Image SynthesisCVPR 2023 1SkyReels-A1: Expressive Portrait Animation in Video Diffusion TransformersarXiv 2025LSUN: Construction of a Large-scale Image Dataset using Deep Learning with Humans in the LooparXiv 2015Deep Anomaly Detection with Outlier Exposuredeep-anomaly-detection-with-outlier-exposure-1Make-A-Character: High Quality Text-to-3D Character Generation within MinutesarXiv 2023Omnivore: A Single Model for Many Visual ModalitiesCVPR 2022 1Recovering Realistic Texture in Image Super-resolution by Deep Spatial Feature Transformrecovering-realistic-texture-in-image-super-1BackdoorBench: A Comprehensive Benchmark of Backdoor LearningarXiv 2022Graph Prompt Learning: A Comprehensive Survey and BeyondarXiv 2023WanJuan: A Comprehensive Multimodal Dataset for Advancing English and Chinese Large ModelsarXiv 2023StickyLand: Breaking the Linear Presentation of Computational NotebooksarXiv 2022DAB-DETR: Dynamic Anchor Boxes are Better Queries for DETRdab-detr-dynamic-anchor-boxes-are-betterUnifiedSKG: Unifying and Multi-Tasking Structured Knowledge Grounding with Text-to-Text Language ModelsarXiv 2022GraphMAE: Self-Supervised Masked Graph AutoencodersarXiv 2022Towards Reasoning in Large Language Models: A SurveyarXiv 2022Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image GenerationNeurIPS 2023 11code2seq: Generating Sequences from Structured Representations of Codecode2seq-generating-sequences-from-structured-1Grasp2Vec: Learning Object Representations from Self-Supervised GraspingarXiv 2018Iterated Decomposition: Improving Science Q&A by Supervising Reasoning ProcessesarXiv 2023ChineseBERT: Chinese Pretraining Enhanced by Glyph and Pinyin InformationACL 2021 5High-performance symbolic-numerics via multiple dispatcharXiv 2021Precise Zero-Shot Dense Retrieval without Relevance LabelsarXiv 2022Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategiesarXiv 2023PAWS-X: A Cross-lingual Adversarial Dataset for Paraphrase Identificationpaws-x-a-cross-lingual-adversarial-dataset-1MVDiffusion: Enabling Holistic Multi-view Image Generation with Correspondence-Aware Diffusionmvdiffusion-enabling-holistic-multi-viewProtein structure generation via folding diffusionarXiv 2022An Empirical Evaluation of Using Large Language Models for Automated Unit Test GenerationarXiv 2023LLaSM: Large Language and Speech ModelarXiv 2023GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak PromptsarXiv 2023SepLLM: Accelerate Large Language Models by Compressing One Segment into One SeparatorarXiv 2024DrivingDiffusion: Layout-Guided multi-view driving scene video generation with latent diffusion modelarXiv 2023Improved Regularization of Convolutional Neural Networks with CutoutarXiv 2017Wuerstchen: An Efficient Architecture for Large-Scale Text-to-Image Diffusion ModelsarXiv 2023Dora: Sampling and Benchmarking for 3D Shape Variational Auto-Encodersdora-sampling-and-benchmarking-for-3d-shapeFascinating Supervisory Signals and Where to Find Them: Deep Anomaly Detection with Scale LearningarXiv 2023Aether: Geometric-Aware Unified World ModelingICCV 2025MultiNet: Real-time Joint Semantic Reasoning for Autonomous DrivingarXiv 2016OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLMCVPR 2024 1TRIPS: Trilinear Point Splatting for Real-Time Radiance Field RenderingarXiv 2024Knowledge Guided Disambiguation for Large-Scale Scene Classification with Multi-Resolution CNNsarXiv 2016ReFT: Reasoning with Reinforced Fine-TuningarXiv 2024Atlas: Few-shot Learning with Retrieval Augmented Language ModelsarXiv 2022SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image EditingarXiv 2024INSTRUCTEVAL: Towards Holistic Evaluation of Instruction-Tuned Large Language ModelsarXiv 2023SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight CompressionarXiv 2023