All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
T2Ranking: A large-scale Chinese Benchmark for Passage RankingarXiv 2023POSTER++: A simpler and stronger facial expression recognition networkarXiv 2023DeeBERT: Dynamic Early Exiting for Accelerating BERT Inferencedeebert-dynamic-early-exiting-for-1HourVideo: 1-Hour Video-Language UnderstandingarXiv 2024Masked Trajectory Models for Prediction, Representation, and ControlarXiv 2023Tranception: protein fitness prediction with autoregressive transformers and inference-time retrievalarXiv 2022Suspicion-Agent: Playing Imperfect Information Games with Theory of Mind Aware GPT-4arXiv 2023Long Range Graph BenchmarkarXiv 2022StyleRF: Zero-shot 3D Style Transfer of Neural Radiance FieldsCVPR 2023 1On the Effectiveness of Interval Bound Propagation for Training Verifiably Robust ModelsarXiv 2018A Survey on Mixup Augmentations and BeyondarXiv 2024TVR: A Large-Scale Dataset for Video-Subtitle Moment RetrievalECCV 2020 8CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-ExpertsarXiv 2024Orthogonal Subspace Decomposition for Generalizable AI-Generated Image DetectionarXiv 2024CARTE: Pretraining and Transfer for Tabular LearningarXiv 2024Small Object Detection via Coarse-to-fine Proposal Generation and Imitation LearningICCV 2023 1Transferable Decoding with Visual Entities for Zero-Shot Image CaptioningICCV 2023 1Fast Sampling of Diffusion Models with Exponential IntegratorarXiv 2022AnomalyBERT: Self-Supervised Transformer for Time Series Anomaly Detection using Data Degradation SchemearXiv 2023MGTBench: Benchmarking Machine-Generated Text DetectionarXiv 2023iVideoGPT: Interactive VideoGPTs are Scalable World ModelsarXiv 20243DGS-DET: Empower 3D Gaussian Splatting with Boundary Guidance and Box-Focused Sampling for 3D Object DetectionarXiv 2024Read, Listen, and See: Leveraging Multimodal Information Helps Chinese Spell CheckingFindings (ACL) 2021 8CLOOB: Modern Hopfield Networks with InfoLOOB Outperform CLIPcloob-modern-hopfield-networks-with-infoloobGradient Origin NetworksICLR 2021 1Multi-Task Pre-Training for Plug-and-Play Task-Oriented Dialogue SystemACL 2022 5Revisit Anything: Visual Place Recognition via Image Segment RetrievalarXiv 2024RaySplats: Ray Tracing based Gaussian SplattingarXiv 2025XLM-T: Multilingual Language Models in Twitter for Sentiment Analysis and BeyondLREC 2022 6Knowledge Circuits in Pretrained TransformersarXiv 2024TheoremQA: A Theorem-driven Question Answering datasetarXiv 2023NLU++: A Multi-Label, Slot-Rich, Generalisable Dataset for Natural Language Understanding in Task-Oriented DialogueFindings (NAACL) 2022 7QTIP: Quantization with Trellises and Incoherence ProcessingarXiv 2024Crystal Structure Generation with Autoregressive Large Language ModelingarXiv 2023How to Find Your Friendly Neighborhood: Graph Attention Design with Self-Supervisionhow-to-find-your-friendly-neighborhood-graphGraph Optimal Transport for Cross-Domain AlignmentICML 2020 1FineRecon: Depth-aware Feed-forward Network for Detailed 3D ReconstructionICCV 2023 1Towards High-Quality and Efficient Speech Bandwidth Extension with Parallel Amplitude and Phase PredictionarXiv 2024CodeR: Issue Resolving with Multi-Agent and Task GraphsarXiv 2024InstructDoc: A Dataset for Zero-Shot Generalization of Visual Document Understanding with InstructionsarXiv 2024The Wisdom of Hindsight Makes Language Models Better Instruction FollowersarXiv 2023Trial and Error: Exploration-Based Trajectory Optimization for LLM AgentsarXiv 2024ClimSim-Online: A Large Multi-scale Dataset and Framework for Hybrid ML-physics Climate EmulationNeurIPS 2023 11APQ: Joint Search for Network Architecture, Pruning and Quantization Policyapq-joint-search-for-network-architectureMG-LLaVA: Towards Multi-Granularity Visual Instruction TuningarXiv 2024Diverse Image Generation via Self-Conditioned GANsdiverse-image-generation-via-self-conditionedThe N+ Implementation Details of RLHF with PPO: A Case Study on TL;DR SummarizationarXiv 2024VSA: Learning Varied-Size Window Attention in Vision TransformersarXiv 2022Cost Aggregation Is All You Need for Few-Shot SegmentationarXiv 2021Leopard: A Vision Language Model For Text-Rich Multi-Image TasksarXiv 2024CamI2V: Camera-Controlled Image-to-Video Diffusion ModelarXiv 2024X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation ModelsarXiv 2024Agent Planning with World Knowledge ModelarXiv 2024Nonparametric Masked Language ModelingarXiv 2022Reflected Diffusion ModelsarXiv 2023FouriScale: A Frequency Perspective on Training-Free High-Resolution Image SynthesisarXiv 2024UniHCP: A Unified Model for Human-Centric PerceptionsCVPR 2023 1Lightweight Image Super-Resolution with Adaptive Weighted Learning NetworkarXiv 2019XPDNet for MRI Reconstruction: an application to the 2020 fastMRI challengearXiv 2020DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal PerceptionarXiv 2024Drone-based RGB-Infrared Cross-Modality Vehicle Detection via Uncertainty-Aware LearningarXiv 2020XtremeDistilTransformers: Task Transfer for Task-agnostic DistillationarXiv 2021Hierarchically Decomposed Graph Convolutional Networks for Skeleton-Based Action RecognitionICCV 2023 1FlipAttack: Jailbreak LLMs via FlippingarXiv 2024TransMix: Attend to Mix for Vision TransformersCVPR 2022 1COIL: Revisit Exact Lexical Match in Information Retrieval with Contextualized Inverted ListNAACL 2021 4PB-LLM: Partially Binarized Large Language ModelsarXiv 2023A Systematic Study of Cross-Layer KV Sharing for Efficient LLM InferencearXiv 2024DVIS: Decoupled Video Instance Segmentation FrameworkICCV 2023 1LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction TuningarXiv 2025Training Transformers with 4-bit Integerstraining-transformers-with-4-bit-integersSelf-Supervised Learning via Conditional Motion Propagationself-supervised-learning-via-conditional-1Robot See Robot Do: Imitating Articulated Object Manipulation with Monocular 4D ReconstructionarXiv 2024Understanding and Robustifying Differentiable Architecture SearchICLR 2020 1LibriTTS-P: A Corpus with Speaking Style and Speaker Identity Prompts for Text-to-Speech and Style CaptioningarXiv 2024ComplexFuncBench: Exploring Multi-Step and Constrained Function Calling under Long-Context ScenarioarXiv 2025PRIMERA: Pyramid-based Masked Sentence Pre-training for Multi-document SummarizationACL 2022 5Scale-MAE: A Scale-Aware Masked Autoencoder for Multiscale Geospatial Representation LearningICCV 2023 1CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge FusionarXiv 2024Bias and Fairness in Large Language Models: A SurveyarXiv 2023CEDR: Contextualized Embeddings for Document RankingarXiv 2019Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language ModelsarXiv 2025Large Language Model as Attributed Training Data Generator: A Tale of Diversity and Biaslarge-language-model-as-attributed-trainingGerman's Next Language ModelCOLING 2020 8VolRecon: Volume Rendering of Signed Ray Distance Functions for Generalizable Multi-View ReconstructionCVPR 2023 1Challenges in Data-to-Document Generationchallenges-in-data-to-document-generation-1HACK: Learning a Parametric Head and Neck Model for High-fidelity
AnimationarXiv 2023Puzzle Mix: Exploiting Saliency and Local Statistics for Optimal Mixuppuzzle-mix-exploiting-saliency-and-localEnd-to-End Human Object Interaction Detection with HOI TransformerarXiv 2021Samba: Semantic Segmentation of Remotely Sensed Images with State Space ModelarXiv 2024Control Prefixes for Parameter-Efficient Text GenerationarXiv 2021Vocalsound: A Dataset for Improving Human Vocal Sounds RecognitionarXiv 2022Language Embedded 3D Gaussians for Open-Vocabulary Scene UnderstandingCVPR 2024 1Direct Preference Optimization of Video Large Multimodal Models from Language Model RewardarXiv 2024CoSER: Coordinating LLM-Based Persona Simulation of Established RolesarXiv 2025ChatGPT-powered Conversational Drug Editing Using Retrieval and Domain FeedbackarXiv 2023Imitating Human Behaviour with Diffusion ModelsarXiv 2023FineDance: A Fine-grained Choreography Dataset for 3D Full Body Dance GenerationICCV 2023 1Analyzing and Mitigating Object Hallucination in Large Vision-Language ModelsarXiv 2023Scalable Diffusion Models with State Space BackbonearXiv 2024Action Segmentation with Joint Self-Supervised Temporal Domain Adaptationaction-segmentation-with-joint-self-1DiffMoE: Dynamic Token Selection for Scalable Diffusion TransformersarXiv 2025A Downsampled Variant of ImageNet as an Alternative to the CIFAR datasetsarXiv 2017Recurrent Memory TransformerarXiv 2022SQA3D: Situated Question Answering in 3D ScenesarXiv 2022Testing the General Deductive Reasoning Capacity of Large Language Models Using OOD Examplestesting-the-general-deductive-reasoningLabel Supervised LLaMA FinetuningarXiv 2023A Recipe for Watermarking Diffusion ModelsarXiv 2023ObjectSDF++: Improved Object-Compositional Neural Implicit SurfacesICCV 2023 1OpenRFT: Adapting Reasoning Foundation Model for Domain-specific Tasks with Reinforcement Fine-TuningarXiv 2024Feature Refinement to Improve High Resolution Image InpaintingarXiv 2022Character-based Joint Segmentation and POS Tagging for Chinese using Bidirectional RNN-CRFcharacter-based-joint-segmentation-and-pos-1MoA: Mixture of Sparse Attention for Automatic Large Language Model CompressionarXiv 2024Sequential Monte Carlo Steering of Large Language Models using Probabilistic ProgramsarXiv 2023Learning to Make Keypoints Sub-Pixel AccuratearXiv 2024AMAGO: Scalable In-Context Reinforcement Learning for Adaptive AgentsarXiv 2023Combining Induction and Transduction for Abstract ReasoningarXiv 2024StarEnhancer: Learning Real-Time and Style-Aware Image EnhancementICCV 2021 10IMP: Iterative Matching and Pose Estimation with Adaptive PoolingCVPR 2023 1Sparse Attention with Linear UnitsEMNLP 2021 11An Empirical Survey of the Effectiveness of Debiasing Techniques for Pre-trained Language ModelsACL 2022 5Mimicking Word Embeddings using Subword RNNsmimicking-word-embeddings-using-subword-rnns-1DCFace: Synthetic Face Generation with Dual Condition Diffusion ModelCVPR 2023 1AI-Generated Images as Data Source: The Dawn of Synthetic EraarXiv 2023Structure-CLIP: Towards Scene Graph Knowledge to Enhance Multi-modal Structured RepresentationsarXiv 2023HOTR: End-to-End Human-Object Interaction Detection with TransformersCVPR 2021 1Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language ModelsarXiv 2024GoMVS: Geometrically Consistent Cost Aggregation for Multi-View StereoCVPR 2024 1Exploring Wav2vec 2.0 fine-tuning for improved speech emotion recognitionarXiv 2021AutoClip: Adaptive Gradient Clipping for Source Separation NetworksarXiv 2020Pseudo-Q: Generating Pseudo Language Queries for Visual GroundingCVPR 2022 1RouterBench: A Benchmark for Multi-LLM Routing SystemarXiv 2024Interpreting the Weight Space of Customized Diffusion ModelsarXiv 2024PlanRAG: A Plan-then-Retrieval Augmented Generation for Generative Large Language Models as Decision MakersarXiv 2024Seismic Foundation Model (SFM): a new generation deep learning model in
geophysicsarXiv 2023TinyFusion: Diffusion Transformers Learned ShallowCVPR 2025 1InsMOS: Instance-Aware Moving Object Segmentation in LiDAR DataarXiv 2023You Only Hypothesize Once: Point Cloud Registration with Rotation-equivariant DescriptorsarXiv 2021MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data EnginearXiv 2024Perception Prioritized Training of Diffusion ModelsCVPR 2022 1MMToM-QA: Multimodal Theory of Mind Question AnsweringarXiv 2024Stream of Search (SoS): Learning to Search in LanguagearXiv 2024Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion
ModelsarXiv 2023Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from VideosICCV 2025LRM-Zero: Training Large Reconstruction Models with Synthesized DataarXiv 2024Restart Sampling for Improving Generative ProcessesNeurIPS 2023 11Revisiting Class-Incremental Learning with Pre-Trained Models: Generalizability and Adaptivity are All You NeedarXiv 2023FuXi Weather: A data-to-forecast machine learning system for global weatherarXiv 2024Adaptive Frequency Filters As Efficient Global Token MixersICCV 2023 1LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language ModelsarXiv 2023SAMPro3D: Locating SAM Prompts in 3D for Zero-Shot Scene SegmentationarXiv 2023LiDAR-based 4D Occupancy Completion and ForecastingarXiv 2023Not Low-Resource Anymore: Aligner Ensembling, Batch Filtering, and New Datasets for Bengali-English Machine TranslationEMNLP 2020 11Neural Vocoder is All You Need for Speech Super-resolutionarXiv 2022Gamba: Marry Gaussian Splatting with Mamba for single view 3D reconstructionarXiv 2024Multitrack Music TransformerarXiv 2022SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware DecodingarXiv 2024ARNIQA: Learning Distortion Manifold for Image Quality AssessmentarXiv 2023Few shot font generation via transferring similarity guided global style and quantization local styleICCV 2023 1TableFormer: Table Structure Understanding with TransformersCVPR 2022 1OneKE: A Dockerized Schema-Guided LLM Agent-based Knowledge Extraction SystemarXiv 2024Position-guided Text Prompt for Vision-Language Pre-trainingCVPR 2023 1MAVE: A Product Dataset for Multi-source Attribute Value ExtractionarXiv 2021Newsroom: A Dataset of 1.3 Million Summaries with Diverse Extractive Strategiesnewsroom-a-dataset-of-13-million-summaries-1Texture-Preserving Diffusion Models for High-Fidelity Virtual Try-OnCVPR 2024 1AutoStory: Generating Diverse Storytelling Images with Minimal Human EffortarXiv 2023Model Fusion via Optimal TransportNeurIPS 2020 12RISE: 3D Perception Makes Real-World Robot Imitation Simple and
EffectivearXiv 2024QQQ: Quality Quattuor-Bit Quantization for Large Language ModelsarXiv 2024Adapted Large Language Models Can Outperform Medical Experts in Clinical Text SummarizationarXiv 2023NetMamba: Efficient Network Traffic Classification via Pre-training Unidirectional MambaarXiv 2024NetMamba: Efficient Network Traffic Classification via Pre-training Unidirectional MambaarXiv 2024CliCR: A Dataset of Clinical Case Reports for Machine Reading Comprehensionclicr-a-dataset-of-clinical-case-reports-for-1An In-depth Look at Gemini's Language AbilitiesarXiv 2023GAPartNet: Cross-Category Domain-Generalizable Object Perception and
Manipulation via Generalizable and Actionable PartsarXiv 2022ST-LLM: Large Language Models Are Effective Temporal Learnersst-llm-large-language-models-are-effectiveBeyond Efficiency: A Systematic Survey of Resource-Efficient Large Language ModelsarXiv 2024Co-Evolution of Pose and Mesh for 3D Human Body Estimation from VideoICCV 2023 1Faster Causal Attention Over Large Sequences Through Sparse Flash AttentionarXiv 2023Bridging Continuous and Discrete Tokens for Autoregressive Visual GenerationICCV 2025Parallel Sampling of Diffusion Modelsparallel-sampling-of-diffusion-modelsSplitwise: Efficient generative LLM inference using phase splittingarXiv 2023DocGenome: An Open Large-scale Scientific Document Benchmark for Training and Testing Multi-modal Large Language ModelsarXiv 2024Knowledge Conflicts for LLMs: A SurveyarXiv 2024What If We Recaption Billions of Web Images with LLaMA-3?arXiv 2024Token-level Direct Preference OptimizationarXiv 2024GREEK-BERT: The Greeks visiting Sesame StreetarXiv 2020PowerSGD: Practical Low-Rank Gradient Compression for Distributed Optimizationpowersgd-practical-low-rank-gradient-1PSLA: Improving Audio Tagging with Pretraining, Sampling, Labeling, and AggregationarXiv 2021Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language ModelsarXiv 2024PosterLLaVa: Constructing a Unified Multi-modal Layout Generator with LLMarXiv 2024DreamWaltz-G: Expressive 3D Gaussian Avatars from Skeleton-Guided 2D DiffusionarXiv 2024Contrast with Reconstruct: Contrastive 3D Representation Learning Guided by Generative PretrainingarXiv 2023Visually Guided Generative Text-Layout Pre-training for Document IntelligencearXiv 2024Train longer, generalize better: closing the generalization gap in large batch training of neural networkstrain-longer-generalize-better-closing-the-1NAS evaluation is frustratingly hardICLR 2020 1Vision Transformer with Super Token SamplingCVPR 2023 1Not All Features Matter: Enhancing Few-shot CLIP with Adaptive Prior RefinementICCV 2023 1A StrongREJECT for Empty JailbreaksarXiv 2024LayoutNUWA: Revealing the Hidden Layout Expertise of Large Language ModelsarXiv 2023