All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
LLM and Simulation as Bilevel Optimizers: A New Paradigm to Advance Physical Scientific DiscoveryarXiv 2024GPT-4V(ision) is a Generalist Web Agent, if GroundedarXiv 2024Multi-task self-supervised learning for Robust Speech RecognitionarXiv 2020DAD-3DHeads: A Large-scale Dense, Accurate and Diverse Dataset for 3D Head Alignment from a Single ImageCVPR 2022 1InjecGuard: Benchmarking and Mitigating Over-defense in Prompt Injection Guardrail ModelsarXiv 2024UniControl: A Unified Diffusion Model for Controllable Visual Generation In the Wildunicontrol-a-unified-diffusion-model-forRealistic and Efficient Face Swapping: A Unified Approach with Diffusion ModelsarXiv 2024XPSR: Cross-modal Priors for Diffusion-based Image Super-ResolutionarXiv 2024Learning Joint Spatial-Temporal Transformations for Video InpaintingECCV 2020 8Summary of a Haystack: A Challenge to Long-Context LLMs and RAG SystemsarXiv 2024MM-Diffusion: Learning Multi-Modal Diffusion Models for Joint Audio and Video GenerationCVPR 2023 1WILDS: A Benchmark of in-the-Wild Distribution ShiftsarXiv 2020Exploring Neural Models for Query-Focused SummarizationFindings (NAACL) 2022 7AutoPatent: A Multi-Agent Framework for Automatic Patent GenerationarXiv 2024VDT: General-purpose Video Diffusion Transformers via Mask ModelingarXiv 2023Small Models, Big Insights: Leveraging Slim Proxy Models To Decide When and What to Retrieve for LLMsarXiv 2024HtmlRAG: HTML is Better Than Plain Text for Modeling Retrieved Knowledge in RAG SystemsarXiv 2024FlatQuant: Flatness Matters for LLM QuantizationarXiv 2024MotionGS: Exploring Explicit Motion Guidance for Deformable 3D Gaussian SplattingarXiv 2024High-Resolution Virtual Try-On with Misalignment and Occlusion-Handled ConditionsarXiv 2022Minimizing Trajectory Curvature of ODE-based Generative ModelsarXiv 2023LayoutDETR: Detection Transformer Is a Good Multimodal Layout DesignerarXiv 2022TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video UnderstandingCVPR 2024 1HorNet: Efficient High-Order Spatial Interactions with Recursive Gated ConvolutionsarXiv 2022GeDi: Generative Discriminator Guided Sequence GenerationFindings (EMNLP) 2021 11LLMs as Factual Reasoners: Insights from Existing Benchmarks and BeyondarXiv 2023OmniEval: An Omnidirectional and Automatic RAG Evaluation Benchmark in Financial DomainarXiv 2024Large Language Models for Information Retrieval: A SurveyarXiv 2023CodeAttack: Revealing Safety Generalization Challenges of Large Language Models via Code CompletionarXiv 2024Sparse R-CNN: End-to-End Object Detection with Learnable ProposalsCVPR 2021 1Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video GeneratorsICCV 2023 1Table-Critic: A Multi-Agent Framework for Collaborative Criticism and Refinement in Table ReasoningarXiv 2025Brain-ID: Learning Contrast-agnostic Anatomical Representations for Brain ImagingarXiv 2023Long-Context Language Modeling with Parallel Context EncodingarXiv 2024ScandEval: A Benchmark for Scandinavian Natural Language ProcessingarXiv 2023MusPy: A Toolkit for Symbolic Music GenerationarXiv 2020Large Language Models for Generative Information Extraction: A SurveyarXiv 2023PG-RCNN: Semantic Surface Point Generation for 3D Object DetectionICCV 2023 1RMT: Retentive Networks Meet Vision TransformersCVPR 2024 1DemoFusion: Democratising High-Resolution Image Generation With No $$$CVPR 2024 1TaskExpert: Dynamically Assembling Multi-Task Representations with Memorial Mixture-of-ExpertsICCV 2023 1CodeTF: One-stop Transformer Library for State-of-the-art Code LLMarXiv 2023Unified Hallucination Detection for Multimodal Large Language ModelsarXiv 2024CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement LearningarXiv 2022User Behavior Simulation with Large Language Model based AgentsarXiv 2023LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic AlignmentarXiv 2023Human Motion Diffusion as a Generative PriorarXiv 2023R-Bench: Are your Large Multimodal Model Robust to Real-world Corruptions?arXiv 2024SpatialSense: An Adversarially Crowdsourced Benchmark for Spatial Relation Recognitionspatialsense-an-adversarially-crowdsourced-1Identifying the Risks of LM Agents with an LM-Emulated SandboxarXiv 2023Teaching LMMs for Image Quality Scoring and InterpretingarXiv 2025Optimal Representations for Covariate Shiftoptimal-representations-for-covariate-shiftSEA-RAFT: Simple, Efficient, Accurate RAFT for Optical FlowarXiv 2024Optimal Goal-Reaching Reinforcement Learning via Quasimetric LearningarXiv 2023Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like ArchitecturesarXiv 2024OV-NeRF: Open-vocabulary Neural Radiance Fields with Vision and Language Foundation Models for 3D Semantic UnderstandingarXiv 2024Q-Ground: Image Quality Grounding with Large Multi-modality ModelsarXiv 2024SA-Med2D-20M Dataset: Segment Anything in 2D Medical Imaging with 20 Million masksarXiv 2023Are Your LLMs Capable of Stable Reasoning?arXiv 2024FairTune: Optimizing Parameter Efficient Fine Tuning for Fairness in Medical Image AnalysisarXiv 2023Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language ModelsarXiv 2025HybriMoE: Hybrid CPU-GPU Scheduling and Cache Management for Efficient MoE InferencearXiv 2025An Empirical Study on Eliciting and Improving R1-like Reasoning ModelsarXiv 2025Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary ResolutionarXiv 2024OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human PreferencearXiv 2025HPO-B: A Large-Scale Reproducible Benchmark for Black-Box HPO based on OpenMLarXiv 2021Unleashing HyDRa: Hybrid Fusion, Depth Consistency and Radar for Unified 3D PerceptionarXiv 2024Robotouille: An Asynchronous Planning Benchmark for LLM AgentsarXiv 2025Vibe-Eval: A hard evaluation suite for measuring progress of multimodal language modelsarXiv 2024Low-Rank Quantization-Aware Training for LLMsarXiv 2024Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language ModelarXiv 2024BotChat: Evaluating LLMs' Capabilities of Having Multi-Turn DialoguesarXiv 2023Mask-DPO: Generalizable Fine-grained Factuality Alignment of LLMsarXiv 2025Improving Large Language Models via Fine-grained Reinforcement Learning with Minimum Editing ConstraintarXiv 2024Catastrophic Jailbreak of Open-source LLMs via Exploiting GenerationarXiv 2023UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban ScenariosarXiv 2024Ada-LEval: Evaluating long-context LLMs with length-adaptable benchmarksarXiv 2024Enhancing One-Shot Federated Learning Through Data and Ensemble Co-BoostingarXiv 2024Making Retrieval-Augmented Language Models Robust to Irrelevant ContextarXiv 2023V*: Guided Visual Search as a Core Mechanism in Multimodal LLMsarXiv 2023Procedural Knowledge in Pretraining Drives Reasoning in Large Language ModelsarXiv 2024Rank1: Test-Time Compute for Reranking in Information RetrievalarXiv 2025Can Language Models Solve Olympiad Programming?arXiv 2024PyThaiNLP: Thai Natural Language Processing in PythonarXiv 2023Theory of Mind for Multi-Agent Collaboration via Large Language ModelsarXiv 2023SugarCrepe: Fixing Hackable Benchmarks for Vision-Language Compositionalitysugarcrepe-fixing-hackable-benchmarks-forMatryoshka Representation LearningarXiv 2022Pipeline Parallelism with Controllable MemoryarXiv 2024WiLoR: End-to-end 3D Hand Localization and Reconstruction in-the-wildCVPR 2025 1pysentimiento: A Python Toolkit for Opinion Mining and Social NLP tasksarXiv 2021TreeMeshGPT: Artistic Mesh Generation with Autoregressive Tree SequencingCVPR 2025 1Quantifying Attention Flow in Transformersquantifying-attention-flow-in-transformers-1Hard-Constrained Deep Learning for Climate DownscalingarXiv 2022RWKV-7 "Goose" with Expressive Dynamic State EvolutionarXiv 2025A Repository of Conversational Datasetsa-repository-of-conversational-datasetsImage Over Text: Transforming Formula Recognition Evaluation with Character Detection MatchingCVPR 2025 1QuRating: Selecting High-Quality Data for Training Language ModelsarXiv 2024Towards Garment Sewing Pattern Reconstruction from a Single ImagearXiv 2023PosterLayout: A New Benchmark and Approach for Content-aware Visual-Textual Presentation LayoutCVPR 2023 1Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language ModelsarXiv 2025Multiview Equivariance Improves 3D Correspondence Understanding with Minimal Feature FinetuningarXiv 2024Needle In A Multimodal HaystackarXiv 2024MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature SynchronizerarXiv 2024I Don't Know: Explicit Modeling of Uncertainty with an [IDK] TokenarXiv 2024A standardized Project Gutenberg corpus for statistical analysis of natural language and quantitative linguisticsarXiv 2018Leveraging Biomolecule and Natural Language through Multi-Modal Learning: A SurveyarXiv 2024LLM Self Defense: By Self Examination, LLMs Know They Are Being TrickedarXiv 2023AgentSims: An Open-Source Sandbox for Large Language Model EvaluationarXiv 2023Fine-Tuning Language Models with Just Forward Passesfine-tuning-language-models-with-just-forwardWDM: 3D Wavelet Diffusion Models for High-Resolution Medical Image SynthesisarXiv 2024GAM Coach: Towards Interactive and User-centered Algorithmic RecoursearXiv 2023ChatCoT: Tool-Augmented Chain-of-Thought Reasoning on Chat-based Large Language ModelsarXiv 2023Learning Manipulation by Predicting InteractionarXiv 2024Fashionpedia: Ontology, Segmentation, and an Attribute Localization DatasetECCV 2020 8Simple Copy-Paste is a Strong Data Augmentation Method for Instance SegmentationCVPR 2021 1Open-vocabulary Object Detection via Vision and Language Knowledge Distillationopen-vocabulary-object-detection-via-visionEfficientNet: Rethinking Model Scaling for Convolutional Neural Networksefficientnet-rethinking-model-scaling-for-1Revisiting ResNets: Improved Training and Scaling StrategiesNeurIPS 2021 12On the Tool Manipulation Capability of Open-source Large Language ModelsarXiv 2023Erasing Concepts from Diffusion ModelsICCV 2023 1CFBench: A Comprehensive Constraints-Following Benchmark for LLMsarXiv 2024FABind: Fast and Accurate Protein-Ligand BindingNeurIPS 2023 11Diffusion Explainer: Visual Explanation for Text-to-image Stable DiffusionarXiv 2023InterCode: Standardizing and Benchmarking Interactive Coding with Execution FeedbackNeurIPS 2023 11Language Models Resist Alignment: Evidence From Data CompressionarXiv 2024FinanceBench: A New Benchmark for Financial Question AnsweringarXiv 2023PokerBench: Training Large Language Models to become Professional Poker PlayersarXiv 2025Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference OptimizationCVPR 2025 1Ghost in the Minecraft: Generally Capable Agents for Open-World Environments via Large Language Models with Text-based Knowledge and MemoryarXiv 2023EfficientQAT: Efficient Quantization-Aware Training for Large Language ModelsarXiv 2024DeepRetrieval: Hacking Real Search Engines and Retrievers with Large Language Models via Reinforcement LearningarXiv 2025LaneSegNet: Map Learning with Lane Segment Perception for Autonomous DrivingarXiv 2023Few-Shot Parameter-Efficient Fine-Tuning is Better and Cheaper than In-Context LearningarXiv 2022ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image GenerationarXiv 2025Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision ApplicationsCVPR 2024 1MVBench: A Comprehensive Multi-modal Video Understanding BenchmarkCVPR 2024 1Generating Long Sequences with Sparse Transformersgenerating-long-sequences-with-sparseRobustSAM: Segment Anything Robustly on Degraded Imagesrobustsam-segment-anything-robustly-onNutriGen: Personalized Meal Plan Generator Leveraging Large Language Models to Enhance Dietary and Nutritional AdherencearXiv 2025COLLIE: Systematic Construction of Constrained Text Generation TasksarXiv 2023PredBench: Benchmarking Spatio-Temporal Prediction across Diverse DisciplinesarXiv 2024DeepZero: Scaling up Zeroth-Order Optimization for Deep Model TrainingarXiv 2023REAL: Benchmarking Autonomous Agents on Deterministic Simulations of Real WebsitesarXiv 2025Fine-Tuning Language Models from Human PreferencesarXiv 2019Formal Mathematics Statement Curriculum LearningarXiv 2022Data Feedback Loops: Model-driven Amplification of Dataset BiasesarXiv 2022UnlearnCanvas: Stylized Image Dataset for Enhanced Machine Unlearning Evaluation in Diffusion ModelsarXiv 2024K-Paths: Reasoning over Graph Paths for Drug Repurposing and Drug Interaction PredictionarXiv 2025Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answeringbottom-up-and-top-down-attention-for-image-1LL3DA: Visual Interactive Instruction Tuning for Omni-3D Understanding, Reasoning, and PlanningarXiv 2023THE COLOSSEUM: A Benchmark for Evaluating Generalization for Robotic ManipulationarXiv 2024SurfaceNet: Adversarial SVBRDF Estimation from a Single ImageICCV 2021 10OpenNMT: Neural Machine Translation Toolkitopennmt-neural-machine-translation-toolkit-1Breaking the cycle -- Colleagues are all you needarXiv 2019Finding the Missing Data: A BERT-inspired Approach Against Package Loss in Wireless SensingarXiv 2024From Words to Numbers: Your Large Language Model Is Secretly A Capable Regressor When Given In-Context ExamplesarXiv 2024Spacetime Gaussian Feature Splatting for Real-Time Dynamic View SynthesisCVPR 2024 1Selective Aggregation for Low-Rank Adaptation in Federated LearningarXiv 2024A New Federated Learning Framework Against Gradient Inversion AttacksarXiv 2024Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual DrawingarXiv 2025From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action ModelsarXiv 2025HuPR: A Benchmark for Human Pose Estimation Using Millimeter Wave RadararXiv 2022Neural Motifs: Scene Graph Parsing with Global Contextneural-motifs-scene-graph-parsing-with-global-1Vision Transformer for Fast and Efficient Scene Text RecognitionarXiv 2021Sparse Autoencoders for Hypothesis GenerationarXiv 2025ClipCap: CLIP Prefix for Image CaptioningarXiv 2021Computational Life: How Well-formed, Self-replicating Programs Emerge from Simple InteractionarXiv 2024Paint3D: Paint Anything 3D with Lighting-Less Texture Diffusion ModelsCVPR 2024 1BlendGAN: Implicitly GAN Blending for Arbitrary Stylized Face GenerationNeurIPS 2021 12Vakyansh: ASR Toolkit for Low Resource Indic languagesarXiv 2022CLIP-MoE: Towards Building Mixture of Experts for CLIP with Diversified Multiplet UpcyclingarXiv 2024Contrastive Learning for Many-to-many Multilingual Neural Machine TranslationACL 2021 5EE-Tuning: An Economical yet Scalable Solution for Tuning Early-Exit Large Language ModelsarXiv 2024Semi-Supervised Reward Modeling via Iterative Self-TrainingarXiv 2024LLaMA-MoE v2: Exploring Sparsity of LLaMA from Perspective of Mixture-of-Experts with Post-TrainingarXiv 2024One-2-3-45: Any Single Image to 3D Mesh in 45 Seconds without Per-Shape Optimizationone-2-3-45-any-single-image-to-3d-mesh-in-45Masked Autoencoders for Point Cloud Self-supervised LearningarXiv 2022Blended Latent DiffusionarXiv 2022MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language AnnotationsarXiv 2024VerIF: Verification Engineering for Reinforcement Learning in Instruction FollowingarXiv 2025XRAI: Better Attributions Through Regionsxrai-better-attributions-through-regionsMedical Image Classification with KAN-Integrated Transformers and Dilated Neighborhood AttentionarXiv 2025From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection TuningICCV 2025GAugLLM: Improving Graph Contrastive Learning for Text-Attributed Graphs with Large Language ModelsarXiv 2024Lightning Attention-2: A Free Lunch for Handling Unlimited Sequence Lengths in Large Language ModelsarXiv 2024MultiDiffusion: Fusing Diffusion Paths for Controlled Image GenerationarXiv 2023SINDy-RL: Interpretable and Efficient Model-Based Reinforcement LearningarXiv 2024QuALITY: Question Answering with Long Input Texts, Yes!NAACL 2022 7ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image ExplorationarXiv 2024PolygloToxicityPrompts: Multilingual Evaluation of Neural Toxic Degeneration in Large Language ModelsarXiv 2024Improve Vision Language Model Chain-of-thought ReasoningarXiv 2024How to Evaluate the Generalization of Detection? A Benchmark for Comprehensive Open-Vocabulary DetectionarXiv 2023Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive DecodingarXiv 2024OctFusion: Octree-based Diffusion Models for 3D Shape GenerationarXiv 2024SpikeGPT: Generative Pre-trained Language Model with Spiking Neural NetworksarXiv 2023Scalable MatMul-free Language ModelingarXiv 2024PIA: Your Personalized Image Animator via Plug-and-Play Modules in Text-to-Image ModelsCVPR 2024 1Attention U-Net: Learning Where to Look for the PancreasarXiv 2018Colorful Image ColorizationarXiv 2016EmbedLLM: Learning Compact Representations of Large Language ModelsarXiv 2024