All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
LlamaTouch: A Faithful and Scalable Testbed for Mobile UI Task AutomationarXiv 2024Accurate LoRA-Finetuning Quantization of LLMs via Information RetentionarXiv 2024FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Visual Language ModelsICCV 2025LatentEditor: Text Driven Local Editing of 3D ScenesarXiv 2023Planning, Creation, Usage: Benchmarking LLMs for Comprehensive Tool Utilization in Real-World Complex ScenariosarXiv 2024Empowering Many, Biasing a Few: Generalist Credit Scoring through Large Language ModelsarXiv 2023Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal AssistantsarXiv 2023Multi-Level Explanations for Generative Language ModelsarXiv 2024AcinoSet: A 3D Pose Estimation Dataset and Baseline Models for Cheetahs in the WildarXiv 2021MSVM-UNet: Multi-Scale Vision Mamba UNet for Medical Image SegmentationarXiv 2024SciPIP: An LLM-based Scientific Paper Idea ProposerarXiv 2024NanoFlow: Scalable Normalizing Flows with Sublinear Parameter ComplexityNeurIPS 2020 12stream-learn -- open-source Python library for difficult data stream batch analysisarXiv 2020I-Max: Maximize the Resolution Potential of Pre-trained Rectified Flow Transformers with Projected FlowarXiv 2024Transforming Image Super-Resolution: A ConvFormer-based Efficient ApproacharXiv 2024BERT Loses Patience: Fast and Robust Inference with Early ExitNeurIPS 2020 12On the Effectiveness of Spectral Discriminators for Perceptual Quality ImprovementICCV 2023 1Parrot Captions Teach CLIP to Spot TextarXiv 2023Vision-Language Models are Zero-Shot Reward Models for Reinforcement LearningarXiv 2023Generative Pre-trained Speech Language Model with Efficient Hierarchical TransformerarXiv 2024Generalized Planning in PDDL Domains with Pretrained Large Language ModelsarXiv 2023Scoring Sentence Singletons and Pairs for Abstractive Summarizationscoring-sentence-singletons-and-pairs-forDPOT: Auto-Regressive Denoising Operator Transformer for Large-Scale PDE Pre-TrainingarXiv 2024EfficientDM: Efficient Quantization-Aware Fine-Tuning of Low-Bit Diffusion ModelsarXiv 2023MF-MOS: A Motion-Focused Model for Moving Object SegmentationarXiv 2024InGram: Inductive Knowledge Graph Embedding via Relation GraphsarXiv 2023Learning Continuous 3D Words for Text-to-Image GenerationCVPR 2024 1From Zero to Hero: Examining the Power of Symbolic Tasks in Instruction TuningarXiv 2023Robust e-NeRF: NeRF from Sparse & Noisy Events under Non-Uniform MotionICCV 2023 1Learning Delays in Spiking Neural Networks using Dilated Convolutions with Learnable SpacingsarXiv 2023Weakly Supervised Disentangled Generative Causal Representation Learningdisentangled-generative-causal-representationCan Language Models Teach Weaker Agents? Teacher Explanations Improve Students via PersonalizationarXiv 2023FICE: Text-Conditioned Fashion Image Editing With Guided GAN InversionarXiv 2023Mitigating Object Hallucination via Concentric Causal AttentionarXiv 2024FemtoDet: An Object Detection Baseline for Energy Versus Performance TradeoffsICCV 2023 1LoRA-Composer: Leveraging Low-Rank Adaptation for Multi-Concept Customization in Training-Free Diffusion ModelsarXiv 2024Universal Jailbreak Backdoors from Poisoned Human FeedbackarXiv 2023Robust Mixture-of-Expert Training for Convolutional Neural NetworksICCV 2023 1OccRWKV: Rethinking Efficient 3D Semantic Occupancy Prediction with Linear ComplexityarXiv 2024NuClick: A Deep Learning Framework for Interactive Segmentation of Microscopy ImagesarXiv 2020DOLG: Single-Stage Image Retrieval with Deep Orthogonal Fusion of Local and Global FeaturesICCV 2021 10Fighting an Infodemic: COVID-19 Fake News DatasetarXiv 2020Efficient LLM Scheduling by Learning to RankarXiv 2024Local Augmentation for Graph Neural Networkslocal-augmentation-for-graph-neural-networks-1Fine-Tuning Language Models with Advantage-Induced Policy AlignmentarXiv 2023Scalable Multi-Temporal Remote Sensing Change Data Generation via Simulating Stochastic Change Processscalable-multi-temporal-remote-sensing-changeSCOOP: Self-Supervised Correspondence and Optimization-Based Scene FlowCVPR 2023 1V2C-CBM: Building Concept Bottlenecks with Vision-to-Concept TokenizerarXiv 2025SpaceByte: Towards Deleting Tokenization from Large Language ModelingarXiv 2024Hyperparameter optimization with approximate gradientarXiv 2016SuperNOVA: Design Strategies and Opportunities for Interactive Visualization in Computational NotebooksarXiv 2023MaIR: A Locality- and Continuity-Preserving Mamba for Image RestorationCVPR 2025 1RepBERT: Contextualized Text Embeddings for First-Stage RetrievalarXiv 2020Sliced Recursive Transformersliced-recursive-transformerNeMF: Inverse Volume Rendering with Neural Microflake FieldICCV 2023 1Graph-enhanced Large Language Models in Asynchronous Plan ReasoningarXiv 2024On the Exploitability of Instruction Tuningon-the-exploitability-of-instruction-tuningA Study of Bayesian Neural Network Surrogates for Bayesian OptimizationarXiv 2023Learning Vision-and-Language Navigation from YouTube VideosICCV 2023 1Efficient and Degree-Guided Graph Generation via Discrete Diffusion ModelingarXiv 2023Intelligent Go-Explore: Standing on the Shoulders of Giant Foundation ModelsarXiv 2024Collaborative Perception in Autonomous Driving: Methods, Datasets and ChallengesarXiv 2023Mamba-ND: Selective State Space Modeling for Multi-Dimensional DataarXiv 2024NeuMap: Neural Coordinate Mapping by Auto-Transdecoder for Camera LocalizationCVPR 2023 1SLUE: New Benchmark Tasks for Spoken Language Understanding Evaluation on Natural SpeecharXiv 2021Machine Unlearning of Pre-trained Large Language ModelsarXiv 2024ReACC: A Retrieval-Augmented Code Completion FrameworkACL 2022 5h-Edit: Effective and Flexible Diffusion-Based Editing via Doob's h-TransformCVPR 2025 1Beyond Text: Optimizing RAG with Multimodal Inputs for Industrial ApplicationsarXiv 2024Introducing RONEC -- the Romanian Named Entity CorpusarXiv 2019Beyond Text: Optimizing RAG with Multimodal Inputs for Industrial ApplicationsarXiv 2024h-Edit: Effective and Flexible Diffusion-Based Editing via Doob's h-TransformCVPR 2025 1Monocular Occupancy Prediction for Scalable Indoor ScenesarXiv 2024Tamper-Resistant Safeguards for Open-Weight LLMsarXiv 2024DeepPerception: Advancing R1-like Cognitive Visual Perception in MLLMs for Knowledge-Intensive Visual GroundingarXiv 2025Why Is Spatial Reasoning Hard for VLMs? An Attention Mechanism Perspective on Focus AreasarXiv 2025ScaleKD: Strong Vision Transformers Could Be Excellent TeachersarXiv 2024Evaluating General Purpose Vision Foundation Models for Medical Image Analysis: An Experimental Study of DINOv2 on Radiology BenchmarksarXiv 2023Attention-Guided Contrastive Role Representations for Multi-Agent
Reinforcement LearningarXiv 2023AdaptDiffuser: Diffusion Models as Adaptive Self-evolving PlannersarXiv 2023Codebook Features: Sparse and Discrete Interpretability for Neural NetworksarXiv 2023Decision-Focused Learning: Foundations, State of the Art, Benchmark and Future OpportunitiesarXiv 2023BoxSnake: Polygonal Instance Segmentation with Box SupervisionICCV 2023 1Cross Attention Based Style Distribution for Controllable Person Image SynthesisarXiv 2022MVGamba: Unify 3D Content Generation as State Space Sequence ModelingarXiv 2024e-CARE: a New Dataset for Exploring Explainable Causal ReasoningACL 2022 5Learning Anchored Unsigned Distance Functions with Gradient Direction Alignment for Single-view Garment ReconstructionICCV 2021 10GaussRender: Learning 3D Occupancy with Gaussian RenderingICCV 2025CoIN: A Benchmark of Continual Instruction tuNing for Multimodel Large Language ModelarXiv 2024CED: Consistent ensemble distillation for audio taggingarXiv 2023Transformers are Meta-Reinforcement LearnersarXiv 2022A Large Scale Search Dataset for Unbiased Learning to RankarXiv 2022Cross-modal Contrastive Learning for Speech TranslationNAACL 2022 7EntQA: Entity Linking as Question Answeringentqa-entity-linking-as-question-answering-1Taming Sparsely Activated Transformer with Stochastic Expertstaming-sparsely-activated-transformer-with-1PhoneLM:an Efficient and Capable Small Language Model Family through Principled Pre-trainingarXiv 2024Rickrolling the Artist: Injecting Backdoors into Text Encoders for Text-to-Image SynthesisICCV 2023 1SegVG: Transferring Object Bounding Box to Segmentation for Visual GroundingarXiv 2024RL4F: Generating Natural Language Feedback with Reinforcement Learning for Repairing Model OutputsarXiv 2023Visual Instruction Tuning with Polite FlamingoarXiv 2023Explainable Automated Fact-Checking for Public Health ClaimsEMNLP 2020 11EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene UnderstandingICCV 2025Trends, Applications, and Challenges in Human Attention ModellingarXiv 2024TESTAM: A Time-Enhanced Spatio-Temporal Attention Model with Mixture of ExpertsarXiv 2024LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and ModelsarXiv 2024We're Afraid Language Models Aren't Modeling AmbiguityarXiv 2023GEDepth: Ground Embedding for Monocular Depth EstimationICCV 2023 1CORAL: Benchmarking Multi-turn Conversational Retrieval-Augmentation GenerationarXiv 2024MSF: Motion-guided Sequential Fusion for Efficient 3D Object Detection from Point Cloud SequencesCVPR 2023 1Exploiting Asymmetry for Synthetic Training Data Generation: SynthIE and the Case of Information ExtractionarXiv 2023Impact of Code Language Models on Automated Program RepairarXiv 2023Region-Adaptive Deformable Network for Image Quality AssessmentarXiv 2021Pansharpening by convolutional neural networks in the full resolution frameworkarXiv 2021Memory-Guided Multi-View Multi-Domain Fake News DetectionarXiv 2022SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image InterpretationarXiv 2025RASAT: Integrating Relational Structures into Pretrained Seq2Seq Model
for Text-to-SQLarXiv 2022SpecExec: Massively Parallel Speculative Decoding for Interactive LLM Inference on Consumer DevicesarXiv 2024Simple Guidance Mechanisms for Discrete Diffusion ModelsarXiv 2024The Devil in Linear TransformerarXiv 2022Grounded Question-Answering in Long Egocentric VideosCVPR 2024 1Grasp as You Say: Language-guided Dexterous Grasp GenerationarXiv 2024Exploring Large Language Models for Communication Games: An Empirical Study on WerewolfarXiv 2023Improving Medical Reasoning through Retrieval and Self-Reflection with Retrieval-Augmented Large Language ModelsarXiv 2024Discovering Preference Optimization Algorithms with and for Large Language ModelsarXiv 2024CrossLoc3D: Aerial-Ground Cross-Source 3D Place RecognitionICCV 2023 1Robin3D: Improving 3D Large Language Model via Robust Instruction TuningICCV 2025Large Language Models Can Learn Temporal ReasoningarXiv 2024The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake AudioarXiv 2024Multiview Contextual Commonsense Inference: A New Dataset and TaskarXiv 2022Video Adverse-Weather-Component Suppression Network via Weather Messenger and Adversarial BackpropagationICCV 2023 1Disfl-QA: A Benchmark Dataset for Understanding Disfluencies in Question AnsweringFindings (ACL) 2021 8BERTRAM: Improved Word Embeddings Have Big Impact on Contextualized Model Performancebertram-improved-word-embeddings-have-big-1Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task AlignmentCVPR 2025 1IterativePFN: True Iterative Point Cloud FilteringCVPR 2023 1Leveraging Hallucinations to Reduce Manual Prompt Dependency in Promptable SegmentationarXiv 2024Kuaipedia: a Large-scale Multi-modal Short-video EncyclopediaarXiv 2022ProsocialDialog: A Prosocial Backbone for Conversational AgentsarXiv 2022Detecting Hallucinated Content in Conditional Neural Sequence Generationdetecting-hallucinated-content-in-conditionalInstructCoder: Instruction Tuning Large Language Models for Code EditingarXiv 2023Making Pre-trained Language Models Great on Tabular PredictionarXiv 2024Qilin-Med-VL: Towards Chinese Large Vision-Language Model for General HealthcarearXiv 2023XED: A Multilingual Dataset for Sentiment Analysis and Emotion DetectionCOLING 2020 8Padé Activation Units: End-to-end Learning of Flexible Activation Functions in Deep NetworksICLR 2020 1Dynosaur: A Dynamic Growth Paradigm for Instruction-Tuning Data CurationarXiv 2023Weak-to-Strong Search: Align Large Language Models via Searching over Small Language ModelsarXiv 2024Watch Every Step! LLM Agent Learning via Iterative Step-Level Process RefinementarXiv 2024CoMPM: Context Modeling with Speaker's Pre-trained Memory Tracking for Emotion Recognition in ConversationarXiv 2021Multistain Pretraining for Slide Representation Learning in PathologyarXiv 2024Large Language Models can Learn RulesarXiv 2023Beyond Browsing: API-Based Web AgentsarXiv 2024BianCang: A Traditional Chinese Medicine Large Language ModelarXiv 2024Exploring CLIP's Dense Knowledge for Weakly Supervised Semantic SegmentationCVPR 2025 1Why Transformers Need Adam: A Hessian PerspectivearXiv 2024MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive DiversityarXiv 2024RICO: Regularizing the Unobservable for Indoor Compositional ReconstructionICCV 2023 1Multimodality Helps Few-Shot 3D Point Cloud Semantic SegmentationarXiv 2024Large Language Models are Better Reasoners with Self-VerificationarXiv 2022DLT: Conditioned layout generation with Joint Discrete-Continuous Diffusion Layout TransformerICCV 2023 1LLMZip: Lossless Text Compression using Large Language ModelsarXiv 2023GRAG: Graph Retrieval-Augmented GenerationarXiv 2024Searching for Efficient Multi-Stage Vision TransformersarXiv 2021ConflictBank: A Benchmark for Evaluating the Influence of Knowledge Conflicts in LLMarXiv 2024ITINERA: Integrating Spatial Optimization with Large Language Models for Open-domain Urban Itinerary PlanningarXiv 2024Exploring Transfer Learning in Medical Image Segmentation using Vision-Language ModelsarXiv 2023TimeMIL: Advancing Multivariate Time Series Classification via a Time-aware Multiple Instance LearningarXiv 2024ScribeAgent: Towards Specialized Web Agents Using Production-Scale Workflow DataarXiv 2024HeadInfer: Memory-Efficient LLM Inference by Head-wise OffloadingarXiv 2025TEST: Text Prototype Aligned Embedding to Activate LLM's Ability for Time SeriesarXiv 2023Diffusion Model is an Effective Planner and Data Synthesizer for Multi-Task Reinforcement Learningdiffusion-model-is-an-effective-planner-andExploiting News Article Structure for Automatic Corpus Generation of Entailment DatasetsarXiv 2020ERA-CoT: Improving Chain-of-Thought through Entity Relationship AnalysisarXiv 2024Constraining Depth Map Geometry for Multi-View Stereo: A Dual-Depth Approach with Saddle-shaped Depth CellsICCV 2023 1EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language ModelsCVPR 2024 1On Breast Cancer Detection: An Application of Machine Learning Algorithms on the Wisconsin Diagnostic DatasetarXiv 2017Phasic Content Fusing Diffusion Model with Directional Distribution Consistency for Few-Shot Model AdaptionICCV 2023 1Exploring evolution-aware & -free protein language models as protein function predictorsarXiv 2022Benchmarking and Analyzing Point Cloud Classification under CorruptionsarXiv 2022Trillion Dollar Words: A New Financial Dataset, Task & Market AnalysisarXiv 2023One-Shot Object Affordance Detection in the WildarXiv 2021MTVQA: Benchmarking Multilingual Text-Centric Visual Question AnsweringarXiv 2024Aggretriever: A Simple Approach to Aggregate Textual Representations for Robust Dense Passage RetrievalarXiv 2022Dirichlet Diffusion Score Model for Biological Sequence GenerationarXiv 2023Video Person Re-ID: Fantastic Techniques and Where to Find ThemarXiv 2019GraphCLIP: Enhancing Transferability in Graph Foundation Models for Text-Attributed GraphsarXiv 2024Video Instance MattingarXiv 2023Towards Principled Disentanglement for Domain GeneralizationCVPR 2022 1PruneVid: Visual Token Pruning for Efficient Video Large Language ModelsarXiv 2024AvatarVerse: High-quality & Stable 3D Avatar Creation from Text and PosearXiv 2023NeRF-DS: Neural Radiance Fields for Dynamic Specular ObjectsCVPR 2023 1DoG is SGD's Best Friend: A Parameter-Free Dynamic Step Size SchedulearXiv 2023A Review of Bangla Natural Language Processing Tasks and the Utility of Transformer ModelsarXiv 2021Improving Knowledge-aware Dialogue Generation via Knowledge Base Question AnsweringarXiv 2019Fast Inference and Update of Probabilistic Density Estimation on Trajectory PredictionICCV 2023 1Aspect-based Document Similarity for Research PapersCOLING 2020 8Unlocking the Hidden Potential of CLIP in Generalizable Deepfake DetectionarXiv 2025Learning to Reason Deductively: Math Word Problem Solving as Complex Relation ExtractionACL 2022 5MC-MoE: Mixture Compressor for Mixture-of-Experts LLMs Gains MorearXiv 2024Maverick: Efficient and Accurate Coreference Resolution Defying Recent TrendsarXiv 2024On the Efficacy of Eviction Policy for Key-Value Constrained Generative Language Model InferencearXiv 2024Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal PromptingarXiv 2025