0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

Gaussian Splatting with NeRF-based Color and OpacityarXiv 2023StruQ: Defending Against Prompt Injection with Structured QueriesarXiv 2024BiMediX2: Bio-Medical EXpert LMM for Diverse Medical ModalitiesarXiv 2024CPPE-5: Medical Personal Protective Equipment DatasetarXiv 2021Channel Vision Transformers: An Image Is Worth 1 x 16 x 16 WordsarXiv 2023Quality Controlled Paraphrase GenerationACL 2022 5ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world ScenariosarXiv 2024Scaling transformer neural networks for skillful and reliable medium-range weather forecastingarXiv 2023CRAFT: Concept Recursive Activation FacTorization for ExplainabilityCVPR 2023 1Mamba-360: Survey of State Space Models as Transformer Alternative for Long Sequence Modelling: Methods, Applications, and ChallengesarXiv 2024Knowledge Infused Decodingknowledge-infused-decodingNorNE: Annotating Named Entities for Norwegiannorne-annotating-named-entities-for-norwegian-1A Surprisingly Robust Trick for Winograd Schema ChallengearXiv 2019ViDA: Homeostatic Visual Domain Adapter for Continual Test Time AdaptationarXiv 2023How Far Can We Go with Practical Function-Level Program Repair?arXiv 2024AgentRE: An Agent-Based Framework for Navigating Complex Information Landscapes in Relation ExtractionarXiv 2024Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced ReasoningarXiv 2025E.T. Bench: Towards Open-Ended Event-Level Video-Language UnderstandingarXiv 2024LOT: A Story-Centric Benchmark for Evaluating Chinese Long Text Understanding and GenerationarXiv 2021Telco-RAG: Navigating the Challenges of Retrieval-Augmented Language Models for TelecommunicationsarXiv 2024Fine-Grained Cross-View Geo-Localization Using a Correlation-Aware Homography Estimatorfine-grained-cross-view-geo-localizationGreedyViG: Dynamic Axial Graph Construction for Efficient Vision GNNsarXiv 2024Context-Aware Meta-LearningarXiv 2023Learning Subpocket Prototypes for Generalizable Structure-based Drug DesignarXiv 2023BillSum: A Corpus for Automatic Summarization of US Legislationbillsum-a-corpus-for-automatic-summarization-1Enhancing Large Vision Language Models with Self-Training on Image ComprehensionarXiv 2024TACRED Revisited: A Thorough Evaluation of the TACRED Relation Extraction Tasktacred-revisited-a-thorough-evaluation-of-the-1An Empirical Evaluation of Columnar Storage FormatsarXiv 2023ChartCoder: Advancing Multimodal Large Language Model for Chart-to-Code GenerationarXiv 2025Quasar: Datasets for Question Answering by Search and ReadingarXiv 2017PatentBERT: Patent Classification with Fine-Tuning a pre-trained BERT ModelarXiv 2019ChartGemma: Visual Instruction-tuning for Chart Reasoning in the WildarXiv 2024Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language ModelsarXiv 2025Cascaded Zoom-in Detector for High Resolution Aerial ImagesarXiv 2023Generative Artificial Intelligence for Navigating Synthesizable Chemical SpacearXiv 2024LiMoE: Mixture of LiDAR Representation Learners from Automotive ScenesCVPR 2025 1TNCR: Table Net Detection and Classification DatasetarXiv 2021Critique-out-Loud Reward ModelsarXiv 2024Online Adaptation of Language Models with a Memory of Amortized ContextsarXiv 2024MultiDoc2Dial: Modeling Dialogues Grounded in Multiple DocumentsEMNLP 2021 11NeuroNet: A Novel Hybrid Self-Supervised Learning Framework for Sleep Stage Classification Using Single-Channel EEGarXiv 2024Dropout Q-Functions for Doubly Efficient Reinforcement Learningdropout-q-functions-for-doubly-efficient-1EVolSplat: Efficient Volume-based Gaussian Splatting for Urban View SynthesisCVPR 2025 1Promptus: Can Prompts Streaming Replace Video Streaming with Stable DiffusionarXiv 2024Context-Aware Entity Grounding with Open-Vocabulary 3D Scene GraphsarXiv 2023Global Reasoning over Database Structures for Text-to-SQL ParsingarXiv 2019The Text Anonymization Benchmark (TAB): A Dedicated Corpus and Evaluation Framework for Text AnonymizationarXiv 2022CleanAgent: Automating Data Standardization with LLM-based AgentsarXiv 2024MAS-GPT: Training LLMs to Build LLM-based Multi-Agent SystemsarXiv 2025Improved sampling via learned diffusionsarXiv 2023Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken ConversationsarXiv 2024XPersona: Evaluating Multilingual Personalized ChatbotEMNLP (NLP4ConvAI) 2021 11Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance DistillationarXiv 2024OVM, Outcome-supervised Value Models for Planning in Mathematical ReasoningarXiv 2023Efficient Long-Text Understanding with Short-Text ModelsarXiv 2022Coercing LLMs to do and reveal (almost) anythingarXiv 2024MBQ: Modality-Balanced Quantization for Large Vision-Language ModelsCVPR 2025 1PosSAM: Panoptic Open-vocabulary Segment Anythingpossam-panoptic-open-vocabulary-segmentMonoNeRF: Learning a Generalizable Dynamic Radiance Field from Monocular VideosICCV 2023 1Language Models as Black-Box Optimizers for Vision-Language ModelsCVPR 2024 1Towards Explainable Anticancer Compound Sensitivity Prediction via Multimodal Attention-based Convolutional EncodersarXiv 2019CM-TTS: Enhancing Real Time Text-to-Speech Synthesis Efficiency through Weighted Samplers and Consistency ModelsarXiv 2024ODEFormer: Symbolic Regression of Dynamical Systems with TransformersarXiv 2023SCROLLS: Standardized CompaRison Over Long Language SequencesarXiv 2022SADM: Sequence-Aware Diffusion Model for Longitudinal Medical Image GenerationarXiv 2022CanvasVAE: Learning to Generate Vector Graphic DocumentsICCV 2021 10RLCD: Reinforcement Learning from Contrastive Distillation for Language Model AlignmentarXiv 2023Adversarial Retriever-Ranker for dense text retrievaladversarial-retriever-ranker-for-dense-text-1MTLoRA: A Low-Rank Adaptation Approach for Efficient Multi-Task LearningarXiv 2024NEAT: Distilling 3D Wireframes from Neural Attraction FieldsCVPR 2024 1Image Inpainting via Iteratively Decoupled Probabilistic ModelingarXiv 2022MiniPLM: Knowledge Distillation for Pre-Training Language ModelsarXiv 2024DReg-NeRF: Deep Registration for Neural Radiance FieldsICCV 2023 1BrainBERT: Self-supervised representation learning for intracranial recordingsarXiv 2023Measuring and Enhancing Trustworthiness of LLMs in RAG through Grounded Attributions and Learning to RefusearXiv 2024Towards Lifelong Learning of Large Language Models: A SurveyarXiv 2024A Bi-Step Grounding Paradigm for Large Language Models in Recommendation SystemsarXiv 2023Evil Geniuses: Delving into the Safety of LLM-based AgentsarXiv 2023CLIPood: Generalizing CLIP to Out-of-DistributionsarXiv 2023Hello Again! LLM-powered Personalized Agent for Long-term DialoguearXiv 2024RetrievalQA: Assessing Adaptive Retrieval-Augmented Generation for Short-form Open-Domain Question AnsweringarXiv 2024Cyclic Test-Time Adaptation on Monocular Video for 3D Human Mesh ReconstructionICCV 2023 1EarthPT: a time series foundation model for Earth ObservationarXiv 2023Unlocking the Capabilities of Thought: A Reasoning Boundary Framework to Quantify and Optimize Chain-of-ThoughtarXiv 2024LANISTR: Multimodal Learning from Structured and Unstructured DataarXiv 2023ARCLE: The Abstraction and Reasoning Corpus Learning Environment for Reinforcement LearningarXiv 2024Decoupling Common and Unique Representations for Multimodal Self-supervised LearningarXiv 2023Crossway Diffusion: Improving Diffusion-based Visuomotor Policy via Self-supervised LearningarXiv 2023Robustness and Accuracy Could Be Reconcilable by (Proper) DefinitionarXiv 2022Why Do We Need Weight Decay in Modern Deep Learning?arXiv 2023Hybrid Ranking Network for Text-to-SQLarXiv 2020Downstream-agnostic Adversarial ExamplesICCV 2023 1Neural CRF Model for Sentence Alignment in Text Simplificationneural-crf-model-for-sentence-alignment-in-1Contrastive Deep SupervisionarXiv 2022Say No to the Discrimination: Learning Fair Graph Neural Networks with Limited Sensitive Attribute InformationarXiv 2020Amortized Inference for Causal Structure LearningarXiv 2022MIntRec2.0: A Large-scale Benchmark Dataset for Multimodal Intent Recognition and Out-of-scope Detection in ConversationsarXiv 2024The Surprisingly Straightforward Scene Text Removal Method With Gated Attention and Region of Interest Generation: A Comprehensive Prominent Model AnalysisarXiv 2022RouterDC: Query-Based Router by Dual Contrastive Learning for Assembling Large Language ModelsarXiv 2024MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language ModelsarXiv 2024IndoBERTweet: A Pretrained Language Model for Indonesian Twitter with Effective Domain-Specific Vocabulary InitializationEMNLP 2021 11Multi-modal Situated Reasoning in 3D ScenesarXiv 2024Neural data-to-text generation: A comparison between pipeline and end-to-end architecturesneural-data-to-text-generation-a-comparison-1Agent AI: Surveying the Horizons of Multimodal InteractionarXiv 2024Pre-training Contextualized World Models with In-the-wild Videos for Reinforcement Learningpre-training-contextualized-world-models-withFiNER: Financial Numeric Entity Recognition for XBRL TaggingACL 2022 5DiffuseHigh: Training-free Progressive High-Resolution Image Synthesis through Structure GuidancearXiv 2024Time is Encoded in the Weights of Finetuned Language ModelsarXiv 2023Speak, Memory: An Archaeology of Books Known to ChatGPT/GPT-4arXiv 2023OWQ: Outlier-Aware Weight Quantization for Efficient Fine-Tuning and Inference of Large Language ModelsarXiv 2023MarS3D: A Plug-and-Play Motion-Aware Model for Semantic Segmentation on Multi-Scan 3D Point Cloudsmars3d-a-plug-and-play-motion-aware-model-forColorMNet: A Memory-based Deep Spatial-Temporal Feature Propagation Network for Video ColorizationarXiv 2024Vision Foundation Models for Computed TomographyarXiv 2025Data-Efficient Multimodal Fusion on a Single GPUCVPR 2024 1Learning to Describe Differences Between Pairs of Similar Imageslearning-to-describe-differences-between-1ColorPeel: Color Prompt Learning with Diffusion Models via Color and Shape DisentanglementarXiv 2024A Unified Framework for Learned Sparse RetrievalarXiv 2023Enabling Efficient Equivariant Operations in the Fourier Basis via Gaunt Tensor ProductsarXiv 2024Diverse Data Augmentation with Diffusions for Effective Test-time Prompt TuningICCV 2023 1Label Anything: Multi-Class Few-Shot Semantic Segmentation with Visual PromptsarXiv 2024Latin BERT: A Contextual Language Model for Classical PhilologyarXiv 2020Leveraging Unimodal Self-Supervised Learning for Multimodal Audio-Visual Speech RecognitionACL 2022 5Leveraging Unimodal Self-Supervised Learning for Multimodal Audio-Visual Speech RecognitionACL 2022 5Usable XAI: 10 Strategies Towards Exploiting Explainability in the LLM EraarXiv 2024On the Effect of Dropping Layers of Pre-trained Transformer ModelsarXiv 2020Conformal Prediction with Large Language Models for Multi-Choice Question AnsweringarXiv 2023SynRS3D: A Synthetic Dataset for Global 3D Semantic Understanding from Monocular Remote Sensing ImageryarXiv 2024Towards Deeper Graph Neural NetworksarXiv 2020FlexCAD: Unified and Versatile Controllable CAD Generation with Fine-tuned Large Language ModelsarXiv 2024DVI: Depth Guided Video Inpainting for Autonomous DrivingECCV 2020 8EVOR: Evolving Retrieval for Code GenerationarXiv 2024UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and MemoryCVPR 2024 13D-LFM: Lifting Foundation ModelCVPR 2024 1Poison-splat: Computation Cost Attack on 3D Gaussian SplattingarXiv 2024VLTinT: Visual-Linguistic Transformer-in-Transformer for Coherent Video Paragraph CaptioningarXiv 2022Contrastive Chain-of-Thought PromptingarXiv 2023ExcelFormer: A neural network surpassing GBDTs on tabular dataarXiv 2023Analysing the Residual Stream of Language Models Under Knowledge ConflictsarXiv 2024MultiOOD: Scaling Out-of-Distribution Detection for Multiple ModalitiesarXiv 2024CLiMB: A Continual Learning Benchmark for Vision-and-Language TasksarXiv 2022Robust Test-Time Adaptation in Dynamic ScenariosCVPR 2023 1MobileQuant: Mobile-friendly Quantization for On-device Language ModelsarXiv 2024Group Robust Preference Optimization in Reward-free RLHFarXiv 2024VL-ICL Bench: The Devil in the Details of Multimodal In-Context LearningarXiv 2024The Power of Noise: Redefining Retrieval for RAG SystemsarXiv 2024Adposition and Case Supersenses v2.6: Guidelines for EnglisharXiv 2017Spectral-Refiner: Accurate Fine-Tuning of Spatiotemporal Fourier Neural Operator for Turbulent FlowsarXiv 2024ChatGPT's One-year Anniversary: Are Open-Source Large Language Models Catching up?arXiv 2023DocNLI: A Large-scale Dataset for Document-level Natural Language InferenceFindings (ACL) 2021 8StreamBench: Towards Benchmarking Continuous Improvement of Language AgentsarXiv 2024Towards Open Respiratory Acoustic Foundation Models: Pretraining and BenchmarkingarXiv 2024METAGENE-1: Metagenomic Foundation Model for Pandemic MonitoringarXiv 2025The state-of-the-art in Cardiac MRI Reconstruction: Results of the CMRxRecon Challenge in MICCAI 2023arXiv 2024Efficient Attentions for Long Document SummarizationNAACL 2021 4Attention Swin U-Net: Cross-Contextual Attention Mechanism for Skin Lesion SegmentationarXiv 2022Simple and Efficient Architectures for Semantic SegmentationarXiv 2022VMBench: A Benchmark for Perception-Aligned Video Motion GenerationICCV 2025Z1: Efficient Test-time Scaling with CodearXiv 2025Set-level Guidance Attack: Boosting Adversarial Transferability of Vision-Language Pre-training ModelsICCV 2023 1MLR-Copilot: Autonomous Machine Learning Research based on Large Language Models AgentsarXiv 2024Large Scale Transfer Learning for Tabular Data via Language ModelingarXiv 2024Once-for-All: Controllable Generative Image Compression with Dynamic Granularity AdaptationarXiv 2024Document Understanding Dataset and Evaluation (DUDE)ICCV 2023 1GROOT: Learning to Follow Instructions by Watching Gameplay VideosarXiv 2023Multimodal Graph Learning for Generative TasksarXiv 2023Large Language Models as Zero-shot Dialogue State Tracker through Function CallingarXiv 2024EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code RepositoriesarXiv 2024MedicalAgentsBench for Complex Medical Reasoning: Comparing Internalized Reasoning Models versus Externalized Agent-based FrameworksarXiv 2025CLAP: Learning Transferable Binary Code Representations with Natural Language SupervisionarXiv 2024Angler: Helping Machine Translation Practitioners Prioritize Model ImprovementsarXiv 2023Harder Tasks Need More Experts: Dynamic Routing in MoE ModelsarXiv 2024Let the Flows Tell: Solving Graph Combinatorial Optimization Problems with GFlowNetsarXiv 2023Mask4Former: Mask Transformer for 4D Panoptic SegmentationarXiv 2023I-MedSAM: Implicit Medical Image Segmentation with Segment AnythingarXiv 2023DiffDub: Person-generic Visual Dubbing Using Inpainting Renderer with Diffusion Auto-encoderarXiv 2023Seurat: From Moving Points to DepthCVPR 2025 1GTBench: Uncovering the Strategic Reasoning Limitations of LLMs via Game-Theoretic EvaluationsarXiv 2024Make a Cheap Scaling: A Self-Cascade Diffusion Model for Higher-Resolution AdaptationarXiv 2024Constrained Language Models Yield Few-Shot Semantic ParsersEMNLP 2021 11A Configurable Library for Generating and Manipulating Maze DatasetsarXiv 2023All you need are a few pixels: semantic segmentation with PixelPickarXiv 2021High Fidelity Image Counterfactuals with Probabilistic Causal ModelsarXiv 2023Spatially Conditioned Graphs for Detecting Human-Object InteractionsICCV 2021 10SkillSpan: Hard and Soft Skill Extraction from English Job PostingsNAACL 2022 7Just Go with the Flow: Self-Supervised Scene Flow Estimationjust-go-with-the-flow-self-supervised-scene-1On Clustered Statistical MIMO Millimeter Wave Channel SimulationarXiv 2016Test-Time Zero-Shot Temporal Action LocalizationCVPR 2024 1Generative Recommendation: Towards Next-generation Recommender ParadigmarXiv 2023DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario UnderstandingarXiv 2025BixBench: a Comprehensive Benchmark for LLM-based Agents in Computational BiologyarXiv 2025Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language ModelsarXiv 2024LLaVA-Gemma: Accelerating Multimodal Foundation Models with a Compact Language ModelarXiv 2024VideoRAG: Retrieval-Augmented Generation over Video CorpusarXiv 2025Instruction Induction: From Few Examples to Natural Language Task DescriptionsarXiv 2022Generative Table Pre-training Empowers Models for Tabular PredictionarXiv 2023MVOR: A Multi-view RGB-D Operating Room Dataset for 2D and 3D Human Pose EstimationarXiv 2018Monte Carlo Tree Search for Comprehensive Exploration in LLM-Based Automatic Heuristic DesignarXiv 2025Layer-adaptive sparsity for the Magnitude-based Pruninga-deeper-look-at-the-layerwise-sparsity-ofD-IF: Uncertainty-aware Human Digitization via Implicit Distribution FieldICCV 2023 1AerialFormer: Multi-resolution Transformer for Aerial Image SegmentationarXiv 2023

Back to Papers