0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

SCTN: Sparse Convolution-Transformer Network for Scene Flow EstimationarXiv 2021Toward a Standardized and More Accurate Indonesian Part-of-Speech TaggingarXiv 2018GANprintR: Improved Fakes and Evaluation of the State of the Art in Face Manipulation DetectionarXiv 2019Linguistic Collapse: Neural Collapse in (Large) Language ModelsarXiv 2024DialoKG: Knowledge-Structure Aware Task-Oriented Dialogue GenerationFindings (NAACL) 2022 7CLIBD: Bridging Vision and Genomics for Biodiversity Monitoring at ScalearXiv 2024ReactionT5: a large-scale pre-trained model towards application of limited reaction dataarXiv 2023RbFT: Robust Fine-tuning for Retrieval-Augmented Generation against Retrieval DefectsarXiv 2025Bag of Tricks for Inference-time Computation of LLM ReasoningarXiv 2025Explainable AI for computational pathology identifies model limitations and tissue biomarkersarXiv 2024BECLR: Batch Enhanced Contrastive Few-Shot Learningbeclr-batch-enhanced-contrastive-few-shot-1Predict to Detect: Prediction-guided 3D Object Detection using Sequential ImagesICCV 2023 1Cumulative Spatial Knowledge Distillation for Vision TransformersICCV 2023 1Robust Weight Signatures: Gaining Robustness as Easy as Patching Weights?arXiv 2023MM-Pyramid: Multimodal Pyramid Attentional Network for Audio-Visual Event Localization and Video ParsingarXiv 2021LLM Safety From Within: Detecting Harmful Content with Internal RepresentationsarXiv 2026A Feasibility Study of Answer-Agnostic Question Generation for EducationarXiv 2022Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video GenerationarXiv 2026On Over-Squashing in Message Passing Neural Networks: The Impact of Width, Depth, and TopologyarXiv 2023Class-relation Knowledge Distillation for Novel Class DiscoveryICCV 2023 1Meta-Personalizing Vision-Language Models to Find Named Instances in Videometa-personalizing-vision-language-models-toMPCViT: Searching for Accurate and Efficient MPC-Friendly Vision Transformer with Heterogeneous AttentionICCV 2023 1The Price of Prompting: Profiling Energy Use in Large Language Models InferencearXiv 2024The Effect of Intrinsic Dataset Properties on Generalization: Unraveling Learning Differences Between Natural and Medical ImagesarXiv 2024Rethinking Surgical Instrument Segmentation: A Background Image Can Be All You NeedarXiv 2022LLM Guided Evolution - The Automation of Models Advancing ModelsarXiv 2024Do Vision and Language Models Share Concepts? A Vector Space Alignment StudyarXiv 2023In-Context Learning with Many Demonstration ExamplesarXiv 2023TempME: Towards the Explainability of Temporal Graph Neural Networks via Motif Discoverytempme-towards-the-explainability-of-temporalETHER: Efficient Finetuning of Large-Scale Models with Hyperplane ReflectionsarXiv 2024ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning ModelsarXiv 2025Aligning LLMs to Ask Good Questions A Case Study in Clinical ReasoningarXiv 2025SynthesizRR: Generating Diverse Datasets with Retrieval AugmentationarXiv 2024Self-Organized Agents: A LLM Multi-Agent Framework toward Ultra Large-Scale Code Generation and OptimizationarXiv 2024SMMix: Self-Motivated Image Mixing for Vision TransformersICCV 2023 1Mitigating the Alignment Tax of RLHFarXiv 2023Autonomous and cooperative design of the monitor positions for a team of UAVs to maximize the quantity and quality of detected objectsarXiv 2020Can LLM Generate Culturally Relevant Commonsense QA Data? Case Study in Indonesian and SundanesearXiv 2024How do Language Models Bind Entities in Context?arXiv 2023Foot-In-The-Door: A Multi-turn Jailbreak for LLMsarXiv 2025Find n' Propagate: Open-Vocabulary 3D Object Detection in Urban EnvironmentsarXiv 2024Memory-Based Meta-Learning on Non-Stationary DistributionsarXiv 2023VDT-Auto: End-to-end Autonomous Driving with VLM-Guided Diffusion TransformersarXiv 2025Retraining-Free Merging of Sparse MoE via Hierarchical ClusteringarXiv 2024PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language ModelsarXiv 2025An Evaluation of DNN Architectures for Page Segmentation of Historical NewspapersarXiv 2020Stateful Defenses for Machine Learning Models Are Not Yet Secure Against Black-box AttacksarXiv 2023Grounding Open-Domain Instructions to Automate Web Support TasksNAACL 2021 4LLMAEL: Large Language Models are Good Context Augmenters for Entity LinkingarXiv 2024Thinking Clearly, Talking Fast: Concept-Guided Non-Autoregressive Generation for Open-Domain Dialogue SystemsEMNLP 2021 11Evaluating Language Model Agency through NegotiationsarXiv 2024Joint rotational invariance and adversarial training of a dual-stream Transformer yields state of the art Brain-Score for Area V4arXiv 2022Beyond saliency: understanding convolutional neural networks from saliency prediction on layer-wise relevance propagationarXiv 2017DyTed: Disentangled Representation Learning for Discrete-time Dynamic GrapharXiv 2022Towards Robust Model Watermark via Reducing Parametric VulnerabilityICCV 2023 1MAG-SQL: Multi-Agent Generative Approach with Soft Schema Linking and Iterative Sub-SQL Refinement for Text-to-SQLarXiv 2024Functional Overlap Reranking for Neural Code GenerationarXiv 2023Subformer: Exploring Weight Sharing for Parameter Efficiency in Generative TransformersFindings (EMNLP) 2021 11Generative Pretrained Autoregressive Transformer Graph Neural Network applied to the Analysis and Discovery of Novel ProteinsarXiv 2023Synthetically Enhanced: Unveiling Synthetic Data's Potential in Medical Imaging ResearcharXiv 2023Learning Character-level Compositionality with Visual Featureslearning-character-level-compositionality-1ZeroGen: Efficient Zero-shot Learning via Dataset GenerationarXiv 2022Object Detectors in the Open Environment: Challenges, Solutions, and OutlookarXiv 2024ReCLIP: Refine Contrastive Language Image Pre-Training with Source Free Domain AdaptationarXiv 2023Soft Prompt Tuning for Augmenting Dense Retrieval with Large Language ModelsarXiv 2023BiRT: Bio-inspired Replay in Vision Transformers for Continual LearningarXiv 2023RevCore: Review-augmented Conversational RecommendationFindings (ACL) 2021 8ParGo: Bridging Vision-Language with Partial and Global ViewsarXiv 2024I Spy a Metaphor: Large Language Models and Diffusion Models Co-Create Visual MetaphorsarXiv 2023Unlocking Reasoning Potential in Large Langauge Models by Scaling Code-form PlanningarXiv 2024Secure Distributed Training at Scalesecure-distributed-training-at-scale-1CARE: Causality Reasoning for Empathetic Responses by Conditional Graph GenerationarXiv 2022SpaCE-10: A Comprehensive Benchmark for Multimodal Large Language Models in Compositional Spatial IntelligencearXiv 2025Multiple instance learning on deep features for weakly supervised object detection with extreme domain shiftsarXiv 2020SteloCoder: a Decoder-Only LLM for Multi-Language to Python Code TranslationarXiv 2023Discovering Transferable Forensic Features for CNN-generated Images DetectionarXiv 2022Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' AlignmentarXiv 2023DocumentCLIP: Linking Figures and Main Body Text in Reflowed DocumentsarXiv 2023Vera: A General-Purpose Plausibility Estimation Model for Commonsense StatementsarXiv 2023Persona-Guided Planning for Controlling the Protagonist's Persona in Story GenerationarXiv 2022Multi-modal Crowd Counting via a Broker ModalityarXiv 2024PANDA: Prompt Transfer Meets Knowledge Distillation for Efficient Model AdaptationarXiv 2022A Three-Stage Learning Framework for Low-Resource Knowledge-Grounded Dialogue GenerationEMNLP 2021 11Configurable Safety Tuning of Language Models with Synthetic Preference DataarXiv 2024A Multi-Modal Context Reasoning Approach for Conditional Inference on Joint Textual and Visual CluesarXiv 2023Inferring Rewards from Language in ContextACL 2022 5Taxonomy Adaptive Cross-Domain Adaptation in Medical Imaging via Optimization Trajectory DistillationICCV 2023 1Graph Reinforcement Learning for Network Control via Bi-Level OptimizationarXiv 2023Prompt-Tuning Can Be Much Better Than Fine-Tuning on Cross-lingual Understanding With Multilingual Language ModelsarXiv 2022Pre-training for Ad-hoc Retrieval: Hyperlink is Also You NeedarXiv 2021A Closer Look at AUROC and AUPRC under Class ImbalancearXiv 2024Progressively Optimized Bi-Granular Document Representation for Scalable Embedding Based RetrievalarXiv 2022Panacea: A foundation model for clinical trial search, summarization, design, and recruitmentarXiv 2024Lyra: Orchestrating Dual Correction in Automated Theorem ProvingarXiv 2023The Unreliability of Explanations in Few-shot Prompting for Textual ReasoningarXiv 2022Hierarchical Spatio-Temporal Representation Learning for Gait RecognitionICCV 2023 1Summarizing Multiple Documents with Conversational Structure for Meta-Review GenerationarXiv 2023VerifyBench: Benchmarking Reference-based Reward Systems for Large Language ModelsarXiv 2025FiNER-ORD: Financial Named Entity Recognition Open Research DatasetarXiv 2023WildDESED: An LLM-Powered Dataset for Wild Domestic Environment Sound Event Detection SystemarXiv 2024Achieving >97% on GSM8K: Deeply Understanding the Problems Makes LLMs Better Solvers for Math Word ProblemsarXiv 2024RQUGE: Reference-Free Metric for Evaluating Question Generation by Answering the QuestionarXiv 2022On Diversified Preferences of Large Language Model AlignmentarXiv 2023CoderUJB: An Executable and Unified Java Benchmark for Practical Programming ScenariosarXiv 2024Multi-Modal Interaction Graph Convolutional Network for Temporal Language Localization in VideosarXiv 2021Planning from Observation and InteractionarXiv 2026Background-aware Moment Detection for Video Moment RetrievalarXiv 2023CSAW-M: An Ordinal Classification Dataset for Benchmarking Mammographic Masking of CancerarXiv 2021InfiMM-HD: A Leap Forward in High-Resolution Multimodal UnderstandingarXiv 2024Visually-Grounded Planning without Vision: Language Models Infer Detailed Plans from High-level InstructionsarXiv 2020Transformers Can Navigate Mazes With Multi-Step PredictionarXiv 2024MM-Eval: A Multilingual Meta-Evaluation Benchmark for LLM-as-a-Judge and Reward ModelsarXiv 2024AD-CLIP: Adapting Domains in Prompt Space Using CLIParXiv 2023Moderately Distributional Exploration for Domain GeneralizationarXiv 2023Understanding Deep Gradient Leakage via Inversion Influence Functionsunderstanding-deep-gradient-leakage-viaMitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized RehearsalarXiv 2024Learning to Segment Actions from Observation and Narrationlearning-to-segment-actions-from-observation-1Solving the Catastrophic Forgetting Problem in Generalized Category Discoverysolving-the-catastrophic-forgetting-problemHow Realistic Is Your Synthetic Data? Constraining Deep Generative Models for Tabular DataarXiv 2024MOCHA: A Dataset for Training and Evaluating Generative Reading Comprehension MetricsEMNLP 2020 11Unit Scaling: Out-of-the-Box Low-Precision TrainingarXiv 2023MTL-LoRA: Low-Rank Adaptation for Multi-Task LearningarXiv 2024GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical ReasoningarXiv 2025Personalized Autonomous Driving with Large Language Models: Field ExperimentsarXiv 2023Understanding Reference Policies in Direct Preference OptimizationarXiv 2024Controllable Mind Visual Diffusion ModelarXiv 2023Exploring the Best Practices of Query Expansion with Large Language ModelsarXiv 2024Two-Stage Constrained Actor-Critic for Short Video RecommendationarXiv 2023BLEU might be Guilty but References are not InnocentEMNLP 2020 11Creating a Dataset for High-Performance Computing Code Translation using LLMs: A Bridge Between OpenMP Fortran and C++arXiv 2023Not All Errors are Equal: Learning Text Generation Metrics using Stratified Error SynthesisarXiv 2022Backdoor Cleaning without External Guidance in MLLM Fine-tuningarXiv 2025ETHIC: Evaluating Large Language Models on Long-Context Tasks with High Information CoveragearXiv 2024Sources of Hallucination by Large Language Models on Inference TasksarXiv 2023SMILE: Multimodal Dataset for Understanding Laughter in Video with Language ModelsarXiv 2023CoTran: An LLM-based Code Translator using Reinforcement Learning with Feedback from Compiler and Symbolic ExecutionarXiv 2023IHEval: Evaluating Language Models on Following the Instruction HierarchyarXiv 2025One Step Diffusion-based Super-Resolution with Time-Aware DistillationarXiv 2024Localizing Paragraph Memorization in Language ModelsarXiv 2024Cached Multi-Lora Composition for Multi-Concept Image GenerationarXiv 2025Open-ended VQA benchmarking of Vision-Language models by exploiting Classification datasets and their semantic hierarchyarXiv 2024State of What Art? A Call for Multi-Prompt LLM EvaluationarXiv 2023Dual RL: Unification and New Methods for Reinforcement and Imitation LearningarXiv 2023Guided Interpretable Facial Expression Recognition via Spatial Action Unit CuesarXiv 2024IndicXNLI: Evaluating Multilingual Inference for Indian LanguagesarXiv 2022Fake Alignment: Are LLMs Really Aligned Well?arXiv 2023In-context Example Selection with InfluencesarXiv 2023RAFT: A Real-World Few-Shot Text Classification BenchmarkarXiv 2021AutoReP: Automatic ReLU Replacement for Fast Private Network InferenceICCV 2023 1ApiQ: Finetuning of 2-Bit Quantized Large Language ModelarXiv 2024Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RLarXiv 2025GL-MCM: Global and Local Maximum Concept Matching for Zero-Shot Out-of-Distribution DetectionarXiv 2023IMPUS: Image Morphing with Perceptually-Uniform Sampling Using Diffusion ModelsarXiv 2023Adaptive Document Retrieval for Deep Question Answeringadaptive-document-retrieval-for-deep-question-1sharpDARTS: Faster and More Accurate Differentiable Architecture SearcharXiv 2019Grounding Visual Illusions in Language: Do Vision-Language Models Perceive Illusions Like Humans?arXiv 2023All You Need is a Few Shifts: Designing Efficient Convolutional Neural Networks for Image Classificationall-you-need-is-a-few-shifts-designing-1On Large Language Model Continual UnlearningarXiv 2024InQSS: a speech intelligibility and quality assessment model using a multi-task learning networkarXiv 2021Should we Stop Training More Monolingual Models, and Simply Use Machine Translation Instead?NoDaLiDa 2021 5ViDiT-Q: Efficient and Accurate Quantization of Diffusion Transformers for Image and Video GenerationarXiv 2024Tuning Pre-trained Model via Moment ProbingICCV 2023 1EPIC: Effective Prompting for Imbalanced-Class Data Synthesis in Tabular Data Classification via Large Language ModelsarXiv 2024Provable Compositional Generalization for Object-Centric LearningarXiv 2023Once for Both: Single Stage of Importance and Sparsity Search for Vision Transformer CompressionCVPR 2024 1Disentangled Graph Variational Auto-Encoder for Multimodal Recommendation with InterpretabilityarXiv 2024Search for Efficient Large Language ModelsarXiv 2024OOSTraj: Out-of-Sight Trajectory Prediction With Vision-Positioning DenoisingCVPR 2024 1Compositional Feature Augmentation for Unbiased Scene Graph GenerationICCV 2023 1How Efficient is LLM-Generated Code? A Rigorous & High-Standard BenchmarkarXiv 2024HR-MultiWOZ: A Task Oriented Dialogue (TOD) Dataset for HR LLM AgentarXiv 2024Revisiting Discriminative vs. Generative Classifiers: Theory and ImplicationsarXiv 2023LMentry: A Language Model Benchmark of Elementary Language TasksarXiv 2022Subgraph Federated Learning for Local GeneralizationarXiv 2025Improving Pacing in Long-Form Story PlanningarXiv 2023Theoretical Foundations of Deep Selective State-Space ModelsarXiv 2024Bayesian Optimization of Antibodies Informed by a Generative Model of Evolving SequencesarXiv 2024VSTAR: A Video-grounded Dialogue Dataset for Situated Semantic Understanding with Scene and Topic TransitionsarXiv 2023Concise Reasoning, Big Gains: Pruning Long Reasoning Trace with Difficulty-Aware PromptingarXiv 2025Is Self-Repair a Silver Bullet for Code Generation?arXiv 2023Not All Prompts Are Made Equal: Prompt-based Pruning of Text-to-Image Diffusion ModelsarXiv 2024GePpeTto Carves Italian into a Language ModelarXiv 2020Navigation Turing Test (NTT): Learning to Evaluate Human-Like NavigationarXiv 2021OASum: Large-Scale Open Domain Aspect-based SummarizationarXiv 2022LLM Task Interference: An Initial Study on the Impact of Task-Switch in Conversational HistoryarXiv 2024Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation BenchmarkarXiv 2024Accelerating Inference in Large Language Models with a Unified Layer Skipping StrategyarXiv 2024EMNS /Imz/ Corpus: An emotive single-speaker dataset for narrative storytelling in games, television and graphic novelsarXiv 2023Chinese MentalBERT: Domain-Adaptive Pre-training on Social Media for Chinese Mental Health Text AnalysisarXiv 2024RocketEval: Efficient Automated LLM Evaluation via Grading ChecklistarXiv 2025OntoChatGPT Information System: Ontology-Driven Structured Prompts for ChatGPT Meta-LearningarXiv 2023Automated Search for Resource-Efficient Branched Multi-Task NetworksarXiv 2020Neural Relation Graph: A Unified Framework for Identifying Label Noise and Outlier Dataneural-relation-graph-a-unified-framework-forSTD-PLM: Understanding Both Spatial and Temporal Properties of Spatial-Temporal Data with PLMarXiv 2024Cephalo: Multi-Modal Vision-Language Models for Bio-Inspired Materials Analysis and DesignarXiv 2024DeTiME: Diffusion-Enhanced Topic Modeling using Encoder-decoder based LLMarXiv 2023The Euclidean Space is Evil: Hyperbolic Attribute Editing for Few-shot Image GenerationICCV 2023 1Language Versatilists vs. Specialists: An Empirical Revisiting on Multilingual Transfer AbilityarXiv 2023Text-Visual Prompting for Efficient 2D Temporal Video GroundingCVPR 2023 1NightVision: Generating Nighttime Satellite Imagery from Infra-Red ObservationsarXiv 2020

Back to Papers