0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

Between Lines of Code: Unraveling the Distinct Patterns of Machine and Human ProgrammersarXiv 2024RTP-LX: Can LLMs Evaluate Toxicity in Multilingual Scenarios?arXiv 2024Pre-train a Discriminative Text Encoder for Dense Retrieval via Contrastive Span PredictionarXiv 2022Learning Navigational Visual Representations with Semantic Map SupervisionICCV 2023 1Tomayto, Tomahto. Beyond Token-level Answer Equivalence for Question Answering EvaluationarXiv 2022Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal LearningarXiv 2024DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language ModelsarXiv 2024SketchXAI: A First Look at Explainability for Human SketchesCVPR 2023 1Re-Reading Improves Reasoning in Large Language ModelsarXiv 2023Residual Stream Analysis with Multi-Layer SAEsarXiv 2024MSECNet: Accurate and Robust Normal Estimation for 3D Point Clouds by Multi-Scale Edge ConditioningarXiv 2023PyEuroVoc: A Tool for Multilingual Legal Document Classification with EuroVoc DescriptorsRANLP 2021 9FreCaS: Efficient Higher-Resolution Image Generation via Frequency-aware Cascaded SamplingarXiv 2024Masked Spatio-Temporal Structure Prediction for Self-supervised Learning on Point Cloud VideosICCV 2023 1SkCoder: A Sketch-based Approach for Automatic Code GenerationarXiv 2023DataEnvGym: Data Generation Agents in Teacher Environments with Student FeedbackarXiv 2024If at First You Don't Succeed, Try, Try Again: Faithful Diffusion-based Text-to-Image Generation by SelectionarXiv 2023Masked Thought: Simply Masking Partial Reasoning Steps Can Improve Mathematical Reasoning Learning of Language ModelsarXiv 2024SemEval-2024 Task 1: Semantic Textual Relatedness for African and Asian LanguagesarXiv 2024Incorporating Context into Subword VocabulariesarXiv 2022Synergistic Multi-Agent Framework with Trajectory Learning for Knowledge-Intensive TasksarXiv 2024The first neural machine translation system for the Erzya languageFieldMatters (COLING) 2022 10VideoMamba: Spatio-Temporal Selective State Space ModelarXiv 2024Enhancing Zero-Shot Chain-of-Thought Reasoning in Large Language Models through LogicarXiv 2023A Comprehensive Survey of Evaluation Techniques for Recommendation SystemsarXiv 2023Eta Inversion: Designing an Optimal Eta Function for Diffusion-based Real Image EditingarXiv 2024Code Prompting Elicits Conditional Reasoning Abilities in Text+Code LLMsarXiv 2024On the Learnability of Watermarks for Language ModelsarXiv 2023Pre-training Vision Transformers with Very Limited Synthesized ImagesICCV 2023 1Geometric Adversarial Attacks and Defenses on 3D Point CloudsarXiv 2020MedMNIST-C: Comprehensive benchmark and improved classifier robustness by simulating realistic image corruptionsarXiv 2024Revisiting the Weaknesses of Reinforcement Learning for Neural Machine Translationrevisiting-the-weaknesses-of-reinforcementAuto-FuzzyJoin: Auto-Program Fuzzy Similarity Joins Without Labeled ExamplesarXiv 2021SoK: Membership Inference Attacks on LLMs are Rushing Nowhere (and How to Fix It)arXiv 2024LongHealth: A Question Answering Benchmark with Long Clinical DocumentsarXiv 2024Traceability Transformed: Generating more Accurate Links with Pre-Trained BERT ModelsarXiv 2021UniFusion: Unified Multi-view Fusion Transformer for Spatial-Temporal Representation in Bird's-Eye-ViewICCV 2023 1Charting New Territories: Exploring the Geographic and Geospatial Capabilities of Multimodal LLMsarXiv 2023SuperMat: Construction of a linked annotated dataset from superconductors-related publicationsarXiv 2021Unsupervised Out-of-Distribution Detection with Diffusion InpaintingarXiv 2023FedBR: Improving Federated Learning on Heterogeneous Data via Local Learning Bias ReductionarXiv 2022Factorising Meaning and Form for Intent-Preserving ParaphrasingACL 2021 5Simulstream: Open-Source Toolkit for Evaluation and Demonstration of Streaming Speech-to-Text Translation SystemsarXiv 2025Chemically Transferable Generative Backmapping of Coarse-Grained ProteinsarXiv 2023Bias Runs Deep: Implicit Reasoning Biases in Persona-Assigned LLMsarXiv 2023VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric InformationarXiv 2024Peer Review as A Multi-Turn and Long-Context Dialogue with Role-Based InteractionsarXiv 2024RTL-Repo: A Benchmark for Evaluating LLMs on Large-Scale RTL Design ProjectsarXiv 2024Revisiting the Role of Language Priors in Vision-Language ModelsarXiv 2023CoSDH: Communication-Efficient Collaborative Perception via Supply-Demand Awareness and Intermediate-Late HybridizationCVPR 2025 1Text InfillingarXiv 2019A Long Way to Go: Investigating Length Correlations in RLHFarXiv 2023CodeIt: Self-Improving Language Models with Prioritized Hindsight ReplayarXiv 2024Mixture Outlier Exposure: Towards Out-of-Distribution Detection in Fine-grained EnvironmentsarXiv 2021Boosting Multi-modal Model Performance with Adaptive Gradient ModulationICCV 2023 1Do LVLMs Understand Charts? Analyzing and Correcting Factual Errors in Chart CaptioningarXiv 2023OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language ModelsarXiv 2024Mapping Memes to Words for Multimodal Hateful Meme ClassificationarXiv 2023Training Language Models with Language Feedback at ScalearXiv 2023OSS-Net: Memory Efficient High Resolution Semantic Segmentation of 3D Medical DataarXiv 2021Online Class Incremental Learning on Stochastic Blurry Task Boundary via Mask and Visual Prompt TuningICCV 2023 1Integrating Pattern- and Fact-based Fake News Detection via Model Preference LearningarXiv 2021Magnet: We Never Know How Text-to-Image Diffusion Models Work, Until We Learn How Vision-Language Models FunctionarXiv 2024Large Arabic Twitter Dataset on COVID-19arXiv 2020SmartAgent: Chain-of-User-Thought for Embodied Personalized Agent in Cyber WorldarXiv 2024Audio-Visual Deception Detection: DOLOS Dataset and Parameter-Efficient Crossmodal LearningICCV 2023 1Plug-and-Play Policy Planner for Large Language Model Powered Dialogue AgentsarXiv 2023A Solution-based LLM API-using Methodology for Academic Information SeekingarXiv 2024LLM-as-a-Coauthor: Can Mixed Human-Written and Machine-Generated Text Be Detected?arXiv 2024End-to-End Rate-Distortion Optimized 3D Gaussian RepresentationarXiv 2024Visual Position Prompt for MLLM based Visual GroundingarXiv 2025Suri: Multi-constraint Instruction Following for Long-form Text GenerationarXiv 2024Experimental Standards for Deep Learning in Natural Language Processing ResearcharXiv 2022DistilDIRE: A Small, Fast, Cheap and Lightweight Diffusion Synthesized Deepfake DetectionarXiv 2024Reinforcement Learning-based Counter-Misinformation Response Generation: A Case Study of COVID-19 Vaccine MisinformationarXiv 2023BlockPruner: Fine-grained Pruning for Large Language ModelsarXiv 2024Self-Guided Contrastive Learning for BERT Sentence RepresentationsACL 2021 5What Evidence Do Language Models Find Convincing?arXiv 2024PICLe: Eliciting Diverse Behaviors from Large Language Models with Persona In-Context LearningarXiv 2024JobBERT: Understanding Job Titles through SkillsarXiv 2021VCD: A Video Conferencing Dataset for Video CompressionarXiv 2023Mix-LN: Unleashing the Power of Deeper Layers by Combining Pre-LN and Post-LNarXiv 2024RES-Q: Evaluating Code-Editing Large Language Model Systems at the Repository ScalearXiv 2024Towards Understanding Grokking: An Effective Theory of Representation LearningarXiv 2022Making Science Simple: Corpora for the Lay Summarisation of Scientific LiteraturearXiv 2022Deeply Supervised Flow-Based Generative ModelsICCV 2025Multi-fingered Robotic Hand Grasping in Cluttered Environments through Hand-object Contact Semantic MappingarXiv 2024LAMP: Extracting Text from Gradients with Language Model PriorsarXiv 2022Concept Generalization in Visual Representation LearningICCV 2021 10EpochX: Building the Infrastructure for an Emergent Agent CivilizationarXiv 2026Deep Optimal Transport: A Practical Algorithm for Photo-realistic Image Restorationdeep-optimal-transport-a-practical-algorithmText Processing Like Humans Do: Visually Attacking and Shielding NLP Systemstext-processing-like-humans-do-visually-1Beyond Prompt Content: Enhancing LLM Performance via Content-Format Integrated Prompt OptimizationarXiv 2025Recomposing the Reinforcement Learning Building Blocks with HypernetworksarXiv 2021Transcendental Idealism of Planner: Evaluating Perception from Planning Perspective for Autonomous DrivingarXiv 2023Semantic Diversity-aware Prototype-based Learning for Unbiased Scene Graph GenerationarXiv 2024Latent-OFER: Detect, Mask, and Reconstruct with Latent Vectors for Occluded Facial Expression RecognitionICCV 2023 1March in Chat: Interactive Prompting for Remote Embodied Referring ExpressionICCV 2023 1GPSFormer: A Global Perception and Local Structure Fitting-based Transformer for Point Cloud UnderstandingarXiv 2024AnnoCTR: A Dataset for Detecting and Linking Entities, Tactics, and Techniques in Cyber Threat ReportsarXiv 2024Echo Chamber: RL Post-training Amplifies Behaviors Learned in PretrainingarXiv 2025Leftover Lunch: Advantage-based Offline Reinforcement Learning for Language ModelsarXiv 2023GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language ModelsarXiv 2023Multi-branch Collaborative Learning Network for 3D Visual GroundingarXiv 2024Taming Diffusion Models for Music-driven Conducting Motion GenerationarXiv 2023ELMER: A Non-Autoregressive Pre-trained Language Model for Efficient and Effective Text GenerationarXiv 2022Renewable energy management in smart home environment via forecast embedded scheduling based on Recurrent Trend Predictive Neural Networkrenewable-energy-management-in-smart-homeOpening the Blackbox: Accelerating Neural Differential Equations by Regularizing Internal Solver HeuristicsarXiv 2021Are Large Pre-Trained Language Models Leaking Your Personal Information?arXiv 2022Scaling laws for language encoding models in fMRIscaling-laws-for-language-encoding-models-inRFBoost: Understanding and Boosting Deep WiFi Sensing via Physical Data AugmentationarXiv 2024S-Agents: Self-organizing Agents in Open-ended EnvironmentsarXiv 2024TimelineQA: A Benchmark for Question Answering over TimelinesarXiv 2023HypeBoy: Generative Self-Supervised Representation Learning on HypergraphsarXiv 2024Traffic Flow Optimisation for Lifelong Multi-Agent Path FindingarXiv 2023Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search AgentsarXiv 2026ComPEFT: Compression for Communicating Parameter Efficient Updates via Sparsification and QuantizationarXiv 2023Classification-Regression for Chart ComprehensionarXiv 2021Rethinking Tabular Data Understanding with Large Language ModelsarXiv 2023Learn over Past, Evolve for Future: Forecasting Temporal Trends for Fake News DetectionarXiv 2023ProxyDet: Synthesizing Proxy Novel Classes via Classwise Mixup for Open-Vocabulary Object DetectionarXiv 2023IAM: A Comprehensive and Large-Scale Dataset for Integrated Argument Mining TasksACL 2022 5SMAFormer: Synergistic Multi-Attention Transformer for Medical Image SegmentationarXiv 2024RAP: Robustness-Aware Perturbations for Defending against Backdoor Attacks on NLP ModelsEMNLP 2021 11Dynatask: A Framework for Creating Dynamic AI Benchmark TasksACL 2022 5U-REPA: Aligning Diffusion U-Nets to ViTsarXiv 2025PINNACLE: PINN Adaptive ColLocation and Experimental points selectionarXiv 2024AccFlow: Backward Accumulation for Long-Range Optical FlowICCV 2023 1CKBP v2: Better Annotation and Reasoning for Commonsense Knowledge Base PopulationarXiv 2023Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay BuffersarXiv 2024SemCoder: Training Code Language Models with Comprehensive Semantics ReasoningarXiv 2024Diffusion in Diffusion: Cyclic One-Way Diffusion for Text-Vision-Conditioned GenerationarXiv 2023Hybrid Preferences: Learning to Route Instances for Human vs. AI FeedbackarXiv 2024L3Cube-HingCorpus and HingBERT: A Code Mixed Hindi-English Dataset and BERT Language ModelsWILDRE (LREC) 2022 6SupCL-Seq: Supervised Contrastive Learning for Downstream Optimized Sequence RepresentationsFindings (EMNLP) 2021 11Let Me Speak Freely? A Study on the Impact of Format Restrictions on Performance of Large Language ModelsarXiv 2024Active Testing: Sample-Efficient Model EvaluationarXiv 2021Peacock: A Family of Arabic Multimodal Large Language Models and BenchmarksarXiv 2024SubgoalXL: Subgoal-based Expert Learning for Theorem ProvingarXiv 2024MP-GUI: Modality Perception with MLLMs for GUI UnderstandingCVPR 2025 12-D SSM: A General Spatial Layer for Visual TransformersarXiv 2023Zero-shot Object Counting with Good ExemplarsarXiv 2024AntGPT: Can Large Language Models Help Long-term Action Anticipation from Videos?arXiv 2023Pre-trained Text-to-Image Diffusion Models Are Versatile Representation Learners for ControlarXiv 2024Bootstrapped Model Predictive ControlarXiv 2025MUSER: A Multi-View Similar Case Retrieval DatasetarXiv 2023CARTO: Category and Joint Agnostic Reconstruction of ARTiculated ObjectsCVPR 2023 1Frequency and Multi-Scale Selective Kernel Attention for Speaker VerificationarXiv 2022OpenBias: Open-set Bias Detection in Text-to-Image Generative ModelsCVPR 2024 1Does Spatial Cognition Emerge in Frontier Models?arXiv 2024Bootstrapping Vision-Language Learning with Decoupled Language Pre-trainingbootstrapping-vision-language-learning-withTowards Practical Deployment-Stage Backdoor Attack on Deep Neural NetworksCVPR 2022 1PMAA: A Progressive Multi-scale Attention Autoencoder Model for High-performance Cloud Removal from Multi-temporal Satellite ImageryarXiv 2023Optimizing Length Compression in Large Reasoning ModelsarXiv 2025DomainRAG: A Chinese Benchmark for Evaluating Domain-specific Retrieval-Augmented GenerationarXiv 2024Learning to Model Editing Processeslearning-to-model-editing-processesEvaluating language models as risk scoresarXiv 2024Temporal Interest Network for User Response PredictionarXiv 2023Compressing LLMs: The Truth is Rarely Pure and Never SimplearXiv 2023Steering LLM Thinking with Budget GuidancearXiv 2025Approximate Quantum Compiling for Quantum Simulation: A Tensor Network based approacharXiv 2023GPT as Psychologist? Preliminary Evaluations for GPT-4V on Visual Affective ComputingarXiv 2024Detecting and Preventing Hallucinations in Large Vision Language ModelsarXiv 2023Benchmarking Algorithms for Federated Domain GeneralizationarXiv 2023End-to-End Open-Domain Question Answering with BERTseriniend-to-end-open-domain-question-answering-1Class Prior-Free Positive-Unlabeled Learning with Taylor Variational Loss for Hyperspectral Remote Sensing ImageryICCV 2023 1A Closer Look at the Intervention Procedure of Concept Bottleneck ModelsarXiv 2023Diffusion Generative Flow Samplers: Improving learning signals through partial trajectory optimizationarXiv 2023Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLMarXiv 2024SuRe: Summarizing Retrievals using Answer Candidates for Open-domain QA of LLMsarXiv 2024Noise Map Guidance: Inversion with Spatial Context for Real Image EditingarXiv 2024How to Boost Face Recognition with StyleGAN?ICCV 2023 1ClickAgent: Enhancing UI Location Capabilities of Autonomous AgentsarXiv 2024EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language ModelsarXiv 2024Can GNN be Good Adapter for LLMs?arXiv 2024Emotion and Intent Joint Understanding in Multimodal Conversation: A Benchmarking DatasetarXiv 2024Evaluating the Factual Consistency of Large Language Models Through News SummarizationarXiv 2022KLEJ: Comprehensive Benchmark for Polish Language Understandingklej-comprehensive-benchmark-for-polish-1Striking Gold in Advertising: Standardization and Exploration of Ad Text GenerationarXiv 2023Scanning Only Once: An End-to-end Framework for Fast Temporal Grounding in Long VideosICCV 2023 1NUNO: A General Framework for Learning Parametric PDEs with Non-Uniform DataarXiv 2023Joint-Relation Transformer for Multi-Person Motion PredictionICCV 2023 1Facilitating Multi-turn Function Calling for LLMs via Compositional Instruction TuningarXiv 2024Egocentric Audio-Visual Object LocalizationCVPR 2023 1On the Generalization of Multi-modal Contrastive LearningarXiv 2023MobA: Multifaceted Memory-Enhanced Adaptive Planning for Efficient Mobile Task AutomationarXiv 2024SeaEval for Multilingual Foundation Models: From Cross-Lingual Alignment to Cultural ReasoningarXiv 2023A Survey of Corpora for Germanic Low-Resource Languages and DialectsarXiv 2023LaKo: Knowledge-driven Visual Question Answering via Late Knowledge-to-Text InjectionarXiv 2022Consistency Models as a Rich and Efficient Policy Class for Reinforcement LearningarXiv 2023BiTA: Bi-Directional Tuning for Lossless Acceleration in Large Language ModelsarXiv 2024Direct Telemetry AccessarXiv 2022Classification of Brain Tumours in MR Images using Deep Spatiospatial ModelsarXiv 2021Reversing the Forget-Retain Objectives: An Efficient LLM Unlearning Framework from Logit DifferencearXiv 2024How Severe is Benchmark-Sensitivity in Video Self-Supervised Learning?arXiv 2022Extracting Low-/High- Frequency Knowledge from Graph Neural Networks and Injecting it into MLPs: An Effective GNN-to-MLP Distillation FrameworkarXiv 2023Unlocking Continual Learning Abilities in Language ModelsarXiv 2024Degradation Oriented and Regularized Network for Blind Depth Super-ResolutionarXiv 2024ConVis: Contrastive Decoding with Hallucination Visualization for Mitigating Hallucinations in Multimodal Large Language ModelsarXiv 2024Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less ReasonablearXiv 2025

Back to Papers