0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

BiasAsker: Measuring the Bias in Conversational AI SystemarXiv 2023DocTer: Documentation Guided Fuzzing for Testing Deep Learning API FunctionsarXiv 2021Self-Supervised Learning for Contextualized Extractive Summarizationself-supervised-learning-for-contextualized-1Towards Tracing Factual Knowledge in Language Models Back to the Training DataarXiv 2022Weird Generalization and Inductive Backdoors: New Ways to Corrupt LLMsarXiv 2025O1 Replication Journey -- Part 3: Inference-time Scaling for Medical ReasoningarXiv 2025ACDiT: Interpolating Autoregressive Conditional Modeling and Diffusion TransformerarXiv 2024SummScreen: A Dataset for Abstractive Screenplay SummarizationACL 2022 5Improving Composed Image Retrieval via Contrastive Learning with Scaling Positives and NegativesarXiv 2024Sensor-Independent Illumination Estimation for DNN ModelsarXiv 2019Reconstructive Neuron Pruning for Backdoor DefensearXiv 2023ParaSCI: A Large Scientific Paraphrase Dataset for Longer Paraphrase GenerationEACL 2021 2Navigating the Safety Landscape: Measuring Risks in Finetuning Large Language ModelsarXiv 2024Instruction-Guided Visual MaskingarXiv 2024Semantic White Balance: Semantic Color Constancy Using Convolutional Neural NetworkarXiv 2018Revisiting the Gold Standard: Grounding Summarization Evaluation with Robust Human EvaluationarXiv 2022Prototype-supervised Adversarial Network for Targeted Attack of Deep HashingCVPR 2021 1With Little Power Comes Great ResponsibilityEMNLP 2020 11AI-Slop to AI-Polish? Aligning Language Models through Edit-Based Writing Rewards and Test-time ComputationarXiv 2025SONICS: Synthetic Or Not -- Identifying Counterfeit SongsarXiv 2024Robustness of AI-Image Detectors: Fundamental Limits and Practical AttacksarXiv 2023Who Wrote this Code? Watermarking for Code GenerationarXiv 2023Binary and Ternary Natural Language GenerationarXiv 2023Teaching Models to Express Their Uncertainty in WordsarXiv 2022PD-MORL: Preference-Driven Multi-Objective Reinforcement Learning AlgorithmarXiv 2022Let's Sample Step by Step: Adaptive-Consistency for Efficient Reasoning and Coding with LLMsarXiv 2023CARE: a Benchmark Suite for the Classification and Retrieval of EnzymesarXiv 2024Have LLMs Advanced Enough? A Challenging Problem Solving Benchmark For Large Language ModelsarXiv 2023Unsupervised Image Denoising in Real-World Scenarios via Self-Collaboration Parallel Generative Adversarial BranchesICCV 2023 1Not All Heads Matter: A Head-Level KV Cache Compression Method with Integrated Retrieval and ReasoningarXiv 2024Train Once, Get a Family: State-Adaptive Balances for Offline-to-Online Reinforcement Learningtrain-once-get-a-family-state-adaptiveInverse Constitutional AI: Compressing Preferences into PrinciplesarXiv 2024Fighting Gradients with Gradients: Dynamic Defenses against Adversarial AttacksNeurIPS 2021 12SAM Decoding: Speculative Decoding via Suffix AutomatonarXiv 2024MonoTAKD: Teaching Assistant Knowledge Distillation for Monocular 3D Object DetectionCVPR 2025 1Stochastic Gradient Descent for Gaussian Processes Done RightarXiv 2023Rethinking Cross-Modal Interaction in Multimodal Diffusion TransformersICCV 2025ReAct: Temporal Action Detection with Relational QueriesarXiv 2022MISC: A MIxed Strategy-Aware Model Integrating COMET for Emotional Support ConversationACL 2022 5CleanCLIP: Mitigating Data Poisoning Attacks in Multimodal Contrastive LearningICCV 2023 1LoRETTA: Low-Rank Economic Tensor-Train Adaptation for Ultra-Low-Parameter Fine-Tuning of Large Language ModelsarXiv 2024NaturalProver: Grounded Mathematical Proof Generation with Language ModelsarXiv 2022Multi-task Self-supervised Graph Neural Networks Enable Stronger Task GeneralizationarXiv 2022FNeVR: Neural Volume Rendering for Face AnimationarXiv 2022FinPT: Financial Risk Prediction with Profile Tuning on Pretrained Foundation ModelsarXiv 2023Audio-Visual Instance SegmentationCVPR 2025 1UNION: Unsupervised 3D Object Detection using Object Appearance-based Pseudo-ClassesarXiv 2024TransTIC: Transferring Transformer-based Image Compression from Human Perception to Machine PerceptionICCV 2023 1Neuroformer: Multimodal and Multitask Generative Pretraining for Brain DataarXiv 2023Stochastic Training is Not Necessary for Generalizationstochastic-training-is-not-necessary-for-1Fairness Definitions in Language Models ExplainedarXiv 2024VDD: Varied Drone Dataset for Semantic SegmentationarXiv 2023Approaching Outside: Scaling Unsupervised 3D Object Detection from 2D ScenearXiv 2024Structured Chemistry Reasoning with Large Language ModelsarXiv 2023A mathematical perspective on TransformersarXiv 2023SamplingAug: On the Importance of Patch Sampling Augmentation for Single Image Super-ResolutionarXiv 2021CLIPer: Hierarchically Improving Spatial Representation of CLIP for Open-Vocabulary Semantic SegmentationICCV 2025INSIDE: LLMs' Internal States Retain the Power of Hallucination DetectionarXiv 2024PoseExaminer: Automated Testing of Out-of-Distribution Robustness in Human Pose and Shape EstimationCVPR 2023 1Question Translation Training for Better Multilingual ReasoningarXiv 2024Compositional Generative Inverse DesignarXiv 2024GPT detectors are biased against non-native English writersarXiv 2023Fourier Transformer: Fast Long Range Modeling by Removing Sequence Redundancy with FFT OperatorarXiv 2023Entropic Neural Optimal Transport via Diffusion Processesentropic-neural-optimal-transport-viaQuantifying Valence and Arousal in Text with Multilingual Pre-trained TransformersarXiv 2023Textual Query-Driven Mask Transformer for Domain Generalized SegmentationarXiv 2024UniMTS: Unified Pre-training for Motion Time SeriesarXiv 2024Can Large Language Models Empower Molecular Property Prediction?arXiv 2023Can Large Language Models Write Parallel Code?arXiv 2024QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language ModelsarXiv 2023Retroformer: Retrospective Large Language Agents with Policy Gradient OptimizationarXiv 2023Mathematical Capabilities of ChatGPTmathematical-capabilities-of-chatgptAnomaly Detection under Distribution ShiftICCV 2023 1Stable Anisotropic RegularizationarXiv 2023Fast Passage Re-ranking with Contextualized Exact Term Matching and Efficient Passage ExpansionarXiv 2021StreamFlow: Streamlined Multi-Frame Optical Flow Estimation for Video SequencesarXiv 2023Text-Guided 3D Face Synthesis -- From Generation to EditingarXiv 2023Cooperation Does Matter: Exploring Multi-Order Bilateral Relations for Audio-Visual SegmentationCVPR 2024 1Language ID in the Wild: Unexpected Challenges on the Path to a Thousand-Language Web Text CorpusCOLING 2020 8Speech Recognition Challenge in the Wild: Arabic MGB-3arXiv 2017Unified Speech Recognition: A Single Model for Auditory, Visual, and Audiovisual InputsarXiv 2024SliceMatch: Geometry-guided Aggregation for Cross-View Pose EstimationCVPR 2023 1FairVis: Visual Analytics for Discovering Intersectional Bias in Machine LearningarXiv 2019Can Multimodal LLMs Perform Time Series Anomaly Detection?arXiv 2025NDC-Scene: Boost Monocular 3D Semantic Scene Completion in Normalized Device Coordinates SpaceICCV 2023 1TurkishBERTweet: Fast and Reliable Large Language Model for Social Media AnalysisarXiv 2023Controlling the Extraction of Memorized Data from Large Language Models via Prompt-TuningarXiv 2023Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision ContentCVPR 2025 1Polynomial Implicit Neural Representations For Large Diverse DatasetsCVPR 2023 1Pseudo Flow Consistency for Self-Supervised 6D Object Pose EstimationICCV 2023 1DISCO: Distilling Counterfactuals with Large Language ModelsarXiv 2022360VOT: A New Benchmark Dataset for Omnidirectional Visual Object TrackingICCV 2023 1SRL: Scaling Distributed Reinforcement Learning to Over Ten Thousand CoresarXiv 2023SARLANG-1M: A Benchmark for Vision-Language Modeling in SAR Image UnderstandingarXiv 2025OAM-TCD: A globally diverse dataset of high-resolution tree cover mapsarXiv 2024SLTrain: a sparse plus low-rank approach for parameter and memory efficient pretrainingarXiv 2024Provable Robust Watermarking for AI-Generated TextarXiv 2023Nebula: Self-Attention for Dynamic Malware AnalysisarXiv 2023RoLoRA: Fine-tuning Rotated Outlier-free LLMs for Effective Weight-Activation QuantizationarXiv 2024DINOv2 based Self Supervised Learning For Few Shot Medical Image SegmentationarXiv 2024Training on the Benchmark Is Not All You NeedarXiv 2024Multilingual Mathematical AutoformalizationarXiv 2023Named Entity Disambiguation using Deep Learning on GraphsarXiv 2018Action Spotting using Dense Detection Anchors Revisited: Submission to the SoccerNet Challenge 2022arXiv 2022GeoGalactica: A Scientific Large Language Model in GeosciencearXiv 2023FUSU: A Multi-temporal-source Land Use Change Segmentation Dataset for Fine-grained Urban Semantic UnderstandingarXiv 2024Reinforcement Learning Friendly Vision-Language Model for MinecraftarXiv 2023TFLEX: Temporal Feature-Logic Embedding Framework for Complex Reasoning over Temporal Knowledge Graphtflex-temporal-feature-logic-embeddingOPIEC: An Open Information Extraction CorpusAKBC 2019CanonicalFusion: Generating Drivable 3D Human Avatars from Multiple ImagesarXiv 2024B-cosification: Transforming Deep Neural Networks to be Inherently InterpretablearXiv 2024Self-Supervised Learning for Anomalous Sound DetectionarXiv 2023Vision Superalignment: Weak-to-Strong Generalization for Vision Foundation ModelsarXiv 2024Multi-Dialect Arabic BERT for Country-Level Dialect IdentificationCOLING (WANLP) 2020 12XTab: Cross-table Pretraining for Tabular TransformersarXiv 2023Reparameterization Gradients through Acceptance-Rejection Sampling AlgorithmsarXiv 2016Align, Reason and Learn: Enhancing Medical Vision-and-Language Pre-training with KnowledgearXiv 2022FeatEnHancer: Enhancing Hierarchical Features for Object Detection and Beyond Under Low-Light VisionICCV 2023 1A Decade of Knowledge Graphs in Natural Language Processing: A SurveyarXiv 2022Unsupervised speech enhancement with diffusion-based generative modelsarXiv 2023Towards Codable Watermarking for Injecting Multi-bits Information to LLMsarXiv 2023Bootstrapping Objectness from Videos by Relaxed Common Fate and Visual GroupingCVPR 2023 1Compact Trilinear Interaction for Visual Question Answeringcompact-trilinear-interaction-for-visual-1MABEL: Attenuating Gender Bias using Textual Entailment DataarXiv 2022SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense RewardsarXiv 2025CTP: Towards Vision-Language Continual Pretraining via Compatible Momentum Contrast and Topology PreservationarXiv 2023C2C: Component-to-Composition Learning for Zero-Shot Compositional Action RecognitionarXiv 2024Root Cause Analysis In Microservice Using Neural Granger Causal DiscoveryarXiv 2024Active Prompt Learning in Vision Language ModelsCVPR 2024 1Automatic Joint Structured Pruning and Quantization for Efficient Neural Network Training and CompressionCVPR 2025 1Dense Reward for Free in Reinforcement Learning from Human FeedbackarXiv 2024Few-Shot Class-Incremental Learning by Sampling Multi-Phase TasksarXiv 2022Condor: Enhance LLM Alignment with Knowledge-Driven Data Synthesis and RefinementarXiv 2025Detecting Adversarial Data by Probing Multiple Perturbations Using Expected Perturbation ScorearXiv 2023Approximating Two-Layer Feedforward Networks for Efficient TransformersarXiv 2023Chess as a Testbed for Language Model State TrackingarXiv 2021AdaMoLE: Fine-Tuning Large Language Models with Adaptive Mixture of Low-Rank Adaptation ExpertsarXiv 2024MoTIF: Learning Motion Trajectories with Local Implicit Neural Functions for Continuous Space-Time Video Super-ResolutionICCV 2023 1Generative Adversarial Symmetry DiscoveryarXiv 2023Regularizing Neural Networks via Adversarial Model PerturbationCVPR 2021 1SpEL: Structured Prediction for Entity LinkingarXiv 2023Motion Question Answering via Modular Motion ProgramsarXiv 2023OST: Refining Text Knowledge with Optimal Spatio-Temporal Descriptor for General Video RecognitionCVPR 2024 1An Amharic News Text classification DatasetarXiv 2021Deep Networks Always Grok and Here is WhyarXiv 2024Efficient Video Action Detection with Token Dropout and Context RefinementICCV 2023 1VoP: Text-Video Co-operative Prompt Tuning for Cross-Modal RetrievalCVPR 2023 1A Diagram Is Worth A Dozen ImagesarXiv 2016Operator Learning with Neural Fields: Tackling PDEs on General Geometriesoperator-learning-with-neural-fields-tacklingMapping Natural Language Commands to Web Elementsmapping-natural-language-commands-to-web-1A Reputation Mechanism Is All You Need: Collaborative Fairness and Adversarial Robustness in Federated LearningarXiv 2020Can We Scale Transformers to Predict Parameters of Diverse ImageNet Models?arXiv 2023Model Editing Harms General Abilities of Large Language Models: Regularization to the RescuearXiv 2024PixelThink: Towards Efficient Chain-of-Pixel ReasoningarXiv 2025SqueezeAttention: 2D Management of KV-Cache in LLM Inference via Layer-wise Optimal BudgetarXiv 2024Instruction Tuning With Loss Over InstructionsarXiv 2024Large Language Models Are Semi-Parametric Reinforcement Learning Agentslarge-language-models-are-semi-parametricMulti-Candidate Speculative DecodingarXiv 2024Long Code Arena: a Set of Benchmarks for Long-Context Code ModelsarXiv 2024ShEMO -- A Large-Scale Validated Database for Persian Speech Emotion DetectionarXiv 2019Delving into Motion-Aware Matching for Monocular 3D Object TrackingICCV 2023 1Leveraging Vision-Language Models for Improving Domain Generalization in Image ClassificationCVPR 2024 1Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!arXiv 2024How Well Does GPT-4V(ision) Adapt to Distribution Shifts? A Preliminary InvestigationarXiv 2023CoDi: Co-evolving Contrastive Diffusion Models for Mixed-type Tabular SynthesisarXiv 2023Liputan6: A Large-scale Indonesian Dataset for Text SummarizationAsian Chapter of the Association for Computational Linguistics 2020Language Model Fine-Tuning on Scaled Survey Data for Predicting Distributions of Public OpinionsarXiv 2025Preserving Privacy in Large Language Models: A Survey on Current Threats and SolutionsarXiv 2024Diffusion Model Based Posterior Sampling for Noisy Linear Inverse ProblemsarXiv 2022Multitask Brain Tumor Inpainting with Diffusion Models: A Methodological ReportarXiv 2022When to Make Exceptions: Exploring Language Models as Accounts of Human Moral JudgmentarXiv 2022Self-Expansion of Pre-trained Models with Mixture of Adapters for Continual LearningarXiv 2024Unveiling the Tapestry of Consistency in Large Vision-Language ModelsarXiv 2024Speech Recognition and Multi-Speaker Diarization of Long ConversationsarXiv 2020Knowledge Mining with Scene Text for Fine-Grained RecognitionCVPR 2022 1Global Convergence of Block Coordinate Descent in Deep LearningarXiv 2018Middleware for LLMs: Tools Are Instrumental for Language Agents in Complex EnvironmentsarXiv 2024POGEMA: A Benchmark Platform for Cooperative Multi-Agent PathfindingarXiv 2024TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video ModelsarXiv 2024LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language FeedbackarXiv 2024What Makes a "Good" Data Augmentation in Knowledge Distillation -- A Statistical PerspectivearXiv 2020Assessor360: Multi-sequence Network for Blind Omnidirectional Image Quality Assessmentassessor360-multi-sequence-network-for-blindDVQA: Understanding Data Visualizations via Question Answeringdvqa-understanding-data-visualizations-via-1AdaVAE: Exploring Adaptive GPT-2s in Variational Auto-Encoders for Language ModelingarXiv 2022Large-scale Training Data Search for Object Re-identificationCVPR 2023 1VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction FormatarXiv 2024LibriSQA: A Novel Dataset and Framework for Spoken Question Answering with Large Language ModelsarXiv 2023Differentiable DAG Samplingdifferentiable-dag-samplingJuICe: A Large Scale Distantly Supervised Dataset for Open Domain Context-based Code Generationjuice-a-large-scale-distantly-supervised-1Multimodal Large Language Models for Inverse Molecular Design with Retrosynthetic PlanningarXiv 2024Supervised Compression for Resource-Constrained Edge Computing SystemsarXiv 2021Robust Open-Vocabulary Translation from Visual Text RepresentationsEMNLP 2021 11Simplicity Prevails: Rethinking Negative Preference Optimization for LLM UnlearningarXiv 2024WEDGE: A multi-weather autonomous driving dataset built from generative vision-language modelsarXiv 2023LSOIE: A Large-Scale Dataset for Supervised Open Information ExtractionEACL 2021 2What to Pre-Train on? Efficient Intermediate Task SelectionEMNLP 2021 11ClashEval: Quantifying the tug-of-war between an LLM's internal prior and external evidencearXiv 2024Ada-NETS: Face Clustering via Adaptive Neighbour Discovery in the Structure Spaceada-nets-face-clustering-via-adaptiveEmoVOCA: Speech-Driven Emotional 3D Talking HeadsarXiv 2024Doc2Query--: When Less is MorearXiv 2023

Back to Papers