All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
netFound: Foundation Model for Network SecurityarXiv 2023Turning Dust into Gold: Distilling Complex Reasoning Capabilities from LLMs by Leveraging Negative DataarXiv 2023Text Modular Networks: Learning to Decompose Tasks in the Language of Existing ModelsNAACL 2021 4NeFII: Inverse Rendering for Reflectance Decomposition with Near-Field Indirect IlluminationCVPR 2023 1Knowledge-Augmented Language Model VerificationarXiv 2023Simple Image-level Classification Improves Open-vocabulary Object DetectionarXiv 2023BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language ModelsarXiv 2025READoc: A Unified Benchmark for Realistic Document Structured ExtractionarXiv 2024LIQUID: A Framework for List Question Answering Dataset GenerationarXiv 2023Investigating Prompting Techniques for Zero- and Few-Shot Visual Question AnsweringarXiv 2023Rainier: Reinforced Knowledge Introspector for Commonsense Question AnsweringarXiv 2022Towards Personalized Deep Research: Benchmarks and EvaluationsarXiv 2025U-CREAT: Unsupervised Case Retrieval using Events extrAcTionarXiv 2023Cramming 1568 Tokens into a Single Vector and Back Again: Exploring the Limits of Embedding Space CapacityarXiv 2025Accelerating Feedforward Computation via Parallel Nonlinear Equation SolvingarXiv 2020Unchosen Experts Can Contribute Too: Unleashing MoE Models' Power by Self-ContrastarXiv 2024Are We Done with MMLU?arXiv 2024CypherBench: Towards Precise Retrieval over Full-scale Modern Knowledge Graphs in the LLM EraarXiv 2024CodeMMLU: A Multi-Task Benchmark for Assessing Code Understanding & Reasoning Capabilities of CodeLLMsarXiv 2024Help, Anna! Visual Navigation with Natural Multimodal Assistance via Retrospective Curiosity-Encouraging Imitation Learninghelp-anna-visual-navigation-with-natural-1BIMBA: Selective-Scan Compression for Long-Range Video Question AnsweringCVPR 2025 1Accuracy Prediction with Non-neural Model for Neural Architecture SearcharXiv 2020Soft Prompt Generation for Domain GeneralizationarXiv 2024A Dataset for Hyper-Relational Extraction and a Cube-Filling ApproacharXiv 2022MotionCrafter: One-Shot Motion Customization of Diffusion ModelsarXiv 2023Transform Once: Efficient Operator Learning in Frequency DomainarXiv 2022Aligning Large Language Models with Human Preferences through Representation EngineeringarXiv 2023Reliable Representations Make A Stronger Defender: Unsupervised Structure Refinement for Robust GNNarXiv 2022MERIt: Meta-Path Guided Contrastive Learning for Logical ReasoningFindings (ACL) 2022 5Summarization as Indirect Supervision for Relation ExtractionarXiv 2022LOCOST: State-Space Models for Long Document Abstractive SummarizationarXiv 2024ASiT: Local-Global Audio Spectrogram vIsion Transformer for Event ClassificationarXiv 2022Nonverbal Interaction DetectionarXiv 2024Scalable Language Model with Generalized Continual LearningarXiv 2024Domain-adaptive Video Deblurring via Test-time BlurringarXiv 2024Facilitating Database Tuning with Hyper-Parameter Optimization: A
Comprehensive Experimental EvaluationarXiv 2021ProteinGPT: Multimodal LLM for Protein Property Prediction and Structure UnderstandingarXiv 2024ExtractGPT: Exploring the Potential of Large Language Models for Product Attribute Value ExtractionarXiv 2023Eliciting Latent Knowledge from Quirky Language ModelsarXiv 2023PsyCoT: Psychological Questionnaire as Powerful Chain-of-Thought for Personality DetectionarXiv 2023Aladdin: Zero-Shot Hallucination of Stylized 3D Assets from Abstract Scene DescriptionsarXiv 2023S3O: A Dual-Phase Approach for Reconstructing Dynamic Shape and Skeleton of Articulated Objects from Single Monocular VideoarXiv 2024What Makes CLIP More Robust to Long-Tailed Pre-Training Data? A Controlled Study for Transferable InsightsarXiv 2024Can Retriever-Augmented Language Models Reason? The Blame Game Between the Retriever and the Language ModelarXiv 2022EMQ: Evolving Training-free Proxies for Automated Mixed Precision QuantizationICCV 2023 1Training-free LLM-generated Text Detection by Mining Token Probability SequencesarXiv 2024MIZAN: A Large Persian-English Parallel CorpusarXiv 2018PRESTO: Progressive Pretraining Enhances Synthetic Chemistry OutcomesarXiv 2024CoLLM: A Large Language Model for Composed Image RetrievalCVPR 2025 1E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTSarXiv 2024MemoChat: Tuning LLMs to Use Memos for Consistent Long-Range Open-Domain ConversationarXiv 2023Semantically Diverse Language Generation for Uncertainty Estimation in Language ModelsarXiv 2024Bring Your Own KG: Self-Supervised Program Synthesis for Zero-Shot KGQAarXiv 2023Understanding Factual Errors in Summarization: Errors, Summarizers, Datasets, Error DetectorsarXiv 2022Computer Vision for Clinical Gait Analysis: A Gait Abnormality Video DatasetarXiv 2024Switch EMA: A Free Lunch for Better Flatness and SharpnessarXiv 2024Inherent Redundancy in Spiking Neural NetworksICCV 2023 1CURIE: Evaluating LLMs On Multitask Scientific Long Context Understanding and ReasoningarXiv 2025TimeDRL: Disentangled Representation Learning for Multivariate
Time-SeriesarXiv 2023SwissBERT: The Multilingual Language Model for SwitzerlandarXiv 2023A comparative evaluation of image-to-image translation methods for stain transfer in histopathologyarXiv 2023Learning Non-Local Spatial-Angular Correlation for Light Field Image Super-ResolutionICCV 2023 1Symphony: Symmetry-Equivariant Point-Centered Spherical Harmonics for 3D Molecule GenerationarXiv 2023PSELDNets: Pre-trained Neural Networks on Large-scale Synthetic Datasets for Sound Event Localization and DetectionarXiv 2024FOFO: A Benchmark to Evaluate LLMs' Format-Following CapabilityarXiv 2024Learning Deformable Object Manipulation from Expert DemonstrationsarXiv 2022ArabicMMLU: Assessing Massive Multitask Language Understanding in ArabicarXiv 2024MultiAgentBench: Evaluating the Collaboration and Competition of LLM agentsarXiv 2025Detecting Any Human-Object Interaction Relationship: Universal HOI Detector with Spatial Prompt Learning on Foundation Modelsdetecting-any-human-object-interactionEvery Shot Counts: Using Exemplars for Repetition Counting in VideosarXiv 2024What Does This Acronym Mean? Introducing a New Dataset for Acronym Identification and DisambiguationCOLING 2020 8ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced AdapterarXiv 2023Aligning Medical Images with General Knowledge from Large Language ModelsarXiv 2024CapeX: Category-Agnostic Pose Estimation from Textual Point ExplanationarXiv 2024Meta-optimized Contrastive Learning for Sequential RecommendationarXiv 2023CriticBench: Benchmarking LLMs for Critique-Correct ReasoningarXiv 2024Linguistic Calibration of Long-Form GenerationsarXiv 2024Intent3D: 3D Object Detection in RGB-D Scans Based on Human IntentionarXiv 2024VLPrompt: Vision-Language Prompting for Panoptic Scene Graph GenerationarXiv 2023Learning Graph Quantized TokenizersarXiv 2024HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language ModelsarXiv 2024The Generalization Gap in Offline Reinforcement LearningarXiv 2023DDMI: Domain-Agnostic Latent Diffusion Models for Synthesizing High-Quality Implicit Neural RepresentationsarXiv 2024MotionCraft: Physics-based Zero-Shot Video GenerationarXiv 2024Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model PretrainingarXiv 2024Unsupervised Evaluation of Interactive Dialog with DialoGPTSIGDIAL (ACL) 2020 7Multilingual Large Language Models: A Systematic SurveyarXiv 2024Large Language Models Reflect the Ideology of their CreatorsarXiv 2024Anonymizing Speech: Evaluating and Designing Speaker Anonymization TechniquesarXiv 2023Enhancing Unsupervised Video Representation Learning by Decoupling the Scene and the MotionarXiv 2020VNE: An Effective Method for Improving Deep Representation by Manipulating Eigenvalue DistributionCVPR 2023 1SEGIC: Unleashing the Emergent Correspondence for In-Context SegmentationarXiv 2023Improving Transformers with Probabilistic Attention Keystransformer-with-a-mixture-of-gaussian-keysALCUNA: Large Language Models Meet New KnowledgearXiv 2023II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language ModelsarXiv 2024SOUL: Unlocking the Power of Second-Order Optimization for LLM UnlearningarXiv 2024ModaVerse: Efficiently Transforming Modalities with LLMsCVPR 2024 1RareBench: Can LLMs Serve as Rare Diseases Specialists?arXiv 2024Natural Language Processing Methods for Symbolic Music Generation and Information Retrieval: a SurveyarXiv 2024Zero-Shot Text Classification via Self-Supervised TuningarXiv 2023Learning an Unreferenced Metric for Online Dialogue Evaluationlearning-an-unreferenced-metric-for-online-1Exploring the Efficacy of Automatically Generated Counterfactuals for Sentiment AnalysisACL 2021 53D-MuPPET: 3D Multi-Pigeon Pose Estimation and TrackingarXiv 2023CAPIVARA: Cost-Efficient Approach for Improving Multilingual CLIP Performance on Low-Resource LanguagesarXiv 2023Answering Complex Logical Queries on Knowledge Graphs via Query Computation Tree OptimizationarXiv 2022RECAP: Towards Precise Radiology Report Generation via Dynamic Disease Progression ReasoningarXiv 2023VELMA: Verbalization Embodiment of LLM Agents for Vision and Language Navigation in Street ViewarXiv 2023Protoformer: Embedding Prototypes for Transformersprotoformer-embedding-prototypes-forSparsing Law: Towards Large Language Models with Greater Activation SparsityarXiv 2024Concept Bottleneck Large Language ModelsarXiv 2024SMaLL-100: Introducing Shallow Multilingual Machine Translation Model for Low-Resource LanguagesarXiv 2022Using a Logarithmic Mapping to Enable Lower Discount Factors in Reinforcement Learningusing-a-logarithmic-mapping-to-enable-lowerThere Are a Thousand Hamlets in a Thousand People's Eyes: Enhancing Knowledge-grounded Dialogue with Personal MemoryarXiv 2022Generalized Large-Scale Data Condensation via Various Backbone and Statistical MatchingCVPR 2024 12D-3D Interlaced Transformer for Point Cloud Segmentation with Scene-Level Supervision2d-3d-interlaced-transformer-for-point-cloudOn Second Thought, Let's Not Think Step by Step! Bias and Toxicity in Zero-Shot ReasoningarXiv 2022MSDNet: Multi-Scale Decoder for Few-Shot Semantic Segmentation via Transformer-Guided PrototypingarXiv 2024Self-Guided Diffusion ModelsCVPR 2023 1DisWOT: Student Architecture Search for Distillation WithOut TrainingCVPR 2023 1AffineQuant: Affine Transformation Quantization for Large Language ModelsarXiv 2024Look before you Hop: Conversational Question Answering over Knowledge Graphs Using Judicious Context ExpansionarXiv 2019dMelodies: A Music Dataset for Disentanglement LearningarXiv 2020Generating Summaries with Topic Templates and Structured Convolutional Decodersgenerating-summaries-with-topic-templates-and-1Co-driver: VLM-based Autonomous Driving Assistant with Human-like
Behavior and Understanding for Complex Road ScenesarXiv 2024Explaining Image Classifiers by Counterfactual Generationexplaining-image-classifiers-by-1A Comprehensive Analysis of Static Word Embeddings for TurkisharXiv 2024Semantically-Shifted Incremental Adapter-Tuning is A Continual ViTransformerCVPR 2024 1"No, to the Right" -- Online Language Corrections for Robotic Manipulation via Shared AutonomyarXiv 2023Efficient Adaptive Human-Object Interaction Detection with Concept-guided MemoryICCV 2023 1EFLNet: Enhancing Feature Learning for Infrared Small Target DetectionarXiv 2023CTRAN: CNN-Transformer-based Network for Natural Language UnderstandingarXiv 2023ChartReader: A Unified Framework for Chart Derendering and Comprehension without Heuristic RulesICCV 2023 1Read Anywhere Pointed: Layout-aware GUI Screen Reading with Tree-of-Lens GroundingarXiv 2024Poincaré ResNetarXiv 2023Parameter-efficient Prompt Learning for 3D Point Cloud UnderstandingarXiv 2024Applying Guidance in a Limited Interval Improves Sample and Distribution Quality in Diffusion ModelsarXiv 2024NTIRE 2022 Challenge on Super-Resolution and Quality Enhancement of Compressed Video: Dataset, Methods and ResultsarXiv 2022Human-Inspired Facial Sketch Synthesis with Dynamic AdaptationICCV 2023 1BoMD: Bag of Multi-label Descriptors for Noisy Chest X-ray ClassificationICCV 2023 1Xplainer: From X-Ray Observations to Explainable Zero-Shot DiagnosisarXiv 2023Zero-shot Domain-sensitive Speech Recognition with Prompt-conditioning Fine-tuningarXiv 2023HyperShot: Few-Shot Learning by Kernel HyperNetworksarXiv 2022Learning Math Reasoning from Self-Sampled Correct and Partially-Correct SolutionsarXiv 2022Density-invariant Features for Distant Point Cloud RegistrationICCV 2023 1Decoding Compressed Trust: Scrutinizing the Trustworthiness of Efficient LLMs Under CompressionarXiv 2024DiscoDVT: Generating Long Text with Discourse-Aware Discrete Variational TransformerEMNLP 2021 11OriGen:Enhancing RTL Code Generation with Code-to-Code Augmentation and Self-ReflectionarXiv 2024Enhancing Network Management Using Code Generated by Large Language ModelsarXiv 2023Learning Rich Representation of Keyphrases from TextFindings (NAACL) 2022 7DVGaze: Dual-View Gaze EstimationICCV 2023 1Prompting with Pseudo-Code InstructionsarXiv 2023MMCode: Benchmarking Multimodal Large Language Models for Code Generation with Visually Rich Programming ProblemsarXiv 2024SCREWS: A Modular Framework for Reasoning with RevisionsarXiv 2023Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity DatasetarXiv 2024Web Agents with World Models: Learning and Leveraging Environment Dynamics in Web NavigationarXiv 2024Allophant: Cross-lingual Phoneme Recognition with Articulatory AttributesarXiv 2023A theory of continuous generative flow networksarXiv 2023Path Neural Networks: Expressive and Accurate Graph Neural NetworksarXiv 2023The Role of ImageNet Classes in Fréchet Inception DistancearXiv 2022STREAM: Spatio-TempoRal Evaluation and Analysis Metric for Video Generative ModelsarXiv 2024MotionHint: Self-Supervised Monocular Visual Odometry with Motion ConstraintsarXiv 2021RNG: Relightable Neural GaussiansCVPR 2025 1SPINE: Online Semantic Planning for Missions with Incomplete Natural Language Specifications in Unstructured EnvironmentsarXiv 2024Layerwise Recurrent Router for Mixture-of-ExpertsarXiv 2024A Toy Model of Universality: Reverse Engineering How Networks Learn Group OperationsarXiv 2023ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal ModelsarXiv 2024Learning to Transfer Prompts for Text GenerationNAACL 2022 7VLSM-Adapter: Finetuning Vision-Language Segmentation Efficiently with Lightweight BlocksarXiv 2024DeCoRe: Decoding by Contrasting Retrieval Heads to Mitigate HallucinationsarXiv 2024eP-ALM: Efficient Perceptual Augmentation of Language ModelsICCV 2023 1ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference TimearXiv 2024Enhancing Generalization of Universal Adversarial Perturbation through Gradient AggregationICCV 2023 1Wind speed super-resolution and validation: from ERA5 to CERRA via diffusion modelsarXiv 2024TPO: Aligning Large Language Models with Multi-branch & Multi-step Preference TreesarXiv 2024How Good is Your Tokenizer? On the Monolingual Performance of Multilingual Language ModelsACL 2021 5HWD: A Novel Evaluation Score for Styled Handwritten Text GenerationarXiv 2023Cross-Lingual Consistency of Factual Knowledge in Multilingual Language ModelsarXiv 2023Latent Traversals in Generative Models as Potential FlowsarXiv 2023PostMark: A Robust Blackbox Watermark for Large Language ModelsarXiv 2024NusaWrites: Constructing High-Quality Corpora for Underrepresented and Extremely Low-Resource LanguagesarXiv 2023Generating Physically-Consistent Satellite Imagery for Climate VisualizationsarXiv 2021Multi-word Tokenization for Sequence CompressionarXiv 2024Doubly Right Object Recognition: A Why Prompt for Visual RationalesCVPR 2023 1A Deductive Verification Infrastructure for Probabilistic ProgramsarXiv 2023SketchDreamer: Interactive Text-Augmented Creative Sketch IdeationarXiv 2023RODEO: Replay for Online Object DetectionarXiv 2020Neighborhood-aware Scalable Temporal Network Representation LearningarXiv 2022Bridging Academia and Industry: A Comprehensive Benchmark for Attributed Graph ClusteringarXiv 2026Can We Talk Models Into Seeing the World Differently?arXiv 2024Community Forensics: Using Thousands of Generators to Train Fake Image DetectorsCVPR 2025 1Chat with the Environment: Interactive Multimodal Perception Using Large Language ModelsarXiv 2023On Robust Prefix-Tuning for Text Classificationon-robust-prefix-tuning-for-textEnhanced Aspect-Based Sentiment Analysis Models with Progressive Self-supervised Attention LearningarXiv 2021Predicting Information Pathways Across Online CommunitiesarXiv 2023DataFinder: Scientific Dataset Recommendation from Natural Language DescriptionsarXiv 2023Knapsack Pruning with Inner DistillationarXiv 2020RNNs are not Transformers (Yet): The Key Bottleneck on In-context RetrievalarXiv 2024VRoPE: Rotary Position Embedding for Video Large Language ModelsarXiv 2025Grounded Situation Recognition with TransformersarXiv 2021Adapting a ConvNeXt model to audio classification on AudioSetarXiv 2023