0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

Personalized Subgraph Federated LearningarXiv 2022Learning a More Continuous Zero Level Set in Unsigned Distance Fields through Level Set ProjectionICCV 2023 1CPCM: Contextual Point Cloud Modeling for Weakly-supervised Point Cloud Semantic SegmentationICCV 2023 1Enhancing CLIP with CLIP: Exploring Pseudolabeling for Limited-Label Prompt Tuningenhancing-clip-with-clip-exploringLifting Architectural Constraints of Injective FlowsarXiv 2023RedCaps: web-curated image-text data created by the people, for the peoplearXiv 2021EvolveDirector: Approaching Advanced Text-to-Image Generation with Large Vision-Language ModelsarXiv 2024The Surprising Effectiveness of Representation Learning for Visual ImitationarXiv 2021TARGET: Federated Class-Continual Learning via Exemplar-Free DistillationICCV 2023 1CLEVR-Dialog: A Diagnostic Dataset for Multi-Round Reasoning in Visual Dialogclevr-dialog-a-diagnostic-dataset-for-multi-1Evaluating the Search Phase of Neural Architecture SearchICLR 2020 1FedSpeed: Larger Local Interval, Less Communication Round, and Higher Generalization AccuracyarXiv 2023AIN: The Arabic INclusive Large Multimodal ModelarXiv 2025Spiking Diffusion ModelsarXiv 2024Medical Dead-ends and Learning to Identify High-risk States and TreatmentsNeurIPS 2021 12COMETA: A Corpus for Medical Entity Linking in the Social MediaEMNLP 2020 11GOO: A Dataset for Gaze Object Prediction in Retail EnvironmentsarXiv 2021Attention Satisfies: A Constraint-Satisfaction Lens on Factual Errors of Language ModelsarXiv 2023BOTH2Hands: Inferring 3D Hands from Both Text Prompts and Body DynamicsCVPR 2024 1DC-Solver: Improving Predictor-Corrector Diffusion Sampler via Dynamic CompensationarXiv 2024NAF-DPM: A Nonlinear Activation-Free Diffusion Probabilistic Model for Document EnhancementarXiv 2024Clinical XLNet: Modeling Sequential Clinical Notes and Predicting Prolonged Mechanical VentilationEMNLP (ClinicalNLP) 2020 11LOREN: Logic-Regularized Reasoning for Interpretable Fact VerificationarXiv 2020PeptideBERT: A Language Model based on Transformers for Peptide Property PredictionarXiv 2023TabPedia: Towards Comprehensive Visual Table Understanding with Concept SynergyarXiv 2024OpenPSG: Open-set Panoptic Scene Graph Generation via Large Multimodal ModelsarXiv 2024MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific UnderstandingarXiv 2024Stochastic Segmentation with Conditional Categorical Diffusion ModelsICCV 2023 1MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at ScalearXiv 2024LAKE-RED: Camouflaged Images Generation by Latent Background Knowledge Retrieval-Augmented DiffusionCVPR 2024 1Edit Away and My Face Will not Stay: Personal Biometric Defense against Malicious Generative EditingCVPR 2025 1CrossRE: A Cross-Domain Dataset for Relation ExtractionarXiv 2022Self-Calibrated Cross Attention Network for Few-Shot SegmentationICCV 2023 1Execution-Based Evaluation for Open-Domain Code GenerationarXiv 2022GRACE: Discriminator-Guided Chain-of-Thought ReasoningarXiv 2023LaPraDoR: Unsupervised Pretrained Dense Retriever for Zero-Shot Text RetrievalFindings (ACL) 2022 5CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language ModelsarXiv 2023DeepSolution: Boosting Complex Engineering Solution Design via Tree-based Exploration and Bi-point ThinkingarXiv 2025VCSUM: A Versatile Chinese Meeting Summarization DatasetarXiv 2023Cascade Prompt Learning for Vision-Language Model AdaptationarXiv 2024CPT: Colorful Prompt Tuning for Pre-trained Vision-Language Modelscpt-colorful-prompt-tuning-for-pre-trained-1Bridging Cross-task Protocol Inconsistency for Distillation in Dense Object DetectionICCV 2023 1MTMamba++: Enhancing Multi-Task Dense Scene Understanding via Mamba-Based DecodersarXiv 2024Automated question generation and question answering from Turkish textsarXiv 2021TransFusion -- A Transparency-Based Diffusion Model for Anomaly DetectionarXiv 2023To Adapt or Not to Adapt? Real-Time Adaptation for Semantic SegmentationICCV 2023 1Is Underwater Image Enhancement All Object Detectors Need?arXiv 2023Multi-task Learning with 3D-Aware RegularizationarXiv 2023TESTA: Temporal-Spatial Token Aggregation for Long-form Video-Language UnderstandingarXiv 2023RARR: Researching and Revising What Language Models Say, Using Language ModelsarXiv 2022Action Matching: Learning Stochastic Dynamics from SamplesarXiv 2022An open-source voice type classifier for child-centered daylong recordingsarXiv 2020Solving Math Word Problems via Cooperative Reasoning induced Language ModelsarXiv 2022Enhancing NeRF akin to Enhancing LLMs: Generalizable NeRF Transformer with Mixture-of-View-ExpertsICCV 2023 1FAdam: Adam is a natural gradient optimizer using diagonal empirical Fisher informationarXiv 2024AesPA-Net: Aesthetic Pattern-Aware Style Transfer NetworksICCV 2023 1Source-free Domain Adaptation via Avatar Prototype Generation and AdaptationarXiv 2021JiuZhang3.0: Efficiently Improving Mathematical Reasoning by Training Small Data Synthesis ModelsarXiv 2024Multimodal Lecture Presentations Dataset: Understanding Multimodality in Educational SlidesarXiv 2022Rethinking Reflection in Pre-TrainingarXiv 2025Distilling Robust and Non-Robust Features in Adversarial Examples by Information Bottleneckdistilling-robust-and-non-robust-features-inToDo: Token Downsampling for Efficient Generation of High-Resolution ImagesarXiv 2024SUPER: Evaluating Agents on Setting Up and Executing Tasks from Research RepositoriesarXiv 2024Elucidating the Exposure Bias in Diffusion ModelsarXiv 2023TidalDecode: Fast and Accurate LLM Decoding with Position Persistent Sparse AttentionarXiv 2024Understanding Hallucinations in Diffusion Models through Mode InterpolationarXiv 2024FollowIR: Evaluating and Teaching Information Retrieval Models to Follow InstructionsarXiv 2024Visual Generation Without GuidancearXiv 2025AdaFisher: Adaptive Second Order Optimization via Fisher InformationarXiv 2024Omni6D: Large-Vocabulary 3D Object Dataset for Category-Level 6D Object Pose EstimationarXiv 2024Knowledge Injected Prompt Based Fine-tuning for Multi-label Few-shot ICD CodingarXiv 2022LabelBench: A Comprehensive Framework for Benchmarking Adaptive Label-Efficient LearningarXiv 2023Leveraging Passage Embeddings for Efficient Listwise Reranking with Large Language ModelsarXiv 2024PosterLlama: Bridging Design Ability of Langauge Model to Contents-Aware Layout GenerationarXiv 2024FinMTEB: Finance Massive Text Embedding BenchmarkarXiv 2025Clinical Prompt Learning with Frozen Language ModelsarXiv 2022Bold but Cautious: Unlocking the Potential of Personalized Federated Learning through Cautiously Aggressive CollaborationICCV 2023 1Contextualized Sparse Representations for Real-Time Open-Domain Question Answeringcontextualized-sparse-representations-forDual Modality Prompt Tuning for Vision-Language Pre-Trained ModelarXiv 2022SemEval-2023 Task 12: Sentiment Analysis for African Languages (AfriSenti-SemEval)arXiv 2023Leveraging LLMs for Synthesizing Training Data Across Many Languages in Multilingual Dense RetrievalarXiv 2023CityBench: Evaluating the Capabilities of Large Language Models for Urban TasksarXiv 2024ESSAformer: Efficient Transformer for Hyperspectral Image Super-resolutionICCV 2023 1Efficient Reinforcement Finetuning via Adaptive Curriculum LearningarXiv 2025GeoMIM: Towards Better 3D Knowledge Transfer via Masked Image Modeling for Multi-view 3D UnderstandingICCV 2023 1SelfCheck: Using LLMs to Zero-Shot Check Their Own Step-by-Step ReasoningarXiv 2023MOOSE-Chem: Large Language Models for Rediscovering Unseen Chemistry Scientific HypothesesarXiv 2024Enhancing Large Language Model with Self-Controlled Memory FrameworkarXiv 2023KnowHalu: Hallucination Detection via Multi-Form Knowledge Based Factual CheckingarXiv 2024Towards Better Alignment: Training Diffusion Models with Reinforcement Learning Against Sparse RewardsCVPR 2025 1Self-Taught Optimizer (STOP): Recursively Self-Improving Code GenerationarXiv 2023Quantized Side Tuning: Fast and Memory-Efficient Tuning of Quantized Large Language ModelsarXiv 2024EHRMamba: Towards Generalizable and Scalable Foundation Models for Electronic Health RecordsarXiv 2024Betrayed by Captions: Joint Caption Grounding and Generation for Open Vocabulary Instance SegmentationICCV 2023 1Leveraging Dual Process Theory in Language Agent Framework for Real-time Simultaneous Human-AI CollaborationarXiv 2025Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction AttacksarXiv 2023Test-Time Training on Nearest Neighbors for Large Language ModelsarXiv 2023Revisiting Domain-Adaptive 3D Object Detection by Reliable, Diverse and Class-balanced Pseudo-LabelingICCV 2023 1Improving Embedded Knowledge Graph Multi-hop Question Answering by introducing Relational Chain ReasoningarXiv 2021MMA-DFER: MultiModal Adaptation of unimodal models for Dynamic Facial Expression Recognition in-the-wildarXiv 20244D Contrastive Superflows are Dense 3D Representation LearnersarXiv 2024SubjQA: A Dataset for Subjectivity and Review ComprehensionEMNLP 2020 11Evaluating GPT-4 and ChatGPT on Japanese Medical Licensing ExaminationsarXiv 2023Large Language Models to Identify Social Determinants of Health in Electronic Health RecordsarXiv 2023As Good as New. How to Successfully Recycle English GPT-2 to Make Models for Other LanguagesFindings (ACL) 2021 8AVA-AVD: Audio-Visual Speaker Diarization in the WildarXiv 2021Learning Concise and Descriptive Attributes for Visual RecognitionICCV 2023 1MambaMixer: Efficient Selective State Space Models with Dual Token and Channel SelectionarXiv 2024Natural Language Embedded Programs for Hybrid Language Symbolic ReasoningarXiv 2023Multimodal Explanations: Justifying Decisions and Pointing to the Evidencemultimodal-explanations-justifying-decisions-1CORN: Contact-based Object Representation for Nonprehensile Manipulation of General Unseen ObjectsarXiv 2024VisionUnite: A Vision-Language Foundation Model for Ophthalmology Enhanced with Clinical Knowledgevisionunite-a-vision-language-foundationCiteME: Can Language Models Accurately Cite Scientific Claims?arXiv 2024Stroke-based Neural Painting and Stylization with Dynamically Predicted Painting RegionarXiv 2023CMM-Math: A Chinese Multimodal Math Dataset To Evaluate and Enhance the Mathematics Reasoning of Large Multimodal ModelsarXiv 2024Copyright Traps for Large Language ModelsarXiv 2024Interpretable Contrastive Monte Carlo Tree Search ReasoningarXiv 2024GitBug-Java: A Reproducible Benchmark of Recent Java BugsarXiv 2024Metadata Conditioning Accelerates Language Model Pre-trainingarXiv 2025Effectively Unbiased FID and Inception Score and where to find themeffectively-unbiased-fid-and-inception-score-1Dynamic Planning with a LLMarXiv 2023The Unreasonable Effectiveness of Easy Training Data for Hard TasksarXiv 2024Talk With Human-like Agents: Empathetic Dialogue Through Perceptible Acoustic Reception and ReactionarXiv 2024Ingredients: Blending Custom Photos with Video Diffusion TransformersarXiv 2025HarmonyDream: Task Harmonization Inside World ModelsarXiv 2023AutoMoE: Heterogeneous Mixture-of-Experts with Adaptive Computation for Efficient Neural Machine TranslationarXiv 2022GraphRouter: A Graph-based Router for LLM SelectionsarXiv 2024CodeChain: Towards Modular Code Generation Through Chain of Self-revisions with Representative Sub-modulesarXiv 2023Class-Incremental Learning with CLIP: Adaptive Representation Adjustment and Parameter FusionarXiv 2024LMEye: An Interactive Perception Network for Large Language ModelsarXiv 2023Weather2K: A Multivariate Spatio-Temporal Benchmark Dataset for Meteorological Forecasting Based on Real-Time Observation Data from Ground Weather StationsarXiv 2023Boosting Neural Representations for Videos with a Conditional DecoderCVPR 2024 1FeTrIL: Feature Translation for Exemplar-Free Class-Incremental LearningarXiv 2022Equivariant Contrastive LearningarXiv 2021Pre-train and Plug-in: Flexible Conditional Text Generation with Variational Auto-Encoderspre-train-and-plug-in-flexible-conditional-1Deconstructing Long Chain-of-Thought: A Structured Reasoning Optimization Framework for Long CoT DistillationarXiv 2025Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model EvaluatorsarXiv 2024Towards Better Question Generation in QA-based Event ExtractionarXiv 2024The Dawn After the Dark: An Empirical Study on Factuality Hallucination in Large Language ModelsarXiv 2024Learning to Break the Loop: Analyzing and Mitigating Repetitions for Neural Text GenerationarXiv 2022Hydra: Sequentially-Dependent Draft Heads for Medusa DecodingarXiv 2024Zero-shot Natural Language Video LocalizationICCV 2021 10ListT5: Listwise Reranking with Fusion-in-Decoder Improves Zero-shot RetrievalarXiv 2024Deep Height Decoupling for Precise Vision-based 3D Occupancy PredictionarXiv 2024KG-Rank: Enhancing Large Language Models for Medical QA with Knowledge Graphs and Ranking TechniquesarXiv 2024Snuffy: Efficient Whole Slide Image ClassifierarXiv 2024Sentiment Polarity Detection for Software DevelopmentarXiv 2017Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance EstimationarXiv 2025FEQA: A Question Answering Evaluation Framework for Faithfulness Assessment in Abstractive Summarizationfeqa-a-question-answering-evaluation-1RuCoLA: Russian Corpus of Linguistic AcceptabilityarXiv 2022Can It Edit? Evaluating the Ability of Large Language Models to Follow Code Editing InstructionsarXiv 2023Attacking Vision-Language Computer Agents via Pop-upsarXiv 2024GalleryGPT: Analyzing Paintings with Large Multimodal ModelsarXiv 2024Learning Similarity Conditions Without Explicit SupervisionarXiv 2019Let's Make Block Coordinate Descent Converge Faster: Faster Greedy Rules, Message-Passing, Active-Set Complexity, and Superlinear ConvergencearXiv 2017An Automatic Approach for Generating Rich, Linked Geo-Metadata from Historical Map ImagesarXiv 2021Hierarchical State Space Models for Continuous Sequence-to-Sequence ModelingarXiv 2024Progressive Text-to-3D Generation for Automatic 3D PrototypingarXiv 2023Prompt Stealing Attacks Against Text-to-Image Generation ModelsarXiv 2023IntactKV: Improving Large Language Model Quantization by Keeping Pivot Tokens IntactarXiv 2024Score Regularized Policy Optimization through Diffusion BehaviorarXiv 2023DendroMap: Visual Exploration of Large-Scale Image Datasets for Machine Learning with TreemapsarXiv 2022FreeCompose: Generic Zero-Shot Image Composition with Diffusion PriorarXiv 2024SlotRefine: A Fast Non-Autoregressive Model for Joint Intent Detection and Slot FillingEMNLP 2020 11SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State SpacesarXiv 2024BEYOND DIALOGUE: A Profile-Dialogue Alignment Framework Towards General Role-Playing Language ModelarXiv 2024Visually-Prompted Language Model for Fine-Grained Scene Graph Generation in an Open WorldICCV 2023 1Neural Link Prediction with Walk Poolingneural-link-prediction-with-walk-pooling-2Source Prompt Disentangled Inversion for Boosting Image Editability with Diffusion ModelsarXiv 2024Retinex-RAWMamba: Bridging Demosaicing and Denoising for Low-Light RAW Image EnhancementarXiv 2024Explore the Potential of CLIP for Training-Free Open Vocabulary Semantic SegmentationarXiv 2024m1: Unleash the Potential of Test-Time Scaling for Medical Reasoning with Large Language ModelsarXiv 2025CFBenchmark: Chinese Financial Assistant Benchmark for Large Language ModelarXiv 2023To Forget or Not? Towards Practical Knowledge Unlearning for Large Language ModelsarXiv 2024FIREBALL: A Dataset of Dungeons and Dragons Actual-Play with Structured Game State InformationarXiv 2023UCTopic: Unsupervised Contrastive Learning for Phrase Representations and Topic MiningACL 2022 5Understanding the Effects of RLHF on LLM Generalisation and DiversityarXiv 2023Towards Bidirectional Human-AI Alignment: A Systematic Review for Clarifications, Framework, and Future DirectionsarXiv 2024Adversarial Training against Location-Optimized Adversarial PatchesarXiv 2020HaMuCo: Hand Pose Estimation via Multiview Collaborative Self-Supervised LearningICCV 2023 1Volcano: Mitigating Multimodal Hallucination through Self-Feedback Guided RevisionarXiv 2023ClawArena: Benchmarking AI Agents in Evolving Information EnvironmentsarXiv 2026RAVE: Residual Vector Embedding for CLIP-Guided Backlit Image EnhancementarXiv 2024Switch Diffusion Transformer: Synergizing Denoising Tasks with Sparse Mixture-of-ExpertsarXiv 2024RAPiD-Seg: Range-Aware Pointwise Distance Distribution Networks for 3D LiDAR SegmentationarXiv 2024DeID-GPT: Zero-shot Medical Text De-Identification by GPT-4arXiv 2023Faceptor: A Generalist Model for Face PerceptionarXiv 2024Toxic Language Detection in Social Media for Brazilian Portuguese: New Dataset and Multilingual AnalysisAsian Chapter of the Association for Computational Linguistics 2020Contrastive Learning of Medical Visual Representations from Paired Images and TextarXiv 2020Neural Spectral Methods: Self-supervised learning in the spectral domainarXiv 2023CATRE: Iterative Point Clouds Alignment for Category-level Object Pose RefinementarXiv 2022End-to-end Music Remastering System Using Self-supervised and Adversarial TrainingarXiv 2022Unsupervised Representation Learning by Sorting Sequencesunsupervised-representation-learning-by-3One Chatbot Per Person: Creating Personalized Chatbots based on Implicit User ProfilesarXiv 2021PVT++: A Simple End-to-End Latency-Aware Visual Tracking FrameworkICCV 2023 1Understanding 3D Object Interaction from a Single ImageICCV 2023 1Chord-Conditioned Melody Harmonization with Controllable HarmonicityarXiv 2022Parameter Competition Balancing for Model MergingarXiv 2024Guiding High-Performance SAT Solvers with Unsat-Core PredictionsarXiv 2019Graph Rationalization with Environment-based AugmentationsarXiv 2022

Back to Papers