0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

milliFlow: Scene Flow Estimation on mmWave Radar Point Cloud for Human Motion SensingarXiv 2023Read, Watch and Scream! Sound Generation from Text and VideoarXiv 2024MIME: MIMicking Emotions for Empathetic Response GenerationEMNLP 2020 11m&m's: A Benchmark to Evaluate Tool-Use for multi-step multi-modal TasksarXiv 2024Acknowledging the Unknown for Multi-label Learning with Single Positive LabelsarXiv 2022Detecting Images Generated by DiffusersarXiv 2023RoSA: Accurate Parameter-Efficient Fine-Tuning via Robust AdaptationarXiv 2024Tapilot-Crossing: Benchmarking and Evolving LLMs Towards Interactive Data Analysis AgentsarXiv 2024Sparkles: Unlocking Chats Across Multiple Images for Multimodal Instruction-Following ModelsarXiv 2023Detecting Machine-Generated Texts by Multi-Population Aware Optimization for Maximum Mean DiscrepancyarXiv 2024Effective Diversity in Population Based Reinforcement LearningNeurIPS 2020 12BadChain: Backdoor Chain-of-Thought Prompting for Large Language ModelsarXiv 2024Probabilistic Triangulation for Uncalibrated Multi-View 3D Human Pose EstimationICCV 2023 1RewardAnything: Generalizable Principle-Following Reward ModelsarXiv 2025ReALFRED: An Embodied Instruction Following Benchmark in Photo-Realistic EnvironmentsarXiv 2024Merging Experts into One: Improving Computational Efficiency of Mixture of ExpertsarXiv 2023Escalation Risks from Language Models in Military and Diplomatic Decision-MakingarXiv 2024Take-A-Photo: 3D-to-2D Generative Pre-training of Point Cloud ModelsICCV 2023 1Generalized Domain Conditioned Adaptation NetworkarXiv 2021Generative Modeling with Phase Stochastic BridgesarXiv 2023Beyond Autoregression: Fast LLMs via Self-Distillation Through TimearXiv 2024Masked Autoencoders are Efficient Class Incremental LearnersICCV 2023 1DEEM: Diffusion Models Serve as the Eyes of Large Language Models for Image PerceptionarXiv 2024Can Programming Languages Boost Each Other via Instruction Tuning?arXiv 2023MobileAgent: enhancing mobile control via human-machine interaction and SOP integrationarXiv 2024DPM-OT: A New Diffusion Probabilistic Model Based on Optimal TransportICCV 2023 1MambaEVT: Event Stream based Visual Object Tracking using State Space ModelarXiv 2024Energy-Based Models for Continual Learningenergy-based-models-for-continual-learningEfficient Causal Graph Discovery Using Large Language ModelsarXiv 2024OccMamba: Semantic Occupancy Prediction with State Space ModelsCVPR 2025 1HarmoniCa: Harmonizing Training and Inference for Better Feature Caching in Diffusion Transformer AccelerationarXiv 2024Towards Memory- and Time-Efficient Backpropagation for Training Spiking Neural NetworksICCV 2023 1Happy: A Debiased Learning Framework for Continual Generalized Category DiscoveryarXiv 2024Vector Quantization for Recommender Systems: A Review and OutlookarXiv 2024ECLAIR: A High-Fidelity Aerial LiDAR Dataset for Semantic SegmentationarXiv 2024A Reproducible Extraction of Training Images from Diffusion ModelsarXiv 2023Deep Encoder, Shallow Decoder: Reevaluating Non-autoregressive Machine Translationdeep-encoder-shallow-decoder-reevaluating-nonRLCoder: Reinforcement Learning for Repository-Level Code CompletionarXiv 2024SceneGraphLoc: Cross-Modal Coarse Visual Localization on 3D Scene GraphsarXiv 2024Shadows Don't Lie and Lines Can't Bend! Generative Models don't know Projective Geometry...for nowCVPR 2024 1MLLMGuard: A Multi-dimensional Safety Evaluation Suite for Multimodal Large Language ModelsarXiv 2024Active Stereo Without Pattern ProjectorICCV 2023 1PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio GenerationarXiv 2024How Language Model Hallucinations Can SnowballarXiv 2023SLMRec: Distilling Large Language Models into Small for Sequential RecommendationarXiv 2024TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image UnderstandingarXiv 2024Topological Singularity Detection at Multiple ScalesarXiv 2022FocusLLM: Precise Understanding of Long Context by Dynamic CondensingarXiv 2024Sub-Character Tokenization for Chinese Pretrained Language ModelsarXiv 2021Transformers are Short Text Classifiers: A Study of Inductive Short Text Classifiers on Benchmarks and Real-world DatasetsarXiv 2022Effective Neural Topic Modeling with Embedding Clustering RegularizationarXiv 2023Progressive Compositionality In Text-to-Image Generative ModelsarXiv 2024DETR for Crowd Pedestrian DetectionarXiv 2020Optimal Transport-based Identity Matching for Identity-invariant Facial Expression RecognitionarXiv 2022Large Graph Convolutional Network Training with GPU-Oriented Data Communication ArchitecturearXiv 2021Landscape of Thoughts: Visualizing the Reasoning Process of Large Language ModelsarXiv 2025Sim-to-Real Transfer for Vision-and-Language NavigationarXiv 2020Generating Adjacency-Constrained Subgoals in Hierarchical Reinforcement LearningNeurIPS 2020 12ProtoOcc: Accurate, Efficient 3D Occupancy Prediction Using Dual Branch Encoder-Prototype Query DecoderarXiv 2024Topological structure of complex predictionsarXiv 2022Tuning Language Models as Training Data Generators for Augmentation-Enhanced Few-Shot LearningarXiv 2022Binary Embedding-based Retrieval at TencentarXiv 2023TwinMarket: A Scalable Behavioral and Social Simulation for Financial MarketsarXiv 2025Make Geometry Matter for Spatial ReasoningarXiv 2026Beyond One-to-One: Rethinking the Referring Image SegmentationICCV 2023 1Instance Neural Radiance FieldICCV 2023 1Finetuning Text-to-Image Diffusion Models for FairnessarXiv 2023Vibravox: A Dataset of French Speech Captured with Body-conduction Audio SensorsarXiv 2024Few-Bit Backward: Quantized Gradients of Activation Functions for Memory Footprint ReductionarXiv 2022Hierarchical Context Merging: Better Long Context Understanding for Pre-trained LLMsarXiv 2024Augmented Box Replay: Overcoming Foreground Shift for Incremental Object DetectionICCV 2023 1A Study of Generative Large Language Model for Medical Research and HealthcarearXiv 2023Recite, Reconstruct, Recollect: Memorization in LMs as a Multifaceted PhenomenonarXiv 2024Proof Artifact Co-training for Theorem Proving with Language Modelsproof-artifact-co-training-for-theorem-1Cooperative Multi-UAV Coverage Mission Planning Platform for Remote Sensing ApplicationsarXiv 2022Large-scale Pre-trained Models are Surprisingly Strong in Incremental Novel Class DiscoveryarXiv 2023Leveraging Representations from Intermediate Encoder-blocks for Synthetic Image DetectionarXiv 2024DetectRL: Benchmarking LLM-Generated Text Detection in Real-World ScenariosarXiv 2024Toward Interpretable Semantic Textual Similarity via Optimal Transport-based Contrastive Sentence LearningACL 2022 5CIDAR: Culturally Relevant Instruction Dataset For ArabicarXiv 2024Compositional Prompt Tuning with Motion Cues for Open-vocabulary Video Relation DetectionarXiv 2023Dissecting Self-Supervised Learning Methods for Surgical Computer VisionarXiv 2022RoleEval: A Bilingual Role Evaluation Benchmark for Large Language ModelsarXiv 2023p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio DecayarXiv 2024Generalizing Event-Based Motion Deblurring in Real-World ScenariosICCV 2023 1Law of the Weakest Link: Cross Capabilities of Large Language ModelsarXiv 2024FireRisk: A Remote Sensing Dataset for Fire Risk Assessment with Benchmarks Using Supervised and Self-supervised LearningarXiv 2023Outline, Then Details: Syntactically Guided Coarse-To-Fine Code GenerationarXiv 2023An Adaptive Model Ensemble Adversarial Attack for Boosting Adversarial TransferabilityICCV 2023 1Protecting Privacy in Multimodal Large Language Models with MLLMU-BencharXiv 2024Hessian-Aware Pruning and Optimal Neural ImplantarXiv 2021DiffusionNAG: Predictor-guided Neural Architecture Generation with Diffusion ModelsarXiv 2023XTTS: a Massively Multilingual Zero-Shot Text-to-Speech ModelarXiv 2024Uncertainty Estimation by Fisher Information-based Evidential Deep LearningarXiv 2023Model Tells You What to Discard: Adaptive KV Cache Compression for LLMsarXiv 2023Bag of Tricks for Training Data Extraction from Language ModelsarXiv 2023PatentMatch: A Dataset for Matching Patent Claims & Prior ArtarXiv 2020Chameleon: Adapting to Peer Images for Planting Durable Backdoors in Federated LearningarXiv 2023ProtoSAM: One-Shot Medical Image Segmentation With Foundational ModelsarXiv 2024TeenyTinyLlama: open-source tiny language models trained in Brazilian PortuguesearXiv 2024On Learning to Summarize with Large Language Models as ReferencesarXiv 2023Simplicial Closure and higher-order link predictionarXiv 2018NeuroLogic A*esque Decoding: Constrained Text Generation with Lookahead HeuristicsNAACL 2022 7Hidden Killer: Invisible Textual Backdoor Attacks with Syntactic TriggerACL 2021 5HGCLIP: Exploring Vision-Language Models with Graph Representations for Hierarchical Understandinghgclip-exploring-vision-language-models-withInference via Interpolation: Contrastive Representations Provably Enable Planning and InferencearXiv 2024Benchmarking Large Language Models for News SummarizationarXiv 2023X$^{2}$-Gaussian: 4D Radiative Gaussian Splatting for Continuous-time Tomographic ReconstructionICCV 2025Improved Zero-Shot Classification by Adapting VLMs with Text DescriptionsCVPR 2024 1SalesBot: Transitioning from Chit-Chat to Task-Oriented DialoguesACL 2022 5Hausdorff Distance Matching with Adaptive Query Denoising for Rotated Detection TransformerarXiv 2023LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference OptimizationarXiv 2025GACT: Activation Compressed Training for Generic Network ArchitecturesarXiv 2022PerfCodeGen: Improving Performance of LLM Generated Code with Execution FeedbackarXiv 2024I Wish I Would Have Loved This One, But I Didn't -- A Multilingual Dataset for Counterfactual Detection in Product ReviewsarXiv 2021Global Sparse Momentum SGD for Pruning Very Deep Neural Networksglobal-sparse-momentum-sgd-for-pruning-very-1LLM-Coordination: Evaluating and Analyzing Multi-agent Coordination Abilities in Large Language ModelsarXiv 2023CORE: Cooperative Reconstruction for Multi-Agent PerceptionICCV 2023 1Understanding Zero-Shot Adversarial Robustness for Large-Scale ModelsarXiv 2022EPIC Fields: Marrying 3D Geometry and Video UnderstandingNeurIPS 2023 11Multimodal ChatGPT for Medical Applications: an Experimental Study of GPT-4VarXiv 2023EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question AnsweringCVPR 2025 1Deep Impression: Audiovisual Deep Residual Networks for Multimodal Apparent Personality Trait RecognitionarXiv 2016A Modern Look at the Relationship between Sharpness and GeneralizationarXiv 2023EHRNoteQA: An LLM Benchmark for Real-World Clinical Practice Using Discharge SummariesarXiv 2024LOVECon: Text-driven Training-Free Long Video Editing with ControlNetarXiv 2023Can Large Language Models be Trusted for Evaluation? Scalable Meta-Evaluation of LLMs as Evaluators via Agent DebatearXiv 2024Improving Virtual Try-On with Garment-focused Diffusion ModelsarXiv 2024Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMsarXiv 2024StateFlow: Enhancing LLM Task-Solving through State-Driven WorkflowsarXiv 2024Raidionics: an open software for pre- and postoperative central nervous system tumor segmentation and standardized reportingarXiv 2023Group DETR: Fast DETR Training with Group-Wise One-to-Many AssignmentICCV 2023 1Re-thinking Model Inversion Attacks Against Deep Neural NetworksCVPR 2023 1Relation-Aware Diffusion Model for Controllable Poster Layout GenerationarXiv 2023Prism: A Framework for Decoupling and Assessing the Capabilities of VLMsarXiv 2024RankCoT: Refining Knowledge for Retrieval-Augmented Generation through Ranking Chain-of-ThoughtsarXiv 2025Shopping MMLU: A Massive Multi-Task Online Shopping Benchmark for Large Language ModelsarXiv 2024SciGraphQA: A Large-Scale Synthetic Multi-Turn Question-Answering Dataset for Scientific GraphsarXiv 2023Aligning LLM Agents by Learning Latent Preference from User EditsarXiv 2024Prompt, Generate, then Cache: Cascade of Foundation Models makes Strong Few-shot LearnersCVPR 2023 1Evaluation Benchmarks and Learning Criteria for Discourse-Aware Sentence Representationsevaluation-benchmarks-and-learning-criteriaIs ChatGPT a Good NLG Evaluator? A Preliminary StudyarXiv 2023P2DFlow: A Protein Ensemble Generative Model with SE(3) Flow MatchingarXiv 2024AltDiffusion: A Multilingual Text-to-Image Diffusion ModelarXiv 2023LMR: A Large-Scale Multi-Reference Dataset for Reference-based Super-ResolutionICCV 2023 1Prioritized Semantic Learning for Zero-shot Instance NavigationarXiv 2024Generalizing to the Future: Mitigating Entity Bias in Fake News DetectionarXiv 2022Distribution-Aware Prompt Tuning for Vision-Language ModelsICCV 2023 1InPO: Inversion Preference Optimization with Reparametrized DDIM for Efficient Diffusion Model AlignmentCVPR 2025 1MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language ModelsarXiv 2024Label Propagation for Zero-shot Classification with Vision-Language ModelsCVPR 2024 1COSA: Concatenated Sample Pretrained Vision-Language Foundation ModelarXiv 2023ReMamber: Referring Image Segmentation with Mamba TwisterarXiv 2024Shape-Erased Feature Learning for Visible-Infrared Person Re-IdentificationCVPR 2023 1Clustering based Point Cloud Representation Learning for 3D AnalysisICCV 2023 1rl_reach: Reproducible Reinforcement Learning Experiments for Robotic Reaching TasksarXiv 2021Be Careful about Poisoned Word Embeddings: Exploring the Vulnerability of the Embedding Layers in NLP ModelsNAACL 2021 4When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token PruningICCV 2025Planning In Natural Language Improves LLM Search For Code GenerationarXiv 2024InfoOT: Information Maximizing Optimal TransportarXiv 2022Making Language Models Better Tool Learners with Execution FeedbackarXiv 2023Generative Expressive Conversational Speech SynthesisarXiv 2024SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language ModelarXiv 2024Situational Awareness Matters in 3D Vision Language ReasoningCVPR 2024 1NICO++: Towards Better Benchmarking for Domain GeneralizationCVPR 2023 1Large Language Models for Automated Open-domain Scientific Hypotheses DiscoveryarXiv 2023CodeMind: Evaluating Large Language Models for Code ReasoningarXiv 2024Interpretable Long-Form Legal Question Answering with Retrieval-Augmented Large Language ModelsarXiv 2023Probabilistic Contrastive Learning Recovers the Correct Aleatoric Uncertainty of Ambiguous InputsarXiv 2023Sparse Fine-tuning for Inference Acceleration of Large Language ModelsarXiv 2023RSTeller: Scaling Up Visual Language Modeling in Remote Sensing with Rich Linguistic Semantics from Openly Available Data and Large Language ModelsarXiv 2024RobustFT: Robust Supervised Fine-tuning for Large Language Models under Noisy ResponsearXiv 2024PolarNet: 3D Point Clouds for Language-Guided Robotic ManipulationarXiv 2023LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?arXiv 2024MMVP: Motion-Matrix-based Video PredictionICCV 2023 1AIBugHunter: A Practical Tool for Predicting, Classifying and Repairing Software VulnerabilitiesarXiv 2023Online Prototype Learning for Online Continual LearningICCV 2023 1Training Language Models for Social Deduction with Multi-Agent Reinforcement LearningarXiv 2025MAPO: Advancing Multilingual Reasoning through Multilingual Alignment-as-Preference OptimizationarXiv 2024TranSplat: Surface Embedding-guided 3D Gaussian Splatting for Transparent Object ManipulationarXiv 2025Large Language Models Are Not Robust Multiple Choice SelectorsarXiv 2023Part-Aware Transformer for Generalizable Person Re-identificationICCV 2023 1VLM2-Bench: A Closer Look at How Well VLMs Implicitly Link Explicit Matching Visual CuesarXiv 2025BLEnD: A Benchmark for LLMs on Everyday Knowledge in Diverse Cultures and LanguagesarXiv 2024On Diffusion Modeling for Anomaly DetectionarXiv 2023Tasty Burgers, Soggy Fries: Probing Aspect Robustness in Aspect-Based Sentiment AnalysisEMNLP 2020 11Enriching Music Descriptions with a Finetuned-LLM and Metadata for Text-to-Music RetrievalarXiv 2024UDA: A Benchmark Suite for Retrieval Augmented Generation in Real-world Document AnalysisarXiv 2024Interactive Segmentation as Gaussian Process ClassificationarXiv 2023ProtAgents: Protein discovery via large language model multi-agent collaborations combining physics and machine learningarXiv 2024Knowledge-Augmented Reasoning Distillation for Small Language Models in Knowledge-Intensive Tasksknowledge-augmented-reasoning-distillationSelfDocSeg: A Self-Supervised vision-based Approach towards Document SegmentationarXiv 2023SEvenLLM: Benchmarking, Eliciting, and Enhancing Abilities of Large Language Models in Cyber Threat IntelligencearXiv 2024Inducing High Energy-Latency of Large Vision-Language Models with Verbose ImagesarXiv 2024MAgIC: Investigation of Large Language Model Powered Multi-Agent in Cognition, Adaptability, Rationality and CollaborationarXiv 2023Are Diffusion Models Vulnerable to Membership Inference Attacks?arXiv 2023Data Splits and Metrics for Method Benchmarking on Surgical Action Triplet DatasetsarXiv 2022Kinematic-aware Prompting for Generalizable Articulated Object Manipulation with LLMsarXiv 2023CodeQA: A Question Answering Dataset for Source Code ComprehensionFindings (EMNLP) 2021 11Language Model Prior for Low-Resource Neural Machine TranslationEMNLP 2020 11

Back to Papers