0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement LearningarXiv 2025AlpaGasus: Training A Better Alpaca with Fewer DataarXiv 2023SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian LanguagesarXiv 2024AlpaGasus: Training A Better Alpaca with Fewer DataarXiv 2023A Survey of Generative AI for de novo Drug Design: New Frontiers in Molecule and Protein GenerationarXiv 2024CARD: Channel Aligned Robust Blend Transformer for Time Series ForecastingarXiv 2023Harnessing the Spatial-Temporal Attention of Diffusion Models for High-Fidelity Text-to-Image SynthesisICCV 2023 1Be like a Goldfish, Don't Memorize! Mitigating Memorization in Generative LLMsarXiv 2024SoccerNet 2022 Challenges ResultsarXiv 2022AraT5: Text-to-Text Transformers for Arabic Language GenerationACL 2022 5GLUE-X: Evaluating Natural Language Understanding Models from an Out-of-distribution Generalization PerspectivearXiv 2022ScoreFlow: Mastering LLM Agent Workflows via Score-based Preference OptimizationarXiv 2025TurboRAG: Accelerating Retrieval-Augmented Generation with Precomputed KV Caches for Chunked TextarXiv 2024CoCon: A Self-Supervised Approach for Controlled Text GenerationICLR 2021 1FreeAL: Towards Human-Free Active Learning in the Era of Large Language ModelsarXiv 2023Reasoning Language Models: A BlueprintarXiv 2025No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model PerformancearXiv 2024MHAF-YOLO: Multi-Branch Heterogeneous Auxiliary Fusion YOLO for accurate object detectionarXiv 2025Learning to Compose Soft Prompts for Compositional Zero-Shot LearningarXiv 2022Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference OptimizationarXiv 2023The Federated Tumor Segmentation (FeTS) ChallengearXiv 2021Unleashing the Power of Data Tsunami: A Comprehensive Survey on Data Assessment and Selection for Instruction Tuning of Language ModelsarXiv 2024Sound Demixing Challenge 2023 Music Demixing Track Technical Report: TFC-TDF-UNet v3arXiv 2023Cross-task weakly supervised learning from instructional videoscross-task-weakly-supervised-learning-from-1DeepVecFont-v2: Exploiting Transformers to Synthesize Vector Fonts with Higher QualityCVPR 2023 1Neural Arabic Text Diacritization: State of the Art Results and a Novel Approach for Machine Translationneural-arabic-text-diacritization-state-ofImproving Image Restoration through Removing Degradations in Textual RepresentationsCVPR 2024 1Episodic Transformer for Vision-and-Language NavigationICCV 2021 10Paralinguistics-Aware Speech-Empowered Large Language Models for Natural ConversationarXiv 2024Response Length Perception and Sequence Scheduling: An LLM-Empowered LLM Inference Pipelineresponse-length-perception-and-sequence-1Mammo-CLIP: A Vision Language Foundation Model to Enhance Data Efficiency and Robustness in MammographyarXiv 2024AccDiffusion: An Accurate Method for Higher-Resolution Image GenerationarXiv 2024Empirical Evaluation of Gated Recurrent Neural Networks on Sequence ModelingarXiv 2014Dataless Knowledge Fusion by Merging Weights of Language ModelsarXiv 2022VL-SAT: Visual-Linguistic Semantics Assisted Training for 3D Semantic Scene Graph Prediction in Point CloudCVPR 2023 1HyPoradise: An Open Baseline for Generative Speech Recognition with Large Language Modelshyporadise-an-open-baseline-for-generative3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene UnderstandingICCV 2025A Comprehensive Study of Multimodal Large Language Models for Image Quality AssessmentarXiv 2024HumanAesExpert: Advancing a Multi-Modality Foundation Model for Human Image Aesthetic AssessmentarXiv 2025Learning to Regress Bodies from Images using Differentiable Semantic Renderinglearning-to-regress-bodies-from-images-usingMulti3DRefer: Grounding Text Description to Multiple 3D ObjectsICCV 2023 1GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative ReasoningarXiv 2025Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You WantarXiv 2024OV-PARTS: Towards Open-Vocabulary Part SegmentationNeurIPS 2023 11Image Clustering Conditioned on Text CriteriaarXiv 2023Diffusion Models for Monocular Depth Estimation: Overcoming Challenging ConditionsarXiv 2024Beto, Bentz, Becas: The Surprising Cross-Lingual Effectiveness of BERTbeto-bentz-becas-the-surprising-cross-lingual-1HelixSurf: A Robust and Efficient Neural Implicit Surface Learning of Indoor Scenes with Iterative Intertwined RegularizationCVPR 2023 1MMRole: A Comprehensive Framework for Developing and Evaluating Multimodal Role-Playing AgentsarXiv 2024BioDiscoveryAgent: An AI Agent for Designing Genetic Perturbation ExperimentsarXiv 2024Towards Continual Knowledge Learning of Language Modelstowards-continual-knowledge-learning-of-1Few-Shot Question Answering by Pretraining Span SelectionACL 2021 5WaveFake: A Data Set to Facilitate Audio Deepfake DetectionarXiv 2021GPGait: Generalized Pose-based Gait RecognitionICCV 2023 1Multimodal Procedural Planning via Dual Text-Image PromptingarXiv 2023A dataset for resolving referring expressions in spoken dialogue via contextual query rewrites (CQR)arXiv 2019Fast Adversarial Attacks on Language Models In One GPU MinutearXiv 2024PTT5: Pretraining and validating the T5 model on Brazilian Portuguese dataarXiv 2020HS-Diffusion: Semantic-Mixing Diffusion for Head SwappingarXiv 2022Surgical Gym: A high-performance GPU-based platform for reinforcement learning with surgical robotsarXiv 202311K Hands: Gender recognition and biometric identification using a large dataset of hand imagesarXiv 2017Subobject-level Image TokenizationarXiv 2024Adversarial Policies Beat Superhuman Go AIsarXiv 2022Fine-tuning Large Language Models for Adaptive Machine TranslationarXiv 2023Vision-Language Instruction Tuning: A Review and AnalysisarXiv 2023Conditional Generation of Audio from Video via Foley AnalogiesCVPR 2023 1WaveMix: A Resource-efficient Neural Network for Image AnalysisarXiv 2022Towards All-in-one Pre-training via Maximizing Multi-modal Mutual InformationCVPR 2023 1HyperDomainNet: Universal Domain Adaptation for Generative Adversarial NetworksarXiv 2022Learning to Route Among Specialized Experts for Zero-Shot GeneralizationarXiv 2024ViM: Out-Of-Distribution with Virtual-logit MatchingCVPR 2022 1HHH: An Online Medical Chatbot System based on Knowledge Graph and Hierarchical Bi-Directional Attentionhhh-an-online-medical-chatbot-system-based-onAdaFocus V2: End-to-End Training of Spatial Dynamic Networks for Video RecognitionCVPR 2022 1ePillID Dataset: A Low-Shot Fine-Grained Benchmark for Pill IdentificationarXiv 2020AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial MemoriesarXiv 2026MoEUT: Mixture-of-Experts Universal TransformersarXiv 2024From Simulated Mixtures to Simulated Conversations as Training Data for End-to-End Neural DiarizationarXiv 2022Sliced-Wasserstein Autoencoder: An Embarrassingly Simple Generative ModelarXiv 2018AnimeRun: 2D Animation Visual Correspondence from Open Source 3D MoviesarXiv 2022Aligning Modalities in Vision Large Language Models via Preference Fine-tuningarXiv 2024Deep Incubation: Training Large Models by Divide-and-ConqueringICCV 2023 1Active Learning for Domain Adaptation: An Energy-Based ApproacharXiv 2021In-Context Reinforcement Learning for Variable Action SpacesarXiv 2023Weak-to-Strong Jailbreaking on Large Language ModelsarXiv 2024The AI Economist: Optimal Economic Policy Design via Two-level Deep Reinforcement LearningarXiv 2021DisCo-Diff: Enhancing Continuous Diffusion Models with Discrete LatentsarXiv 2024Clustering and Ranking: Diversity-preserved Instruction Selection through Expert-aligned Quality EstimationarXiv 2024LOVA3: Learning to Visual Question Answering, Asking and AssessmentarXiv 2024Multi-Frame, Lightweight & Efficient Vision-Language Models for Question Answering in Autonomous DrivingarXiv 20243D Implicit Transporter for Temporally Consistent Keypoint DiscoveryICCV 2023 1CRS-Diff: Controllable Remote Sensing Image Generation with Diffusion ModelarXiv 2024Language Conditioned Traffic GenerationarXiv 2023ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMsarXiv 2024Autonomous Driving with Spiking Neural NetworksarXiv 2024Improving Contrastive Learning by Visualizing Feature TransformationICCV 2021 10Group Pose: A Simple Baseline for End-to-End Multi-person Pose EstimationICCV 2023 1Toward Spatially Unbiased Generative ModelsICCV 2021 10Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning GaparXiv 2024Null It Out: Guarding Protected Attributes by Iterative Nullspace Projectionnull-it-out-guarding-protected-attributes-by-1Keep CALM and Improve Visual Feature AttributionICCV 2021 10Equivariant Architectures for Learning in Deep Weight SpacesarXiv 2023LLaMA-Adapter V2: Parameter-Efficient Visual Instruction ModelarXiv 2023How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent EnvironmentsarXiv 2024IEBins: Iterative Elastic Bins for Monocular Depth Estimationiebins-iterative-elastic-bins-for-monocularRecurrent Off-policy Baselines for Memory-based Continuous ControlarXiv 2021A Stem-Agnostic Single-Decoder System for Music Source Separation Beyond Four StemsarXiv 2024LEVER: Learning to Verify Language-to-Code Generation with ExecutionarXiv 2023Towards Unified Conversational Recommender Systems via Knowledge-Enhanced Prompt LearningarXiv 2022How to Index Item IDs for Recommendation Foundation ModelsarXiv 2023Keeping Yourself is Important in Downstream Tuning Multimodal Large Language ModelarXiv 2025Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow InstructionsarXiv 2023Teacher algorithms for curriculum learning of Deep RL in continuously parameterized environmentsarXiv 2019Molecular Contrastive Learning with Chemical Element Knowledge GrapharXiv 2021FactCHD: Benchmarking Fact-Conflicting Hallucination DetectionarXiv 2023MonoFormer: One Transformer for Both Diffusion and AutoregressionarXiv 2024Towards High-Quality and Efficient Video Super-Resolution via Spatial-Temporal Data OverfittingCVPR 2023 1Learning to (Learn at Test Time)arXiv 2023Fine-grained style control in Transformer-based Text-to-speech SynthesisarXiv 2021PGN: The RNN's New Successor is Effective for Long-Range Time Series ForecastingarXiv 2024KING: Generating Safety-Critical Driving Scenarios for Robust Imitation via Kinematics GradientsarXiv 2022Multi-Level Knowledge Distillation for Out-of-Distribution Detection in TextarXiv 2022Understanding Dataset Difficulty with $\mathcal{V}$-Usable InformationarXiv 2021Conifer: Improving Complex Constrained Instruction-Following Ability of Large Language ModelsarXiv 2024Rethinking Positional Encodingrethinking-positional-encoding-1GSCo: Towards Generalizable AI in Medicine via Generalist-Specialist CollaborationarXiv 2024Measuring Massive Multitask Chinese UnderstandingarXiv 2023I Have Covered All the Bases Here: Interpreting Reasoning Features in Large Language Models via Sparse AutoencodersarXiv 2025TIARA: Multi-grained Retrieval for Robust Question Answering over Large Knowledge BasesarXiv 2022BrightDreamer: Generic 3D Gaussian Generative Framework for Fast Text-to-3D SynthesisarXiv 2024Pre-training Polish Transformer-based Language Models at ScalearXiv 2020BiBERT: Accurate Fully Binarized BERTbibert-accurate-fully-binarized-bertScaling Laws with Vocabulary: Larger Models Deserve Larger VocabulariesarXiv 2024AgentCourt: Simulating Court with Adversarial Evolvable Lawyer AgentsarXiv 2024Injecting Numerical Reasoning Skills into Language Modelsinjecting-numerical-reasoning-skills-into-1DC-BENCH: Dataset Condensation BenchmarkarXiv 2022Promptriever: Instruction-Trained Retrievers Can Be Prompted Like Language ModelsarXiv 2024XLCoST: A Benchmark Dataset for Cross-lingual Code IntelligencearXiv 2022ECG-QA: A Comprehensive Question Answering Dataset Combined With ElectrocardiogramNeurIPS 2023 11Self-Knowledge Distillation with Progressive Refinement of TargetsICCV 2021 10LVOS: A Benchmark for Long-term Video Object SegmentationICCV 2023 1Reinforcement Learning from Passive Data via Latent IntentionsarXiv 2023MLLM Is a Strong Reranker: Advancing Multimodal Retrieval-augmented Generation via Knowledge-enhanced Reranking and Noise-injected TrainingarXiv 2024Direct Feedback Alignment Scales to Modern Deep Learning Tasks and ArchitecturesNeurIPS 2020 12Progressive Temporal Feature Alignment Network for Video InpaintingCVPR 2021 1Language-Specific Neurons: The Key to Multilingual Capabilities in Large Language ModelsarXiv 2024Instance-Aware Domain Generalization for Face Anti-SpoofingCVPR 2023 1IDiff-Face: Synthetic-based Face Recognition through Fizzy Identity-Conditioned Diffusion ModelsarXiv 2023Phrase-BERT: Improved Phrase Embeddings from BERT with an Application to Corpus ExplorationEMNLP 2021 11Thought2Text: Text Generation from EEG Signal using Large Language Models (LLMs)arXiv 2024CoT-Valve: Length-Compressible Chain-of-Thought TuningarXiv 2025Diverse Beam Search: Decoding Diverse Solutions from Neural Sequence ModelsarXiv 2016OmniSat: Self-Supervised Modality Fusion for Earth ObservationarXiv 2024WeaverBird: Empowering Financial Decision-Making with Large Language Model, Knowledge Base, and Search EnginearXiv 2023Towards Understanding Chain-of-Thought Prompting: An Empirical Study of What MattersarXiv 2022DreamPropeller: Supercharge Text-to-3D Generation with Parallel SamplingCVPR 2024 1Self-Diagnosis and Self-Debiasing: A Proposal for Reducing Corpus-Based Bias in NLParXiv 2021Anonymizing Speech with Generative Adversarial Networks to Preserve Speaker PrivacyarXiv 2022GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language ModelsarXiv 2024Autoregressive Pretraining with Mamba in VisionarXiv 2024Guiding Pretraining in Reinforcement Learning with Large Language ModelsarXiv 2023Weight Normalization: A Simple Reparameterization to Accelerate Training of Deep Neural Networksweight-normalization-a-simple-1Contrastive Learning-Based Audio to Lyrics Alignment for Multiple LanguagesarXiv 2023Object-aware Inversion and Reassembly for Image EditingarXiv 2023Can GPT-4 Perform Neural Architecture Search?arXiv 2023Yet Another ICU Benchmark: A Flexible Multi-Center Framework for Clinical MLarXiv 2023aMUSEd: An Open MUSE ReproductionarXiv 2024Illiterate DALL-E Learns to ComposearXiv 2021The iMaterialist Fashion Attribute DatasetarXiv 2019City-on-Web: Real-time Neural Rendering of Large-scale Scenes on the WebarXiv 2023ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question AnsweringarXiv 2019A Touch, Vision, and Language Dataset for Multimodal AlignmentarXiv 2024Mantis: Lightweight Foundation Model for Time Series ClassificationarXiv 2025Minimum Latency Deep Online Video StabilizationICCV 2023 1MaskBit: Embedding-free Image Generation via Bit TokensarXiv 2024Learning to Aggregate Multi-Scale Context for Instance Segmentation in Remote Sensing ImagesarXiv 2021Adaptive Early-Learning Correction for Segmentation from Noisy Annotationsadaptive-early-learning-correction-for-1LLaMP: Large Language Model Made Powerful for High-fidelity Materials Knowledge Retrieval and DistillationarXiv 2024X2I: Seamless Integration of Multimodal Understanding into Diffusion Transformer via Attention DistillationICCV 2025Can Contextual Biasing Remain Effective with Whisper and GPT-2?arXiv 2023mBLIP: Efficient Bootstrapping of Multilingual Vision-LLMsarXiv 2023Two-shot Spatially-varying BRDF and Shape Estimationtwo-shot-spatially-varying-brdf-and-shape-1CodeSteer: Symbolic-Augmented Language Models via Code/Text GuidancearXiv 2025AudioToken: Adaptation of Text-Conditioned Diffusion Models for Audio-to-Image Generationaudiotoken-adaptation-of-text-conditionedThe PRISM Alignment Dataset: What Participatory, Representative and Individualised Human Feedback Reveals About the Subjective and Multicultural Alignment of Large Language ModelsarXiv 2024To Generate or Not? Safety-Driven Unlearned Diffusion Models Are Still Easy To Generate Unsafe Images ... For NowarXiv 2023One-Shot Learning as Instruction Data Prospector for Large Language ModelsarXiv 2023Prompting Frameworks for Large Language Models: A SurveyarXiv 2023Analyzing Feed-Forward Blocks in Transformers through the Lens of Attention MapsarXiv 2023PromptCap: Prompt-Guided Task-Aware Image CaptioningarXiv 2022Continuous-Multiple Image Outpainting in One-Step via Positional Query and A Diffusion-based ApproacharXiv 2024Image2Reverb: Cross-Modal Reverb Impulse Response SynthesisICCV 2021 10Autonomous Agents for Collaborative Task under Information AsymmetryarXiv 2024Can AI-Generated Text be Reliably Detected?arXiv 2023A Study of Global and Episodic Bonuses for Exploration in Contextual MDPsarXiv 2023Attentions Help CNNs See Better: Attention-based Hybrid Image Quality Assessment NetworkarXiv 2022Single Image Reflection Separation via Component SynergyICCV 2023 1Rethinking Channel Dependence for Multivariate Time Series Forecasting: Learning from Leading IndicatorsarXiv 2024Automated Peer Reviewing in Paper SEA: Standardization, Evaluation, and AnalysisarXiv 2024Intent Detection and Slot Filling for VietnamesearXiv 2021Named Entity Recognition in Indian court judgmentsarXiv 2022

Back to Papers