0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

Answering Complex Open-domain Questions Through Iterative Query Generationanswering-complex-open-domain-questions-1SNAP: Self-Supervised Neural Maps for Visual Positioning and Semantic Understandingsnap-self-supervised-neural-maps-for-visualExtracting Training Data from Large Language ModelsarXiv 2020P2B: Point-to-Box Network for 3D Object Tracking in Point Cloudsp2b-point-to-box-network-for-3d-object-1Natural Language Reasoning, A SurveyarXiv 2023CrossKD: Cross-Head Knowledge Distillation for Object DetectionCVPR 2024 1SneakyPrompt: Jailbreaking Text-to-image Generative ModelsarXiv 2023OneForecast: A Universal Framework for Global and Regional Weather ForecastingarXiv 2025StereoSet: Measuring stereotypical bias in pretrained language modelsACL 2021 5Knowledgeable Preference Alignment for LLMs in Domain-specific Question AnsweringarXiv 2023NeRF On-the-go: Exploiting Uncertainty for Distractor-free NeRFs in the WildCVPR 2024 1xLSTM-UNet can be an Effective 2D & 3D Medical Image Segmentation Backbone with Vision-LSTM (ViL) better than its Mamba CounterpartarXiv 2024Fighting Fake News: Image Splice Detection via Learned Self-Consistencyfighting-fake-news-image-splice-detection-via-1CodeS: Towards Building Open-source Language Models for Text-to-SQLarXiv 2024MiniCheck: Efficient Fact-Checking of LLMs on Grounding DocumentsarXiv 2024Efficient Training of Language Models to Fill in the MiddlearXiv 2022Golden Noise for Diffusion Models: A Learning FrameworkICCV 2025CrossOver: 3D Scene Cross-Modal AlignmentCVPR 2025 1Benchmarking Large Language Models for Automated Verilog RTL Code GenerationarXiv 2022P2C: Self-Supervised Point Cloud Completion from Single Partial CloudsICCV 2023 1Specifying Object Attributes and Relations in Interactive Scene Generationspecifying-object-attributes-and-relations-in-1Solving ImageNet: a Unified Scheme for Training any Backbone to Top ResultsarXiv 2022FlowDec: A flow-based full-band general audio codec with high perceptual qualityarXiv 2025Keys to Better Image Inpainting: Structure and Texture Go Hand in HandarXiv 2022GrowSP: Unsupervised Semantic Segmentation of 3D Point Cloudsgrowsp-unsupervised-semantic-segmentation-ofContent Enhanced BERT-based Text-to-SQL GenerationarXiv 2019Prompting Visual-Language Models for Efficient Video UnderstandingarXiv 2021Embodied Task Planning with Large Language ModelsarXiv 2023I-ViT: Integer-only Quantization for Efficient Vision Transformer InferenceICCV 2023 1Adaptive Personalized Federated LearningarXiv 2020Video2Music: Suitable Music Generation from Videos using an Affective Multimodal Transformer modelarXiv 2023Is GPT-4 a Good Data Analyst?arXiv 2023SkyScript: A Large and Semantically Diverse Vision-Language Dataset for Remote SensingarXiv 2023Conditional Positional Encodings for Vision TransformersarXiv 2021LooGLE: Can Long-Context Language Models Understand Long Contexts?arXiv 2023SCoDA: Domain Adaptive Shape Completion for Real ScansCVPR 2023 1Pic2Word: Mapping Pictures to Words for Zero-shot Composed Image RetrievalCVPR 2023 1Fine-Tuning Language Models via Epistemic Neural NetworksarXiv 2022Yuan 2.0-M32: Mixture of Experts with Attention RouterarXiv 2024AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language ModelsarXiv 2024SARATR-X: Toward Building A Foundation Model for SAR Target RecognitionarXiv 2024Text2Reward: Reward Shaping with Language Models for Reinforcement LearningarXiv 2023LLM2LLM: Boosting LLMs with Novel Iterative Data EnhancementarXiv 2024Towards Accurate Image Coding: Improved Autoregressive Image Generation with Dynamic Vector Quantizationtowards-accurate-image-coding-improvedSMART-LLM: Smart Multi-Agent Robot Task Planning using Large Language ModelsarXiv 2023Self-Chained Image-Language Model for Video Localization and Question Answeringself-chained-image-language-model-for-videoBehavior Generation with Latent ActionsarXiv 2024LITA: Language Instructed Temporal-Localization AssistantarXiv 2024Region Normalization for Image InpaintingarXiv 2019Neural Waveshaping SynthesisarXiv 2021Dockerface: an Easy to Install and Use Faster R-CNN Face Detector in a Docker ContainerarXiv 2017MTet: Multi-domain Translation for English and VietnamesearXiv 2022Transcending the Limit of Local Window: Advanced Super-Resolution Transformer with Adaptive Token DictionaryCVPR 2024 1Fastformer: Additive Attention Can Be All You NeedarXiv 2021Imp: Highly Capable Large Multimodal Models for Mobile DevicesarXiv 2024Lawformer: A Pre-trained Language Model for Chinese Legal Long DocumentsarXiv 2021Super-Convergence: Very Fast Training of Neural Networks Using Large Learning RatesarXiv 2017Scaling & Shifting Your Features: A New Baseline for Efficient Model TuningarXiv 2022What do Vision Transformers Learn? A Visual ExplorationarXiv 2022Encoding Sentences with Graph Convolutional Networks for Semantic Role Labelingencoding-sentences-with-graph-convolutional-1Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio GenerationarXiv 2024HOOD: Hierarchical Graphs for Generalized Modelling of Clothing DynamicsCVPR 2023 1Zero-Shot Semantic Segmentationzero-shot-semantic-segmentationObject-Compositional Neural Implicit SurfacesarXiv 2022Reconstruction of three-dimensional porous media using generative adversarial neural networksarXiv 2017Body Transformer: Leveraging Robot Embodiment for Policy LearningarXiv 2024Flow++: Improving Flow-Based Generative Models with Variational Dequantization and Architecture Designflow-improving-flow-based-generative-models-1Archon: An Architecture Search Framework for Inference-Time TechniquesarXiv 2024When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric MemoriesarXiv 2022CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal ConcatenationarXiv 2025LEAP: Liberate Sparse-view 3D Modeling from Camera PosesarXiv 2023SportsMOT: A Large Multi-Object Tracking Dataset in Multiple Sports ScenesICCV 2023 1tasksource: A Dataset Harmonization Framework for Streamlined NLP Multi-Task Learning and EvaluationarXiv 2023TransEditor: Transformer-Based Dual-Space GAN for Highly Controllable Facial EditingCVPR 2022 1Democratizing Fine-grained Visual Recognition with Large Language ModelsarXiv 2024SINE: SINgle Image Editing with Text-to-Image Diffusion ModelsCVPR 2023 1AvatarCraft: Transforming Text into Neural Human Avatars with Parameterized Shape and Pose ControlICCV 2023 1Few-shot Natural Language Generation for Task-Oriented DialogFindings of the Association for Computational Linguistics 2020A Survey on Programmatic Weak SupervisionarXiv 2022Recognizing Emotion Cause in Conversationsrecognizing-emotion-cause-in-conversationsOn the Diagram of ThoughtarXiv 2024SimCLS: A Simple Framework for Contrastive Learning of Abstractive SummarizationACL 2021 5Diffusion-Based 3D Human Pose Estimation with Multi-Hypothesis AggregationICCV 2023 1Advancing Pose-Guided Image Synthesis with Progressive Conditional Diffusion ModelsarXiv 2023Generative AI for Cel-Animation: A SurveyarXiv 2025Generating Diverse Structure for Image Inpainting With Hierarchical VQ-VAECVPR 2021 1MedAgentBench: A Realistic Virtual EHR Environment to Benchmark Medical LLM AgentsarXiv 2025UniOcc: A Unified Benchmark for Occupancy Forecasting and Prediction in Autonomous DrivingICCV 2025Align and Prompt: Video-and-Language Pre-training with Entity PromptsCVPR 2022 1SAMformer: Unlocking the Potential of Transformers in Time Series Forecasting with Sharpness-Aware Minimization and Channel-Wise AttentionarXiv 2024Composed Image Retrieval using Contrastive Learning and Task-oriented CLIP-based FeaturesarXiv 2023Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene UnderstandingCVPR 2025 1Towards a Unified View of Preference Learning for Large Language Models: A SurveyarXiv 2024Massive Activations in Large Language ModelsarXiv 2024Text Spotting TransformersCVPR 2022 1Image and Video Tokenization with Binary Spherical QuantizationarXiv 2024Unified Pre-training for Program Understanding and GenerationNAACL 2021 43DRealCar: An In-the-wild RGB-D Car Dataset with 360-degree ViewsarXiv 2024ChatCAD+: Towards a Universal and Reliable Interactive CAD using LLMsarXiv 2023Panoptic Segmentation of Satellite Image Time Series with Convolutional Temporal Attention NetworksICCV 2021 10Centaur: a foundation model of human cognitionarXiv 2024Lbl2Vec: An Embedding-Based Approach for Unsupervised Document Retrieval on Predefined TopicsarXiv 2022EXTD: Extremely Tiny Face Detector via Iterative Filter ReusearXiv 2019Exphormer: Sparse Transformers for GraphsarXiv 2023Change is Everywhere: Single-Temporal Supervised Object Change Detection in Remote Sensing ImageryICCV 2021 10A Survey on Non-Autoregressive Generation for Neural Machine Translation and BeyondarXiv 2022WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion ModelCVPR 2025 1Codified audio language modeling learns useful representations for music information retrievalarXiv 2021N-HiTS: Neural Hierarchical Interpolation for Time Series ForecastingarXiv 2022BOLAA: Benchmarking and Orchestrating LLM-augmented Autonomous AgentsarXiv 2023PutnamBench: Evaluating Neural Theorem-Provers on the Putnam Mathematical CompetitionarXiv 2024RA-ISF: Learning to Answer and Understand from Retrieval Augmentation via Iterative Self-FeedbackarXiv 2024Decoding Natural Images from EEG for Object RecognitionarXiv 2023EvalCrafter: Benchmarking and Evaluating Large Video Generation ModelsCVPR 2024 1MotionEditor: Editing Video Motion via Content-Aware DiffusionCVPR 2024 1Target-aware Dual Adversarial Learning and a Multi-scenario Multi-Modality Benchmark to Fuse Infrared and Visible for Object DetectionCVPR 2022 1Depicting Beyond Scores: Advancing Image Quality Assessment through Multi-modal Language ModelsarXiv 2023Scaling Video-Language Models to 10K Frames via Hierarchical Differential DistillationarXiv 2025Evaluating Unsupervised Text Classification: Zero-shot and Similarity-based ApproachesarXiv 2022Spatial-Mamba: Effective Visual State Space Models via Structure-Aware State FusionarXiv 2024How2: A Large-scale Dataset for Multimodal Language UnderstandingarXiv 2018Improving Wikipedia Verifiability with AIarXiv 2022IntrinsicNeRF: Learning Intrinsic Neural Radiance Fields for Editable Novel View SynthesisICCV 2023 1Learning a Deep Embedding Model for Zero-Shot Learninglearning-a-deep-embedding-model-for-zero-shot-1Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive TasksarXiv 2025Reinforcement Learning Enhanced LLMs: A SurveyarXiv 2024ResearchTown: Simulator of Human Research CommunityarXiv 2024EDiffSR: An Efficient Diffusion Probabilistic Model for Remote Sensing Image Super-ResolutionarXiv 2023Contrastive Language-Image Pre-training for the Italian LanguagearXiv 2021Amortizing intractable inference in large language modelsarXiv 2023How Well Do Self-Supervised Models Transfer?CVPR 2021 1PanoOcc: Unified Occupancy Representation for Camera-based 3D Panoptic SegmentationCVPR 2024 1Diffusion Model for Dense MatchingarXiv 2023CoMoGAN: continuous model-guided image-to-image translationCVPR 2021 1Evaluation of Retrieval-Augmented Generation: A SurveyarXiv 2024Reproducible scaling laws for contrastive language-image learningCVPR 2023 1Adapting Large Language Models by Integrating Collaborative Semantics for RecommendationarXiv 2023Revisiting Few-sample BERT Fine-tuningICLR 2021 1Invisible Stitch: Generating Smooth 3D Scenes with Depth InpaintingarXiv 2024DialogSum: A Real-Life Scenario Dialogue Summarization DatasetFindings (ACL) 2021 8Superfiltering: Weak-to-Strong Data Filtering for Fast Instruction-TuningarXiv 2024A Neural Network Solves, Explains, and Generates University Math Problems by Program Synthesis and Few-Shot Learning at Human LevelarXiv 2021Vivim: a Video Vision Mamba for Medical Video SegmentationarXiv 2024Is synthetic data from generative models ready for image recognition?arXiv 2022Large Language Models(LLMs) on Tabular Data: Prediction, Generation, and Understanding -- A SurveyarXiv 2024Neural Plasticity-Inspired Multimodal Foundation Model for Earth ObservationarXiv 2024Learning to Prompt for Open-Vocabulary Object Detection with Vision-Language ModelCVPR 2022 1mLongT5: A Multilingual and Efficient Text-To-Text Transformer for Longer SequencesarXiv 2023Controlling Perceptual Factors in Neural Style Transfercontrolling-perceptual-factors-in-neural-1Multi-view Aggregation Network for Dichotomous Image SegmentationCVPR 2024 1Contrastive learning of global and local features for medical image segmentation with limited annotationsNeurIPS 2020 12Polynomial Regression As an Alternative to Neural NetsarXiv 2018Modelling Long Range Dependencies in $N$D: From Task-Specific to a General Purpose CNNarXiv 2023Generating Novel, Designable, and Diverse Protein Structures by Equivariantly Diffusing Oriented Residue CloudsarXiv 2023A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and EvaluationsarXiv 2025Mixed High-Order Attention Network for Person Re-Identificationmixed-high-order-attention-network-for-person-1QUIK: Towards End-to-End 4-Bit Inference on Generative Large Language ModelsarXiv 2023Baichuan-Omni-1.5 Technical ReportarXiv 2025Deep Directly-Trained Spiking Neural Networks for Object DetectionICCV 2023 1LAFITE: Towards Language-Free Training for Text-to-Image GenerationarXiv 2021A Comparative Survey of Deep Active LearningarXiv 2022CRN: Camera Radar Net for Accurate, Robust, Efficient 3D PerceptionICCV 2023 1SplatFields: Neural Gaussian Splats for Sparse 3D and 4D ReconstructionarXiv 2024Denoising Diffusion Autoencoders are Unified Self-supervised LearnersICCV 2023 1Revisiting Weakly Supervised Pre-Training of Visual Perception ModelsCVPR 2022 1CLIP2Scene: Towards Label-efficient 3D Scene Understanding by CLIPCVPR 2023 1Poseur: Direct Human Pose Regression with TransformersarXiv 2022MusicLDM: Enhancing Novelty in Text-to-Music Generation Using Beat-Synchronous Mixup StrategiesarXiv 2023FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual PromptsarXiv 2023DRAGIN: Dynamic Retrieval Augmented Generation based on the Information Needs of Large Language ModelsarXiv 2024GraphNAS: Graph Neural Architecture Search with Reinforcement LearningarXiv 2019Harmonizing Visual Representations for Unified Multimodal Understanding and GenerationICCV 2025WorkflowLLM: Enhancing Workflow Orchestration Capability of Large Language ModelsarXiv 2024Domain-Agnostic Molecular Generation with Chemical FeedbackarXiv 2023Skeleton-of-Thought: Prompting LLMs for Efficient Parallel GenerationarXiv 2023Structured Sequence Modeling with Graph Convolutional Recurrent NetworksarXiv 2016TernGrad: Ternary Gradients to Reduce Communication in Distributed Deep Learningterngrad-ternary-gradients-to-reduce-1MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech SeparationarXiv 2023Online Clustered CodebookICCV 2023 1SearchQA: A New Q&A Dataset Augmented with Context from a Search EnginearXiv 2017RepoBench: Benchmarking Repository-Level Code Auto-Completion SystemsarXiv 2023ChineseWebText: Large-scale High-quality Chinese Web Text Extracted with Effective Evaluation ModelarXiv 2023Object Recognition as Next Token PredictionCVPR 2024 1A Neural Space-Time Representation for Text-to-Image PersonalizationarXiv 2023Coreferential Reasoning Learning for Language RepresentationEMNLP 2020 11Large Language Models Can Be Strong Differentially Private Learnerslarge-language-models-can-be-strongMuSiQue: Multihop Questions via Single-hop Question CompositionarXiv 2021Measuring Style Similarity in Diffusion ModelsarXiv 2024RegMix: Data Mixture as Regression for Language Model Pre-trainingarXiv 2024ProcessBench: Identifying Process Errors in Mathematical ReasoningarXiv 2024Dense Connector for MLLMsarXiv 2024Flood Segmentation on Sentinel-1 SAR Imagery with Semi-Supervised LearningNeurIPS Workshop AI4Scien 2021 12DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous DrivingarXiv 2023DiT4SR: Taming Diffusion Transformer for Real-World Image Super-ResolutionICCV 2025Pretraining Language Models with Human PreferencesarXiv 2023Multi-scale Attributed Node EmbeddingarXiv 2019CATCH: Channel-Aware multivariate Time Series Anomaly Detection via Frequency PatchingarXiv 2024Unnatural Instructions: Tuning Language Models with (Almost) No Human LaborarXiv 2022Image Captioning: Transforming Objects into Wordsimage-captioning-transforming-objects-into-1Adaptive Super Resolution For One-Shot Talking-Head GenerationarXiv 2024

Back to Papers