0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

FreshLLMs: Refreshing Large Language Models with Search Engine AugmentationarXiv 2023DISC-MedLLM: Bridging General Large Language Models and Real-World Medical ConsultationarXiv 2023From Individual to Society: A Survey on Social Simulation Driven by Large Language Model-based AgentsarXiv 2024MBA-RAG: a Bandit Approach for Adaptive Retrieval-Augmented Generation through Question ComplexityarXiv 2024Linear-Covariance Loss for End-to-End Learning of 6D Pose EstimationICCV 2023 1An Open and Large-Scale Dataset for Multi-Modal Climate Change-aware Crop Yield PredictionsarXiv 2024Bridging Past and Future: End-to-End Autonomous Driving with Historical Prediction and PlanningCVPR 2025 1ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code GenerationarXiv 2023LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid ArchitecturearXiv 2024Efficiently Democratizing Medical LLMs for 50 Languages via a Mixture of Language Family ExpertsarXiv 2024ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language ModelsarXiv 2024Knowledge Composition using Task Vectors with Learned Anisotropic ScalingarXiv 2024Segment Anything without SupervisionarXiv 2024PubMed 200k RCT: a Dataset for Sequential Sentence Classification in Medical Abstractspubmed-200k-rct-a-dataset-for-sequential-2Competition of Mechanisms: Tracing How Language Models Handle Facts and CounterfactualsarXiv 2024Focus on Local: Finding Reliable Discriminative Regions for Visual Place Recognitionfocus-on-local-finding-reliableProcess Reward Models That ThinkarXiv 2025DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language ModelsarXiv 2025R2MED: A Benchmark for Reasoning-Driven Medical RetrievalarXiv 2025SparseGS: Sparse View Synthesis using 3D Gaussian SplattingarXiv 2023Ring Attention with Blockwise Transformers for Near-Infinite ContextarXiv 2023OmniTokenizer: A Joint Image-Video Tokenizer for Visual GenerationarXiv 2024Liquid: Language Models are Scalable Multi-modal GeneratorsarXiv 2024ForecastBench: A Dynamic Benchmark of AI Forecasting CapabilitiesarXiv 2024M-RewardBench: Evaluating Reward Models in Multilingual SettingsarXiv 2024FlashVideo:Flowing Fidelity to Detail for Efficient High-Resolution Video GenerationarXiv 2025Pushing Mixture of Experts to the Limit: Extremely Parameter Efficient MoE for Instruction TuningarXiv 2023FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPUarXiv 2023Chinese Open Instruction Generalist: A Preliminary ReleasearXiv 2023AltCLIP: Altering the Language Encoder in CLIP for Extended Language CapabilitiesarXiv 2022Low-Complexity Acoustic Echo Cancellation with Neural Kalman FilteringarXiv 2022A Closer Look at GAN Priors: Exploiting Intermediate Features for Enhanced Model Inversion AttacksarXiv 2024Parameter-free Online Test-time AdaptationCVPR 2022 1UniDet3D: Multi-dataset Indoor 3D Object DetectionarXiv 2024PM-LLM-Benchmark: Evaluating Large Language Models on Process Mining TasksarXiv 2024TalkingGaussian: Structure-Persistent 3D Talking Head Synthesis via Gaussian SplattingarXiv 2024Hybrid Global-Local Representation with Augmented Spatial Guidance for Zero-Shot Referring Image SegmentationCVPR 2025 1GSO: Challenging Software Optimization Tasks for Evaluating SWE-AgentsarXiv 2025UniTEX: Universal High Fidelity Generative Texturing for 3D ShapesarXiv 2025Reloc3r: Large-Scale Training of Relative Camera Pose Regression for Generalizable, Fast, and Accurate Visual LocalizationCVPR 2025 1CLIP-Guided Generative Networks for Transferable Targeted Adversarial AttacksarXiv 2024Future-conditioned Unsupervised Pretraining for Decision TransformerarXiv 2023MambaMIM: Pre-training Mamba with State Space Token Interpolation and its Application to Medical Image SegmentationarXiv 2024Scaling Diffusion Transformers to 16 Billion ParametersarXiv 2024Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion ModelsarXiv 2024tinyBenchmarks: evaluating LLMs with fewer examplesarXiv 2024Evolution of Heuristics: Towards Efficient Automatic Algorithm Design Using Large Language ModelarXiv 2024LegalNLP -- Natural Language Processing methods for the Brazilian Legal LanguagearXiv 2021Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine TranslationarXiv 2024Generative World ExplorerarXiv 2024Data Scaling Laws in Imitation Learning for Robotic ManipulationarXiv 2024FuseChat: Knowledge Fusion of Chat ModelsarXiv 2024FantasyID: Face Knowledge Enhanced ID-Preserving Video GenerationarXiv 2025Reangle-A-Video: 4D Video Generation as Video-to-Video TranslationarXiv 2025RARE: Retrieval-Augmented Reasoning Enhancement for Large Language ModelsarXiv 2024Training-Free Activation Sparsity in Large Language ModelsarXiv 2024UP-VLA: A Unified Understanding and Prediction Model for Embodied AgentarXiv 2025OrcaLoca: An LLM Agent Framework for Software Issue LocalizationarXiv 2025TransFusion: Generating Long, High Fidelity Time Series using Diffusion Models with TransformersarXiv 2023Unsupervised Cross-lingual Representation Learning at Scaleunsupervised-cross-lingual-representation-2Going Denser with Open-Vocabulary Part SegmentationICCV 2023 1A Whac-A-Mole Dilemma: Shortcuts Come in Multiples Where Mitigating One Amplifies OthersCVPR 2023 1VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and InterpretationACL 2021 5Spirit LM: Interleaved Spoken and Written Language ModelarXiv 2024VICReg: Variance-Invariance-Covariance Regularization for Self-Supervised Learningvicreg-variance-invariance-covariance-1Autoregressive Search Engines: Generating Substrings as Document IdentifiersarXiv 2022Beyond A*: Better Planning with Transformers via Search Dynamics BootstrappingarXiv 2024Flow Matching on General GeometriesarXiv 2023Exploring Simple Siamese Representation LearningCVPR 2021 1Open-Canopy: Towards Very High Resolution Forest MonitoringCVPR 2025 1Toward Generalized Image Quality Assessment: Relaxing the Perfect Reference Quality AssumptionCVPR 2025 1Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AIarXiv 2021Hiera: A Hierarchical Vision Transformer without the Bells-and-WhistlesarXiv 2023HyperReel: High-Fidelity 6-DoF Video with Ray-Conditioned SamplingCVPR 2023 1Instance-Conditioned GANNeurIPS 2021 12KILT: a Benchmark for Knowledge Intensive Language TasksNAACL 2021 4Language Models as Knowledge Bases?language-models-as-knowledge-bases-1LayerSkip: Enabling Early Exit Inference and Self-Speculative DecodingarXiv 2024Masked Autoencoders As Spatiotemporal LearnersarXiv 2022Is Heuristic Sampling Necessary in Training Deep Object Detectors?arXiv 2019Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context Reflectionreflect-dit-inference-time-scaling-for-textMultiview Compressive Coding for 3D ReconstructionCVPR 2023 1Memory Layers at ScalearXiv 2024MetaICL: Learning to Learn In ContextNAACL 2022 7MIND: Benchmarking Memory Consistency and Action Control in World ModelsarXiv 2026MLQA: Evaluating Cross-lingual Extractive Question Answeringmlqa-evaluating-cross-lingual-extractive-1DreamRenderer: Taming Multi-Instance Attribute Control in Large-Scale Text-to-Image ModelsICCV 2025Generating Multi-Image Synthetic Data for Text-to-Image CustomizationICCV 2025PACO: Parts and Attributes of Common ObjectsCVPR 2023 1Omni3D: A Large Benchmark and Model for 3D Object Detection in the WildCVPR 2023 1OrienterNet: Visual Localization in 2D Public Maps with Neural MatchingCVPR 2023 1PIFuHD: Multi-Level Pixel-Aligned Implicit Function for High-Resolution 3D Human Digitizationpifuhd-multi-level-pixel-aligned-implicit-1Pearl: A Production-ready Reinforcement Learning AgentarXiv 2023Motif: Intrinsic Motivation from Artificial Intelligence FeedbackarXiv 2023An Empirical Study of Training Self-Supervised Vision TransformersICCV 2021 10Scaling Language-Image Pre-training via MaskingCVPR 2023 1Distilling Knowledge from Reader to Retriever for Question Answeringdistilling-knowledge-from-reader-to-retrieverThinkless: LLM Learns When to ThinkarXiv 2025Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent SpacearXiv 2025EFM3D: A Benchmark for Measuring Progress Towards 3D Egocentric Foundation ModelsarXiv 2024The Web Is Your Oyster -- Knowledge-Intensive NLP against a Very Large Web CorpusarXiv 2021DocAgent: A Multi-Agent System for Automated Code Documentation GenerationarXiv 2025Dense Passage Retrieval for Open-Domain Question AnsweringEMNLP 2020 11Digitizing Touch with an Artificial Multimodal FingertiparXiv 2024A Picture is Worth More Than 77 Text Tokens: Evaluating CLIP-Style Models on Dense CaptionsCVPR 2024 1Inferring and Executing Programs for Visual Reasoninginferring-and-executing-programs-for-visual-1CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Dataccnet-extracting-high-quality-monolingual-1Byte Latent Transformer: Patches Scale Better Than TokensarXiv 20248-bit Optimizers via Block-wise Quantization8-bit-optimizers-via-block-wise-quantization-1OmniAudio: Generating Spatial Audio from 360-Degree VideoarXiv 2025Striped Attention: Faster Ring Attention for Causal TransformersarXiv 2023AgentDAM: Privacy Leakage Evaluation for Autonomous Web AgentsarXiv 2025AdvPrompter: Fast Adaptive Adversarial Prompting for LLMsarXiv 2024ReNO: Enhancing One-step Text-to-Image Models through Reward-based Noise OptimizationarXiv 2024Active Image IndexingarXiv 2022Long Context Transfer from Language to VisionarXiv 2024FaceFormer: Speech-Driven 3D Facial Animation with TransformersCVPR 2022 1CAD-Editor: A Locate-then-Infill Framework with Automated Training Data Synthesis for Text-Based CAD EditingarXiv 2025Vector-ICL: In-context Learning with Continuous Vector RepresentationsarXiv 2024AutoScraper: A Progressive Understanding Web Agent for Web Scraper GenerationarXiv 2024MemeCap: A Dataset for Captioning and Interpreting MemesarXiv 2023Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMsarXiv 2024Large Language Models for Code: Security Hardening and Adversarial TestingarXiv 2023Beyond Memorization: Violating Privacy Via Inference with Large Language ModelsarXiv 2023MathDial: A Dialogue Tutoring Dataset with Rich Pedagogical Properties Grounded in Math Reasoning ProblemsarXiv 2023Benchmarking Positional Encodings for GNNs and Graph TransformersarXiv 2024Incidents1M: a large-scale dataset of images with natural disasters, damage, and incidentsarXiv 2022Unsupervised Learning of Sentence Embeddings using Compositional n-Gram Featuresunsupervised-learning-of-sentence-embeddings-1Unraveling Downstream Gender Bias from Large Language Models: A Study on AI Educational Writing AssistancearXiv 2023KID-PPG: Knowledge Informed Deep Learning for Extracting Heart Rate from a SmartwatcharXiv 2024A New Era in Software Security: Towards Self-Healing Software via Large Language Models and Formal VerificationarXiv 2023Grammar-Constrained Decoding for Structured NLP Tasks without FinetuningarXiv 2023Flows: Building Blocks of Reasoning and Collaborating AIarXiv 2023X-LoRA: Mixture of Low-Rank Adapter Experts, a Flexible Framework for Large Language Models with Applications in Protein Mechanics and Molecular DesignarXiv 2024Parameter-efficient Model Adaptation for Vision TransformersarXiv 2022Rethinking the Value of Network Pruningrethinking-the-value-of-network-pruning-1TurnGPT: a Transformer-based Language Model for Predicting Turn-taking in Spoken DialogFindings of the Association for Computational Linguistics 2020Point-SLAM: Dense Neural Point Cloud-based SLAMICCV 2023 1Generative Modeling by Estimating Gradients of the Data Distributiongenerative-modeling-by-estimating-gradients-1SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equationssdedit-guided-image-synthesis-and-editingTEOChat: A Large Vision-Language Assistant for Temporal Earth Observation DataarXiv 2024Deepfake Video Detection Using Generative Convolutional Vision TransformerarXiv 2023Learning Deep Semantics for Test CompletionarXiv 2023Compositional Visual Generation with Composable Diffusion ModelsarXiv 2022ChatCounselor: A Large Language Models for Mental Health SupportarXiv 2023DeeperForensics-1.0: A Large-Scale Dataset for Real-World Face Forgery Detectiondeeperforensics-1-0-a-large-scale-dataset-forSupervised Learning with Quantum-Inspired Tensor NetworksarXiv 2016MetaDE: Evolving Differential Evolution by Differential EvolutionarXiv 2025Publicly Available Clinical BERT Embeddingspublicly-available-clinical-bert-embeddings-1An Embodied Generalist Agent in 3D WorldarXiv 2023TSLANet: Rethinking Transformers for Time Series Representation LearningarXiv 2024Learning high-level visual representations from a child's perspective without strong inductive biasesarXiv 2023Bayesian active learning for production, a systematic study and a reusable libraryarXiv 2020PHNNs: Lightweight Neural Networks via Parameterized Hypercomplex Convolutionslightweight-convolutional-neural-networks-by-1Multi-Layer Visual Feature Fusion in Multimodal LLMs: Methods, Analysis, and Best PracticesCVPR 2025 1EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understandingegoschema-a-diagnostic-benchmark-for-veryGLEE: A Unified Framework and Benchmark for Language-based Economic EnvironmentsarXiv 2024The Geometry of Concepts: Sparse Autoencoder Feature StructurearXiv 2024SAM3D: Zero-Shot 3D Object Detection via Segment Anything ModelarXiv 2023LEACE: Perfect linear concept erasure in closed formNeurIPS 2023 11SciER: An Entity and Relation Extraction Dataset for Datasets, Methods, and Tasks in Scientific DocumentsarXiv 2024Fast Inference of Mixture-of-Experts Language Models with OffloadingarXiv 2023Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMsarXiv 2024Skywork Open Reasoner 1 Technical ReportarXiv 2025Text Clustering as Classification with LLMsarXiv 2024Text2NeRF: Text-Driven 3D Scene Generation with Neural Radiance FieldsarXiv 2023ContraBAR: Contrastive Bayes-Adaptive Deep RLarXiv 2023Magic Mirror: ID-Preserved Video Generation in Video Diffusion TransformersarXiv 2025Lyra: An Efficient and Speech-Centric Framework for Omni-CognitionICCV 2025DPC: Unsupervised Deep Point Correspondence via Cross and Self ConstructionarXiv 20213DMOTFormer: Graph Transformer for Online 3D Multi-Object TrackingICCV 2023 1LLM4SR: A Survey on Large Language Models for Scientific ResearcharXiv 2025Federated PCA on Grassmann Manifold for IoT Anomaly DetectionarXiv 2024Lossy Image Compression with Quantized Hierarchical VAEsarXiv 2022Restore Anything with Masks: Leveraging Mask Image Modeling for Blind All-in-One Image RestorationarXiv 2024Incremental Transformer Structure Enhanced Image Inpainting with Masking Positional EncodingCVPR 2022 1SciLitLLM: How to Adapt LLMs for Scientific Literature UnderstandingarXiv 2024Progressive Disentangled Representation Learning for Fine-Grained Controllable Talking Head SynthesisCVPR 2023 1Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language ModelsCVPR 2025 1Estimator Meets Equilibrium Perspective: A Rectified Straight Through Estimator for Binary Neural Networks TrainingICCV 2023 1Can LLM be a Personalized Judge?arXiv 2024MolGrapher: Graph-based Visual Recognition of Chemical StructuresICCV 2023 1ReConcile: Round-Table Conference Improves Reasoning via Consensus among Diverse LLMsarXiv 2023Recurrent Variational Network: A Deep Learning Inverse Problem Solver applied to the task of Accelerated MRI ReconstructionCVPR 2022 1RoMe: Towards Large Scale Road Surface Reconstruction via Mesh RepresentationarXiv 2023Just Add $π$! Pose Induced Video Transformers for Understanding Activities of Daily LivingarXiv 2023RetGen: A Joint framework for Retrieval and Grounded Text Generation ModelingarXiv 2021DreamScene4D: Dynamic Multi-Object Scene Generation from Monocular VideosarXiv 2024CAMS: An Annotated Corpus for Causal Analysis of Mental Health Issues in Social Media PostsLREC 2022 6A Novel Sampling Scheme for Text- and Image-Conditional Image Synthesis in Quantized Latent SpacesarXiv 2022Active Test-Time Adaptation: Theoretical Analyses and An AlgorithmarXiv 2024SAM3D: Segment Anything Model in Volumetric Medical ImagesarXiv 2023The Topology and Geometry of Neural RepresentationsarXiv 2023NExT-QA:Next Phase of Question-Answering to Explaining Temporal ActionsarXiv 2021DNA-Rendering: A Diverse Neural Actor Repository for High-Fidelity Human-centric RenderingICCV 2023 1Involution: Inverting the Inherence of Convolution for Visual RecognitionCVPR 2021 1Seeing the Future, Perceiving the Future: A Unified Driving World Model for Future Generation and PerceptionarXiv 2025Retrosynthetic Planning with Dual Value NetworksarXiv 2023Mish: A Self Regularized Non-Monotonic Activation FunctionBMVC 2020 8Attacking Cooperative Multi-Agent Reinforcement Learning by Adversarial Minority InfluencearXiv 2023

Back to Papers