- Uncertainty-Aware End-to-End AI Weather Forecasting: Disentangling Observation and Model Contributions
- DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection
- WebWorld: The Browser as a World Model for Self-Improving Web Code
- LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation
- Verification-Aware Training for Speculative Decoding
- Lies We Can See: Joint Verbal and Non-Verbal Deception by VLM Agents in Embodied Social Interactions
- Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation
- PaperBanana-Interact: Scientific Diagram Refinement with Multi-Turn Human Feedback
- Normalized Low-Rank Adaptation
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability
- CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents
- CogEvol: Towards Efficient and Reliable Learning Environment Generation
- Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling
- DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution
- BLARM: Animating 3D Objects from Video via Blending Latent Rigid Motion Primitives
- MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents
- Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents
- Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence
- PaperGym: Rubric-Centered Evolution for Research-Plan Generation
- Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
- MMMMM: A Unified Taxonomy for Investigating the Mechanisms of Multilingual MultiModal Misinformation
- SpanCalib-VLM: Calibrated Hallucination Span Detection in Vision-Language Models
- ContextBias: Controlled Evaluation of Bias Persistence Under Context Shift in Text-to-Image Models
- Matrix-Game 3.5: Enhancing Real-Time Streaming Interactive World Models with Patch Memory
- Cross-lingual Functional Vectors for Emotion Detection in Large Language Models
- NutriTrack: Multimodal AI Food Recognition with USDA RAG Nutrition Lookup
- EvoGenUI-Bench: Evaluating LLMs as Multi-Turn Generative UI Assistants
- Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered
- SafeAtlas-VL: Beyond Binary Multimodal Safety with Large-Scale Data and Guard Models
- Chat-Edit-3D++: Interactive 3D and 4D Scene Editing via Large Language Models
- Super Library Agent: Joint Generation and Maintenance of Multiple Applications Beyond the Single Codebase
- Dynamic Important Example Mining for Reinforcement Finetuning
- GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling
- Evaluating the Hidden Costs of Personalization in Large Language Models
- Acquire, Repair, Preserve: A Diagnosis-Guided Post-Training Recipe for Small-Model Dialogue Game Agents
- EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses
- Sliding-window beats linear attention
- Hy4 preview
- LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering
- Agentic Artifact Creation: Systems, Evaluation, Principles, and Opportunities
- Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding
- LayerRecall: A State-Conditioned Memory Router for Long-Horizon Consistency in Video Generation
- OpenStamp: A Watermark for Open-Source Language Models
- Video Generative Models as Geometry Learner
- Rubric-to-Code Credit Assignment for Reinforcement Learning
- Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge
- ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL
- Weaving Visual Narratives: Agentic Image Bundle Composition Beyond Atomic Visual Matching
- Generative Semantic Scene Completion
- Deterministic multi-hash routing supports long-horizon training in a compact language model
- Fast Weight Attention for Continual Learning
- Ring Forcing: Towards Precise Long-Term Memory for Autoregressive Video Diffusion
- Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
- J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero Data
- Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction
- Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
- Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning
- LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics
- CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes
- EditaLive! Unified Character Video Editing for Live Streaming
- PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
- Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
- WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
- Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning
- Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning
- Magpie: Real-Time World Renderer for Interactive Games
- Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
- UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City
- TTPO: Test-Time Policy Optimization
- PAWBench: How Far Are We from Probabilistically Aligned World Modeling?
- What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents
- GGSS: Geodesic-Gated Spherical Steering for Inference-Time Debiasing of Generative Vision-Language Models
- Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents
- LMSM: LLM Security Framework Inspired by Linux Security Modules
- TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback
- CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval
- Procedura: Agentic 3D Modeling with Procedural Control
- Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models
- Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
- Prefix Sliding for efficient test-time scaling
- Skill Issue: Are Skills Language-Invariant in LLMs?
- D'Agnese DIF-FNO: Diffeomorphic Implicit Fourier Neural Operators with Topological Guarantees on Non-Convex Domains
- SureRoute: Toward a Hallucination-Free Self-Improving Platform for Retrosynthesis
- RetrievalRouter: Joint Modality and Architecture Selection for Document Retrieval
- MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization
- Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
- VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
- A Programming Paradigm for Spatiotemporal Composability
- StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models
- V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning
- Code World Model: Coding Agent as World Brain
- VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
- JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
- GLM-5.3-Flash: Frontier Intelligence, Flash Cost
- Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation
- Granite 4.2 LLMs: How They're Built
- StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
- StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing
- PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control
- Luce: Relightable Gaussians for 3D Asset Generation