-
Multi-Agent Computer Use
Paper • 2606.01533 • Published • 6 -
OpenSkill: Open-World Self-Evolution for LLM Agents
Paper • 2606.06741 • Published • 29 -
Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills
Paper • 2606.07412 • Published • 13 -
Bayesian-Agent: Posterior-Guided Skill Evolution for LLM Agent Harnesses
Paper • 2606.08348 • Published • 16
Collections
Discover the best community collections!
Collections including paper arxiv:2609.01591
-
ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research
Paper • 2606.07591 • Published • 106 -
SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research
Paper • 2606.09730 • Published • 56 -
DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch
Paper • 2606.10728 • Published • 37 -
Towards Diverse Scientific Hypothesis Search with Large Language Models
Paper • 2606.10587 • Published • 2
-
ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search
Paper • 2609.13356 • Published • 263 -
StudentSim: Training LLM-based Student Simulators
Paper • 2609.01591 • Published • 493 -
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
Paper • 2609.03430 • Published • 187
-
HuggingFaceFW/finetranslations
Viewer • Updated • 3.33B • 38.2k • 303 -
LLM-Inference-Bench: Inference Benchmarking of Large Language Models on AI Accelerators
Paper • 2411.00136 • Published -
The Illusion of Readiness in Health AI
Paper • 2509.18234 • Published • 1 -
The Roots of Performance Disparity in Multilingual Language Models: Intrinsic Modeling Difficulty or Design Choices?
Paper • 2601.07220 • Published
-
Multi-Agent Computer Use
Paper • 2606.01533 • Published • 6 -
OpenSkill: Open-World Self-Evolution for LLM Agents
Paper • 2606.06741 • Published • 29 -
Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills
Paper • 2606.07412 • Published • 13 -
Bayesian-Agent: Posterior-Guided Skill Evolution for LLM Agent Harnesses
Paper • 2606.08348 • Published • 16
-
ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search
Paper • 2609.13356 • Published • 263 -
StudentSim: Training LLM-based Student Simulators
Paper • 2609.01591 • Published • 493 -
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
Paper • 2609.03430 • Published • 187
-
ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research
Paper • 2606.07591 • Published • 106 -
SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research
Paper • 2606.09730 • Published • 56 -
DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch
Paper • 2606.10728 • Published • 37 -
Towards Diverse Scientific Hypothesis Search with Large Language Models
Paper • 2606.10587 • Published • 2
-
HuggingFaceFW/finetranslations
Viewer • Updated • 3.33B • 38.2k • 303 -
LLM-Inference-Bench: Inference Benchmarking of Large Language Models on AI Accelerators
Paper • 2411.00136 • Published -
The Illusion of Readiness in Health AI
Paper • 2509.18234 • Published • 1 -
The Roots of Performance Disparity in Multilingual Language Models: Intrinsic Modeling Difficulty or Design Choices?
Paper • 2601.07220 • Published