Blog
Research writeups, experiments, and product notes.
11 min read
Let Your Agents Tinker with Research Papers
Reproducing self-distillation papers with autoresearch agents.
Rehaan Ahmad, Myles Anderson, Daniel Kim
16 min read
Reinforcing Recursive Language Models
RL fine-tuning small models to behave as recursive language models.
Daniel Kim, Rehaan Ahmad
16 min read
Evolution Strategies vs GRPO for LLM Fine-Tuning
An empirical comparison of Evolution Strategies and GRPO on reasoning tasks, examining data efficiency, model types, and population size.
Raj Palleti, Yuvraj Singh
17 min read
ArxivQA: Training Retrieval Agents for arXiv Search
Exploring RLVR and Rubric-as-Reward fine-tuning techniques for training retrieval agents on real-world research queries.
Rehaan Ahmad, Daniel Kim