IntelligenceLab/Long-Horizon-Terminal-Bench Benchmark β’ Updated 26 days ago β’ 46 β’ 8.85k β’ 133
Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning Paper β’ 2607.18722 β’ Published Jul 21 β’ 37
Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable Paper β’ 2607.13285 β’ Published Jul 14 β’ 236
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading Paper β’ 2607.08964 β’ Published Jul 9 β’ 78
Graph of Skills: Dependency-Aware Structural Retrieval for Massive Agent Skills Paper β’ 2604.05333 β’ Published Apr 7 β’ 24
VisPlay: Self-Evolving Vision-Language Models from Images Paper β’ 2511.15661 β’ Published Nov 19, 2025 β’ 45
R-Zero: Self-Evolving Reasoning LLM from Zero Data Paper β’ 2508.05004 β’ Published Aug 7, 2025 β’ 135
A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges Paper β’ 2501.02189 β’ Published Jan 4, 2025 β’ 1
Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning Paper β’ 2607.18722 β’ Published Jul 21 β’ 37