Skip to content
81

When LLM Agents Meet Reinforcement Learning

Awesome List for Agentic RL

1.9k stars74 forks407 entriesLast push Sep 15, 2026 (14 days ago)License none

This page lists names, links and short descriptions. The original list on GitHub is the source and belongs to its authors.

Base Framework

Libra

NetX Lab

Molt

NVIDIA (NeMo Labs)

In 2 lists

Orchard

Microsoft

AgentJet

ModelScope (Alibaba)

HarnessX

Darwin-Agent

Dressage

Accio-Lab

AReno

Ant Group (inclusionAI)

Polar

NVIDIA (NeMo)

uni-agent

verl-project

VeRL-Omni

verl-project

OpenClaw-RL

Gen-Verse

Claw-R1

USTC

Open-AgentRL

Gen-Verse

NeMo-RL

NVIDIA

In 3 lists

RLinf

Tsinghua/Infinigence AI/PKU

In 3 lists

siiRL

Shanghai Innovation Institute

slime

Tsinghua University (THUDM)

In 5 listsDetails

agent-lightning

Microsoft Research

In 3 lists

AReaL

AntGroup/Tsinghua

In 2 lists

ROLL

Alibaba

In 2 lists

MARTI

Tsinghua

Tunix

Google

RL2

Accio

In 2 lists

verifiers

Individual

prime-rl

Prime Intellect

In 3 lists

oat

NUS/Sea AI

veRL

ByteDance

In 3 lists

OpenRLHF

OpenRLHF

In 4 listsDetails

trl

HuggingFace

In 8 listsDetails

Click to view technical details

Libra

NetX Lab

Orchard

Microsoft

AReno

Ant Group (inclusionAI)

Molt

NVIDIA (NeMo Labs)

In 2 lists

AgentJet

ModelScope (Alibaba)

HarnessX

Darwin-Agent

Dressage

Accio-Lab

Polar

NVIDIA (NeMo)

uni-agent

verl-project

VeRL-Omni

verl-project

OpenClaw-RL

Gen-Verse

Claw-R1

USTC

Open-AgentRL

Gen-Verse

NeMo-RL

NVIDIA

In 3 lists

RLinf

Tsinghua/Infinigence AI/PKU

In 3 lists

siiRL

Shanghai Innovation Institute

slime

Tsinghua University (THUDM)

In 5 listsDetails

agent-lightning

Microsoft Research

In 3 lists

AReaL

AntGroup/Tsinghua

In 2 lists

ROLL

Alibaba

In 2 lists

MARTI

Tsinghua

Tunix

Google

RL2

Accio

In 2 lists

verifiers

Individual

prime-rl

Prime Intellect

In 3 lists

oat

NUS/Sea AI

veRL

ByteDance

In 3 lists

OpenRLHF

OpenRLHF

In 4 listsDetails

trl

HuggingFace

In 8 listsDetails

General/MultiTask

T2PO

Academic (ICML 2026 Spotlight)

StraTA

Shanghai AI Lab / Oxford / Multi-institution

SDAR

Zhejiang University (ZJU-REAL)

SkillZero

Zhejiang University (ZJU-REAL)

MetaClaw

UNC-Chapel Hill (AIMING Lab)

In 2 lists

SkillRL

UNC-Chapel Hill (AIMING Lab)

LLM-in-Sandbox

RUC/MSRA/THU

youtu-agent

Tencent Youtu Lab

In 4 listsDetails

DEPO

HKUST/SJTU

SPEAR

Tencent Youtu Lab

DeepAgent

RUC/Xiaohongshu

AgentRL

Tsinghua

AgentGym-RL

Fudan University

Agent_Foundation_Models

OPPO Personal AI Lab

Trinity-RFT

Alibaba

SPA-RL-Agent

PolyU

verl-agent

NTU/Skywork

SkyRL

UC Berkeley / NovaSky-AI

In 2 lists

VAGEN

Northwestern University (mll-lab-nu)

ART

OpenPipe

In 3 lists

OpenManus-RL

UIUC/MetaGPT

In 2 lists

Click to view technical details

T2PO

Academic (ICML 2026 Spotlight)

StraTA

Shanghai AI Lab / Oxford / Multi-institution

SDAR

Zhejiang University (ZJU-REAL)

SkillZero

Zhejiang University (ZJU-REAL)

MetaClaw

UNC-Chapel Hill (AIMING Lab)

In 2 lists

SkillRL

UNC-Chapel Hill (AIMING Lab)

LLM-in-Sandbox

RUC/MSRA/THU

youtu-agent

Tencent Youtu Lab

In 4 listsDetails

DEPO

HKUST/SJTU

SPEAR

Tencent Youtu Lab

DeepAgent

RUC/Xiaohongshu

AgentRL

Tsinghua

AgentGym-RL

Fudan University

Agent_Foundation_Models

OPPO Personal AI Lab

Trinity-RFT

Alibaba

SPA-RL-Agent

PolyU

verl-agent

NTU/Skywork

SkyRL

UC Berkeley / NovaSky-AI

In 2 lists

VAGEN

Northwestern University (mll-lab-nu)

ART

OpenPipe

In 3 lists

OpenManus-RL

UIUC/MetaGPT

In 2 lists

Search & RAG Agent

EviSD

Academic

GTA-RAG

Academic (EMNLP'26 Findings)

LAPO

Academic

Harness-1

UIUC

SlimSearcher

Ant Group / ZJU

DeepRubric

Shandong University

SAAS

Xiamen University

CuSearch

Academic

GrepSeek

UMass Amherst (CIIR)

PyRAG

Academic

ORBIT

University of Waterloo

LiteResearcher

Simplex AI / ZJU / PolyU

DR-Venus

Ant Group (inclusionAI)

MR-Search

Academic

ProRAG

RUC

O-Researcher

OPPO PersonalAI Lab

Agentic-RAG-R1

PKU

In 2 lists

MemSearcher

CAS

DR Tulu

AI2 / UW / CMU / MIT

IGPO

Ant Group

ReSeek

Tencent PCG BAC/Tsinghua University

AutoGraph-R1

HKUST KnowComp

WebSeer

Individual

HiPRAG

Individual

Tree-GRPO

AMAP

DeepResearch

Alibaba/Tongyi Lab

In 2 lists

DeepDive

Tsinghua/THUDM

ASearcher

Ant Research RL Lab Tsinghua University & UW

SSRL

Tsinghua

Research-Venus

Ant Group

Graph-R1

BUPT/NTU/NUS

Kimi-Researcher

Moonshot AI

R-Search

Individual

R1-Searcher-plus

RUC

StepSearch

SenseTime

AutoRefine

USTC

ZeroSearch

Alibaba

ReasonRAG

CityU HK / Huawei

VRAG

USTC / Tongyi Lab, Alibaba

MaskSearch

Tongyi Lab, Alibaba

R3-RAG

Fudan NLP

O2-Searcher

KnowledgeXLab

s3

UIUC

knowledge-r1

CAS / UCAS

WebThinker

RUC

DeepResearcher

SJTU

Search-R1

UIUC/Google

In 2 lists

R1-Searcher

RUC

C-3PO

Alibaba

DeepRetrieval

UIUC

Click to view technical details

PyRAG

Academic

GrepSeek

UMass Amherst (CIIR)

LAPO

Academic

GTA-RAG

Academic (EMNLP'26 Findings)

EviSD

Academic

Harness-1

UIUC

SlimSearcher

Ant Group / ZJU

DeepRubric

Shandong University

SAAS

Xiamen University

CuSearch

Academic

ORBIT

University of Waterloo

LiteResearcher

Simplex AI / ZJU / PolyU

DR-Venus

Ant Group (inclusionAI)

MR-Search

Academic

ProRAG

RUC

O-Researcher

OPPO PersonalAI Lab

Agentic-RAG-R1

PKU

In 2 lists

MemSearcher

CAS

DR Tulu

AI2 / UW / CMU / MIT

IGPO

Ant Group

ReSeek

Tencent PCG BAC/Tsinghua University

AutoGraph-R1

HKUST KnowComp

WebSeer

Individual

HiPRAG

Individual

Tree-GRPO

AMAP

DeepResearch

Alibaba/Tongyi Lab

In 2 lists

DeepDive

Tsinghua/THUDM

ASearcher

Ant Research RL Lab Tsinghua University & UW

SSRL

Tsinghua

Research-Venus

Ant Group

Graph-R1

BUPT/NTU/NUS

Kimi-Researcher

Moonshot AI

R-Search

Individual

R1-Searcher-plus

RUC

StepSearch

SenseTime

AutoRefine

USTC

ZeroSearch

Alibaba

ReasonRAG

CityU HK / Huawei

VRAG

USTC / Tongyi Lab, Alibaba

MaskSearch

Tongyi Lab, Alibaba

R3-RAG

Fudan NLP

O2-Searcher

KnowledgeXLab

s3

UIUC

knowledge-r1

CAS / UCAS

WebThinker

RUC

DeepResearcher

SJTU

Search-R1

UIUC/Google

In 2 lists

R1-Searcher

RUC

C-3PO

Alibaba

DeepRetrieval

UIUC

Web & GUI Agent

SCALE-CUA

Tsinghua (THUDM)

OpenWebRL

UIUC / Microsoft Research

ToolCUA

Alibaba Tongyi Lab (X-PLUG)

ClawGUI

Zhejiang University (ZJU-REAL)

In 2 lists

OpAgent

Codefuse AI (Ant Group)

GUI-Libra

GUI-Libra (MS-affiliated)

MobileAgent

X-PLUG (TongyiQwen)

In 4 listsDetails

UI-TARS

ByteDance Seed

In 3 lists

MobileRL

Tsinghua / Zhipu AI (THUDM)

DART-GUI

Computer-use-agents

Mano-P

Mininglamp AI

InfiGUI-G1

InfiX AI

gui-rcpo

Zhejiang University

UI-AGILE

Xiamen University

GUI-G2

Zhejiang University (ZJU-REAL)

MagicGUI

Honor (MagicAgent-GUI)

Grounding-R1

Salesforce

AgentCPM-GUI

OpenBMB/Tsinghua/RUC

TTI

CMU

GTA1

Salesforce / ANU

SE-GUI

Nankai University/vivo

ARPO

CUHK/HKUST

GUI-G1

RUC

WebAgent-R1

Amazon/UVA

ZeroGUI

Shanghai AI Lab

GUI-R1

CAS/NUS

InfiGUI-R1

Zhejiang University

UI-R1

vivo/CUHK

CollabUIAgents

Tsinghua/Alibaba/HKUST

DigiQ

UC Berkeley/CMU/Amazon

GUI-Agent-RL

Microsoft

WebAgent

Alibaba

In 2 lists

Click to view technical details

SCALE-CUA

Tsinghua (THUDM)

OpenWebRL

UIUC / Microsoft Research

ToolCUA

Alibaba Tongyi Lab (X-PLUG)

ClawGUI

Zhejiang University (ZJU-REAL)

In 2 lists

OpAgent

Codefuse AI (Ant Group)

GUI-Libra

GUI-Libra (MS-affiliated)

MobileAgent

X-PLUG (TongyiQwen)

In 4 listsDetails

UI-TARS

ByteDance Seed

In 3 lists

MobileRL

Tsinghua / Zhipu AI (THUDM)

DART-GUI

Computer-use-agents

Mano-P

Mininglamp AI

InfiGUI-G1

InfiX AI

gui-rcpo

Zhejiang University

UI-AGILE

Xiamen University

GUI-G2

Zhejiang University (ZJU-REAL)

MagicGUI

Honor (MagicAgent-GUI)

Grounding-R1

Salesforce

AgentCPM-GUI

OpenBMB/Tsinghua/RUC

TTI

CMU

GTA1

Salesforce / ANU

SE-GUI

Nankai University/vivo

ARPO

CUHK/HKUST

GUI-G1

RUC

WebAgent-R1

Amazon/UVA

ZeroGUI

Shanghai AI Lab

GUI-R1

CAS/NUS

InfiGUI-R1

Zhejiang University

UI-R1

vivo/CUHK

CollabUIAgents

Tsinghua/Alibaba/HKUST

DigiQ

UC Berkeley/CMU/Amazon

GUI-Agent-RL

Microsoft

WebAgent

Alibaba

In 2 lists

Tool-Use Agent

Tool-RL-Box

Harbin Institute of Technology

SPADER

Zhejiang University

APPO

Alibaba AMAP (AMAP-ML)

AgenticQwen

Alibaba PAI

Agent-STAR

CUHK

ToolOrchestra

NVIDIA / HKU

ToolMaster

Northeastern University (NEUIR)

MATPO

MiroMind AI

AWorld-RL

Ant Group (inclusionAI)

CodeGym

Academic

UserRL

Salesforce AI Research

ToolBrain

ToolBrain (AAMAS 2026)

Tool-R1

Individual (YBYBZhang)

MiroRL

MiroMindAI

MUA-RL

Alibaba (Tongyi)

verl-tool

TIGER-Lab

Multi-Turn-RL-Agent

University of Minnesota

Tool-N1

NVIDIA

Tool-Star

RUC

RL-Factory

Simple-Efficient

In 2 lists

calculator_agent_rl

Individual (Danau5tin)

ReTool

ByteDance

ToolRL

UIUC

AWorld

Ant Group (inclusionAI)

In 2 lists

Agent-R1

USTC

In 2 lists

ReCall

BaiChuan

Click to view technical details

Tool-RL-Box

Harbin Institute of Technology

SPADER

Zhejiang University

APPO

Alibaba AMAP (AMAP-ML)

AgenticQwen

Alibaba PAI

Agent-STAR

CUHK

ToolOrchestra

NVIDIA / HKU

ToolMaster

Northeastern University (NEUIR)

MATPO

MiroMind AI

AWorld-RL

Ant Group (inclusionAI)

CodeGym

Academic

UserRL

Salesforce AI Research

ToolBrain

ToolBrain (AAMAS 2026)

Tool-R1

Individual (YBYBZhang)

MiroRL

MiroMindAI

verl-tool

TIGER-Lab

Multi-Turn-RL-Agent

University of Minnesota

Tool-N1

NVIDIA

Tool-Star

RUC

RL-Factory

Simple-Efficient

In 2 lists

calculator_agent_rl

Individual (Danau5tin)

ReTool

ByteDance

ToolRL

UIUC

AWorld

Ant Group (inclusionAI)

In 2 lists

Agent-R1

USTC

In 2 lists

ReCall

BaiChuan

Code & SWE Agent

Lego-RL

LegoX

FastContext

Microsoft

SWE-Edit

Microsoft Research

CodeScout

OpenHands

CUDA-Agent

ByteDance/Tsinghua

SWE-World

RUC (RUCAIBox)

LLM-in-Sandbox

RUC/MSRA/THU

CUDA-L2

DeepReinforce AI

PPP-Agent

CMU/OpenHands

DeepAnalyze

RUC/Tsinghua

In 8 listsDetails

RepoDeepSearch

PKU, Bytedance, BIT

CUDA-L1

DeepReinforce AI

SWE-Swiss

Tsinghua / ByteDance

MedAgentGym

Emory/Georgia Tech

In 2 lists

CURE

University of Chicago Princeton/ByteDance

Time-R1

UIUC

ML-Agent

MASWorks

In 2 lists

R1-Code-Interpreter

MIT

digitalhuman

Tencent

Skywork-OR1

Skywork AI

In 2 lists

sweet_rl

Meta/UCB

swe-rl

Meta/UIUC/CMU

In 2 lists

CTRL

HKU/ByteDance

AceCoder

Waterloo (TIGER-Lab)

rllm

Berkeley Sky Computing Lab BAIR / Together AI

open-r1

HuggingFace

In 3 lists

Click to view technical details

Lego-RL

LegoX

FastContext

Microsoft

SWE-Edit

Microsoft Research

CodeScout

OpenHands

CUDA-Agent

ByteDance/Tsinghua

SWE-World

RUC (RUCAIBox)

LLM-in-Sandbox

RUC/MSRA/THU

CUDA-L2

DeepReinforce AI

PPP-Agent

CMU/OpenHands

DeepAnalyze

RUC/Tsinghua

In 8 listsDetails

RepoDeepSearch

PKU, Bytedance, BIT

CUDA-L1

DeepReinforce AI

SWE-Swiss

Tsinghua / ByteDance

MedAgentGym

Emory/Georgia Tech

In 2 lists

CURE

University of Chicago Princeton/ByteDance

Time-R1

UIUC

ML-Agent

MASWorks

In 2 lists

R1-Code-Interpreter

MIT

digitalhuman

Tencent

Skywork-OR1

Skywork AI

In 2 lists

sweet_rl

Meta/UCB

swe-rl

Meta/UIUC/CMU

In 2 lists

CTRL

HKU/ByteDance

AceCoder

Waterloo (TIGER-Lab)

rllm

Berkeley Sky Computing Lab BAIR / Together AI

open-r1

HuggingFace

In 3 lists

Reasoning Agent

Agent0

UNC‑Chapel Hill / Salesforce Research / Stanford University

KG-R1

UIUC/Google

AgentFlow

Stanford University

In 2 lists

THOR

USTC / iFLYTEK

Tool-Light

RUC (RUC-NLPIR)

ARPO

RUC, Kuaishou

terminal-bench-rl

Individual (Danau5tin)

AutoTIR

Beihang University / BAAI

MOTIF

University of Maryland

cmriat/l0

CMRIAT

agent-distillation

KAIST

EasyR1

Individual

In 3 lists

AutoCoA

BJTU

ToRL

SJTU

ReMA

SJTU, UCL

Agentic-Reasoning

Oxford

SimpleTIR

NTU, Bytedance

openrlhf_async_pipline

OpenRLHF

Click to view technical details

Agent0

UNC‑Chapel Hill / Salesforce Research / Stanford University

KG-R1

UIUC/Google

AgentFlow

Stanford University

In 2 lists

THOR

USTC / iFLYTEK

Tool-Light

RUC (RUC-NLPIR)

ARPO

RUC, Kuaishou

terminal-bench-rl

Individual (Danau5tin)

AutoTIR

Beihang University / BAAI

MOTIF

University of Maryland

cmriat/l0

CMRIAT

agent-distillation

KAIST

EasyR1

Individual

In 3 lists

AutoCoA

BJTU

ToRL

SJTU

ReMA

SJTU, UCL

Agentic-Reasoning

Oxford

SimpleTIR

NTU, Bytedance

openrlhf_async_pipline

OpenRLHF

Multi-Agent RL

Maestro

Tsinghua / Multi-institution

DrMAS

NTU

MarsRL

Academic

PettingLLMs

Intel / UCSD

MASPRM

UBC / Huawei

MrlX

Ant Group (AQ-MedAI)

CoMAS

Shanghai AI Lab / CUHK / Oxford / NUS

MAPoRL

Academic

CoMLRL

OpenMLRL

ARIA

Fudan University

SPIRAL

NUS / A*STAR / Sea AI Lab

AMPO

Tongyi Lab, Alibaba

FlowReasoner

Sea AI Lab / NUS

MARFT

SII / SJTU

Click to view technical details

Maestro

Tsinghua / Multi-institution

DrMAS

NTU

MarsRL

Academic

PettingLLMs

Intel / UCSD

MASPRM

UBC / Huawei

MrlX

Ant Group (AQ-MedAI)

CoMAS

Shanghai AI Lab / CUHK / Oxford / NUS

MAPoRL

Academic

CoMLRL

OpenMLRL

ARIA

Fudan University

SPIRAL

NUS / A*STAR / Sea AI Lab

AMPO

Tongyi Lab, Alibaba

FlowReasoner

Sea AI Lab / NUS

MARFT

SII / SJTU

Memory

MemPrism

Academic

Supersede

Vrin

AgeMem

Multi-institution (incl. Alibaba DAMO)

Mem-alpha

UCSD / USTC

MEM1

MIT

M3-Agent

ByteDance Seed / Zhejiang University

Memento

UCL, Huawei

MemAgent

Bytedance, Tsinghua-SIA

Click to view technical details

MemPrism

Academic

Supersede

Vrin

AgeMem

Multi-institution (incl. Alibaba DAMO)

Mem-alpha

UCSD / USTC

MEM1

MIT

M3-Agent

ByteDance Seed / Zhejiang University

Memento

UCL, Huawei

MemAgent

Bytedance, Tsinghua-SIA

Embodied

REAL

InternRobotics

Embodied-R1.5

Tianjin University

AVA-VLA

UCAS

WorldVLN

Tsinghua (EmbodiedCity)

Embodied-R1

Tianjing University

VIKI-R

MARS-EAI (NeurIPS 2025 D&B)

STeCa

The Hong Kong Polytechnic University

Click to view technical details

REAL

InternRobotics

Embodied-R1.5

Tianjin University

AVA-VLA

UCAS

WorldVLN

Tsinghua (EmbodiedCity)

Embodied-R1

Tianjing University

VIKI-R

MARS-EAI (NeurIPS 2025 D&B)

STeCa

The Hong Kong Polytechnic University

Domain-Specific

FaithMed

CMU

Gene-Disease-Curation

Academic

MedSAM-Agent

CUHK/Tencent

ChemCraft

Peking University / IDEA

Doctor-R1

Tsinghua (thu-unicorn)

Alpha-R1

SJTU / FinStep.AI / StepFun

OS-R1

ISCAS

MMedAgent-RL

Unknown

MedResearcher-R1

Ant Group (AQ-MedAI)

LegalDelta

Northeastern University (NEUIR)

DoctorAgent-RL

UCAS/CAS/USTC

Biomni

Stanford University (SNAP)

In 2 lists

Click to view technical details

FaithMed

CMU

Gene-Disease-Curation

Academic

MedSAM-Agent

CUHK/Tencent

ChemCraft

Peking University / IDEA

Doctor-R1

Tsinghua (thu-unicorn)

Alpha-R1

SJTU / FinStep.AI / StepFun

OS-R1

ISCAS

MMedAgent-RL

Unknown

MedResearcher-R1

Ant Group (AQ-MedAI)

LegalDelta

Northeastern University (NEUIR)

DoctorAgent-RL

UCAS/CAS/USTC

Biomni

Stanford University (SNAP)

In 2 lists

Reward & Training Methodology

DRACO

CMU / IBM Research

Agent-G²

Zhejiang University / Baidu (EMNLP'26)

AgentV-RL

Academic

DataMind

Zhejiang University (ZJUNLP)

ARLArena

UCLA

Agent-RRM

Academic

ToolPRMBench

Arizona State University

RLVR-World

THU ML Group

AgentProg

MobileLLM

AgentPRM

Cornell

Agentic-Reward-Modeling

THU-KEG

AgentRM

THUNLP/Tsinghua

Click to view technical details

DRACO

CMU / IBM Research

Agent-G²

Zhejiang University / Baidu (EMNLP'26)

AgentV-RL

Academic

DataMind

Zhejiang University (ZJUNLP)

ARLArena

UCLA

Agent-RRM

Academic

ToolPRMBench

Arizona State University

RLVR-World

THU ML Group

AgentProg

MobileLLM

AgentPRM

Cornell

Agentic-Reward-Modeling

THU-KEG

AgentRM

THUNLP/Tsinghua

Safety

ToolSafe

Academic (MurrayTom)

TROJail

Academic (ACL 2026)

SafeSearch

Amazon Science

Jailbreak-R1

Academic (yuki-younai)

GuardReasoner-VL

NUS (yueliu1999)

xJailbreak

Academic

Auto-RT

ICIP-CAS

RLbreaker

Purdue

curiosity_redteam

MIT

Click to view technical details

ToolSafe

Academic (MurrayTom)

TROJail

Academic (ACL 2026)

SafeSearch

Amazon Science

Jailbreak-R1

Academic (yuki-younai)

GuardReasoner-VL

NUS (yueliu1999)

xJailbreak

Academic

Auto-RT

ICIP-CAS

RLbreaker

Purdue

curiosity_redteam

MIT

VLM Agent

InSight-doc

Academic (EMNLP'26)

VTS

UNC Chapel Hill / Sony

VSeek

UT Austin (SwarmLab)

HyperEyes

DeepExperience

ODE

HKUST / CUHK / PKU

ParaVT

NTU / HKU / Tsinghua / MiroMind (LMMs-Lab)

OpenSearch-VL

CUHK / NTU / HKU / Multi-institution

MTA-Agent

Salesforce AI Research

Gen-Searcher

Academic

MM-DeepResearch

Academic

PyVision-RL

agents-x-project

Vision-DeepResearch

Academic (ICML 2026)

ARM-Thinker

Shanghai AI Lab / InternLM

CodeDance

ByteDance

DeepEyesV2

Xiaohongshu

Mini-o3

Mini-o3 team

VisionThink

CUHK (dvlab-research)

multimodal-search-r1

ByteDance/NTU

AutoVLA

UCLA Mobility Lab

VDeepEyes

Xiaohongshu/XJTU

CoSo

NTU/Alibaba

Pixel-Reasoner

University of Waterloo (TIGER-AI-Lab)

Visual-ARFT

Shanghai AI Lab / SJTU

In 2 lists

VTool-R1

UIUC

OpenThinkIMG

Academic (zhaochen0110)

Chain-of-Focus

Multi-institution

GRIT

UC Santa Cruz (eric-ai-lab)

AlphaDrive

HUST/Horizon Robotics

VSC-RL

Liverpool/Huawei/Tianjin/UCL

RL4VLM

UC Berkeley

Click to view technical details

InSight-doc

Academic (EMNLP'26)

VTS

UNC Chapel Hill / Sony

VSeek

UT Austin (SwarmLab)

HyperEyes

DeepExperience

ODE

HKUST / CUHK / PKU

ParaVT

NTU / HKU / Tsinghua / MiroMind (LMMs-Lab)

OpenSearch-VL

CUHK / NTU / HKU / Multi-institution

MTA-Agent

Salesforce AI Research

Gen-Searcher

Academic

MM-DeepResearch

Academic

PyVision-RL

agents-x-project

Vision-DeepResearch

Academic (ICML 2026)

ARM-Thinker

Shanghai AI Lab / InternLM

CodeDance

ByteDance

DeepEyesV2

Xiaohongshu

Mini-o3

Mini-o3 team

VisionThink

CUHK (dvlab-research)

multimodal-search-r1

ByteDance/NTU

AutoVLA

UCLA Mobility Lab

VDeepEyes

Xiaohongshu/XJTU

CoSo

NTU/Alibaba

Pixel-Reasoner

University of Waterloo (TIGER-AI-Lab)

Visual-ARFT

Shanghai AI Lab / SJTU

In 2 lists

VTool-R1

UIUC

OpenThinkIMG

Academic (zhaochen0110)

Chain-of-Focus

Multi-institution

GRIT

UC Santa Cruz (eric-ai-lab)

AlphaDrive

HUST/Horizon Robotics

VSC-RL

Liverpool/Huawei/Tianjin/UCL

RL4VLM

UC Berkeley

Self-Evolution

AgentOPSD

Academic

BaT

NVIDIA (MONAI)

SEED

Academic (jinyangwu)

OPID

Academic (jinyangwu)

UCOB

Academic (TU2021)

SIRI

Academic

world-knowledge

HKUST / Tencent

ARISE

George Washington University

Tool-R0

UIUC / ETH Zurich

MemSkill

NTU/UIUC/UIC/Tsinghua

MemRL

SJTU/Xidian/NUS/USTC/MemTensor

AgentEvolver

Alibaba/Tongyi Lab

EvolveR

KnowledgeXLab / Shanghai AI Lab

SEAgent

Shanghai AI Lab / CUHK

R-Zero

Tencent AI Seattle Lab / WashU / UMD

Absolute-Zero-Reasoner

Tsinghua (LeapLabTHU) / BIGAI / PSU

RAGEN

RAGEN-AI

In 2 lists

WebRL

Tsinghua/Zhipu AI

Click to view technical details

BaT

NVIDIA (MONAI)

AgentOPSD

Academic

SEED

Academic (jinyangwu)

OPID

Academic (jinyangwu)

UCOB

Academic (TU2021)

SIRI

Academic

world-knowledge

HKUST / Tencent

ARISE

George Washington University

Tool-R0

UIUC / ETH Zurich

MemSkill

NTU/UIUC/UIC/Tsinghua

MemRL

SJTU/Xidian/NUS/USTC/MemTensor

AgentEvolver

Alibaba/Tongyi Lab

EvolveR

KnowledgeXLab / Shanghai AI Lab

SEAgent

Shanghai AI Lab / CUHK

R-Zero

Tencent AI Seattle Lab / WashU / UMD

Absolute-Zero-Reasoner

Tsinghua (LeapLabTHU) / BIGAI / PSU

RAGEN

RAGEN-AI

In 2 lists

WebRL

Tsinghua/Zhipu AI

Environment

PAST-Bench

Gen-Verse (NUS/Stanford/Oxford/Princeton)

DigiWorld

Meta (FAIR)

Evo-Bench

Renmin University (RUCAIBox)

ScrambleToolBench

NTU DeCLaRe Lab / A*STAR

SETA

CAMEL-AI.org

OpenAgent

Nanjing University (LAMDA-NeSy)

Echoverse

Microsoft Research

DocOps

Chinese Academy of Sciences (ICT)

PatientAgentBench

Amazon Science

LegalWorld

SII / Fudan DISC

MobileGym

Academic

AEnvironment

Ant Group (inclusionAI)

Gym-Anything

CMU L3 Lab

ClawBench

TIGER-AI Lab / NAIL Group

In 2 lists

OpenSandbox

Alibaba

In 2 lists

OpenEnv

Meta (PyTorch)

In 2 lists

open-trajectory-gym

Individual

Agent-World-Model

Snowflake AI Research

TermiGen

UCSB

VisGym

UC Berkeley

NeMo-Gym

NVIDIA

In 2 lists

VISTA-Gym

Texas A&M / Emory / KAUST

LoCoBench-Agent

Salesforce AI Research

Simia-Agent-Training

Microsoft

PaperArena

University of Science and Technology of China

enterprise-deep-research

Salesforce AI Research

In 2 lists

meta-agents-research-environments

Meta (FAIR)

BrowseComp-Plus

University of Waterloo

MCP-Bench

Accenture

MCPVerse

Individual

CompassVerifier

Shanghai AI Lab

tau2-bench

Sierra Research

Mind2Web-2

Ohio State University

MCP-Universe

Salesforce AI Research

gem

Sea AI Lab

MLE-Dojo

GIT, Stanford

R2E-Gym

UC Berkeley/ANU

SWE-smith

Princeton/Stanford/SWE-bench

atropos

Nous Research

InternBootcamp

InternBootcamp

loong

CAMEL-AI.org

DataSciBench

Tsinghua

reasoning-gym

open-thought

llmgym

tensorzero

SWE-Gym

UC Berkeley/UIUC/CMU/Apple

debug-gym

Microsoft Research

gym-llm

Rodrigo Sánchez Molina

AgentGym

Fudan

tau-bench

Sierra

In 2 lists

appworld

Stony Brook University

In 2 lists

android_world

Google Research

TheAgentCompany

CMU, Duke

In 2 lists

LlamaGym

Rohan Pandey

In 2 lists

visualwebarena

CMU

In 2 lists

LMRL-Gym

UC Berkeley

OSWorld

HKU, CMU, Salesforce, Waterloo

In 3 lists

webarena

CMU

In 2 lists

AgentBench

Tsinghua University

In 7 listsDetails

WebShop

Princeton-NLP

ScienceWorld

AllenAI

factorio-learning-environment

JackHopkins

alfworld

Microsoft, CMU, UW

jericho

Microsoft, GIT

TextWorld

Microsoft Research

In 2 lists

Under Review/Waiting for Open Source

Qwen-UI-Agent: Towards Next-Generation Real-World Centric Foundation GUI Agent

(Tongyi-MAI — repo released, but no RL training code)

Qwen-CUA

(xlang-ai — technical report + demo only, weights hosted separately)

UI-Mate

(Tencent — inference/eval code only)

SearchMaster

(training code marked "planned for release")

RoMeRL

(training code "being organized"; eval checkpoints only)

GroundCUA

(ServiceNow — training/ marked "Coming Soon")

Agon

SINKFLEX-RL

GRASP

MAVEN: Evidence-State Rewards

EviBack

ChemWorld

Test-Time Self-Evolving GUI Visual Grounding

CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution

(ACL 2026, AMAP/Alibaba — repo created but code not yet released)

JoyAgents-R1: Joint Evolution Dynamics for Versatile Multi-LLM Agents with Reinforcement Learning

Shop-R1: Rewarding LLMs to Simulate Human Behavior in Online Shopping via Reinforcement Learning

Training Long-Context, Multi-Turn Software Engineering Agents with Reinforcement Learning

Acting Less is Reasoning More! Teaching Model to Act Efficiently

Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning

ComputerRL: Scaling End-to-End Online Reinforcement Learning for Computer Use Agents

Understanding Tool-Integrated Reasoning

Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning

(2025) Arxiv

In 2 lists

Encouraging Good Processes Without the Need for Good Answers: Reinforcement Learning for LLM Agent Planning

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents

WebExplorer: Explore and Evolve for Training Long-Horizon Web Agents

EnvX: Agentize Everything with Agentic AI

UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning

UI-Venus Technical Report: Building High-performance UI Agents with RFT

Agent2 : An Agent-Generates-Agent Framework for Reinforcement Learning Automation

Adversarial Reinforcement Learning for Large Language Model Agent Safety

Learning to Refine: An Agentic RL Approach for Iterative SPARQL Query Construction

InfoFlow: Reinforcing Search Agent Via Reward Density Optimization

See category
94

Table of Contents

hesreallyhim/awesome-claude-code

A hand-picked collection of the finest of resources for the most awesome of agents, Claude Code, the undisputed champion of coding companions, from the unstoppable team…

Fresh★ 55k202 entriesPushed today
94

Awesome Agent Skills

VoltAgent/awesome-agent-skills

A curated collection of 1000+ agent skills from official dev teams and the community, compatible with Claude Code, Codex, Gemini CLI, Cursor, and more.

Fresh★ 35k839 entriesPushed today
93

Awesome Machine Learning

josephmisiti/awesome-machine-learning

A curated list of awesome Machine Learning frameworks, libraries and software.

Fresh★ 74k1188 entriesPushed 7 days ago
92

Awesome Production Machine Learning

EthicalML/awesome-production-machine-learning

A curated list of awesome open source libraries to deploy, monitor, version and scale your machine learning

Fresh★ 21k519 entriesPushed 3 days ago
92

AWESOME DATA SCIENCE

academic/awesome-datascience

:memo: An awesome Data Science repository to learn and apply for real world problems.

Fresh★ 30k881 entriesPushed today
91

Static Analysis

analysis-tools-dev/static-analysis

⚙️ A curated list of static analysis (SAST) tools and linters for all programming languages, config files, build tools, and more. The focus is on tools which improve…

Fresh★ 15k528 entriesPushed 8 days ago