Recent posts
[Agent] Evolving Procedural Memory from User Traffic for Agentic Graphic Design: weight update 없이 skill bank를 키워 그래픽 디자인 에이전트를 진화
[Agent] Evolving Procedural Memory from User Traffic for Agentic Graphic Design
[Agent] MENTOR: Teacher-Optimized Reward로 Tool-Use를 SLM에 distill하는 on-policy RL
[Agent] MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation
Agent Distillation
title: “[Agent] Agent Distillation: CoT가 아니라 ‘행동’을 증류해서 0.5B 모델을 도구 쓰는 에이전트로 만들기”