
도구
첫 단추 잘못 꿰면 끝장, 멀티턴 AI 에이전트 평가법 AEM 등장
- AI 에이전트 대화가 길어질 때 초기 턴에서 하나 틀리면 이후 턴까지 싹 다 오염되는 문제 알지?
- AWS에서 이걸 해결하려고 대화 턴별로 정확도를 세분화해서 평가하는 AEM(Agent Evaluation Metric)을 선보였어.
- 어느 턴에서 실수가 발생했는지, 그리고 그 실수를 승계받은 턴이 어디인지 정확히 범인을 찾아내 줘.
- 복잡한 멀티턴 에이전트 만들 때 디버깅이랑 성능 개선 효율을 획기적으로 올려줄 듯!
AWS ML Blog원문 보기

