KR EN

좋은 'AI 에이전트' 의 기준은 무엇인가

좋은 AI 에이전트의 가치는 자율성이 아닌 완수 능력에 있습니다.

AI 에이전트란 단순히 답변을 생성하는 대규모 언어 모델(LLM)과 구분하여 가치를 판단합니다.
그렇기 때문에 '어떤 AI가 더 똑똑한가?' 가 아니라 사용자의 의도를 정확히 이해하고, 맡은 업무를 신뢰할 수 있는 결과로 완수 하는가에 대한 기준이 필요합니다.

좋은 AI 에이전트를 판단하는 3가지 기준에 대해서 정리해보겠습니다.

첫째, 성공 조건이 명확해야 한다.

좋은 AI 에이전트는 요청에 답하는 시스템이 아니라 나와 합의된 완료 조건을 충족해야 합니다.
목표를 구체적인 작업으로 나누고, 무엇을 완료로 볼 것인지 정의합니다. 따라서, 성과도 답변의 유창함이 아니라 업무 완료율, 오류율, 사람의 개입률, 처리 비용과 시간으로 평가해야 합니다. 이를 완료 조건 이라고 합니다.

예를 들어 고객 문의 처리 에이전트의 목표는 단순히 답변을 작성하는 것이 아닙니다. 고객의 의도를 파악하고, 정확한 정보를 조회해 문제를 해결하며, 처리 내용을 기록하는 것까지 포함해야 합니다. 그리고 스스로 해결할 수 없는 문의는 담당자에게 필요한 정보와 함께 이관해야 한다.

이처럼 에이전트의 성공은 ‘내가 원하는 상태로 실제 업무가 끝났는지 판단해야 합니다.‘

둘째, 긴 작업에서도 상태와 방향을 유지해야 한다.

에이전트는 완료한 단계와 남은 작업, 사용한 근거와 실패 원인을 기억해야 합니다.

예를 들어, 회사의 마케팅 업무를 지원하는 AI 에이전트 라고 가정해봅시다. 타깃 설정, 콘텐츠 제작, 채널별 집행, 성과 분석 중 어떤 단계까지 진행했는지 관리할줄 알아야 합니다. 예상보다 반응이 낮을 경우엔 채널과 소재별 데이터를 분석하고, 실행 계획을 다시 제안할줄 알아야 합니다. 이 과정에서 예산 변경이나 브랜드 판단이 필요하다면 근거와 선택지를 정리해 마케터에게 검토를 요청할 수 있어야 합니다.
즉, 결과가 예상과 다르면 계획을 수정하고, 스스로 해결할 수 없을 때는 사람에게 통제권을 넘겨야 합니다. 그 이유는 순간적인 추론 능력과 장기적인 완수 능력은 다르기 때문입니다.

셋째, 실행 과정과 판단 근거를 확인할 수 있어야 합니다.

좋은 AI 에이전트는 최종 결과만 보여주는 시스템이 아닙니다. 사용한 정보와 도구, 권한 요청, 실패와 재시도 과정, 실제 업무 환경에 반영된 결과까지 기록해 성능을 개선할 수 있어야 합니다.

Anthropic의 에이전트 평가 가이드는 실행 기록을 출력, 도구 호출, 중간 결과와 상호작용이 담긴 전체 과정으로 설명하고, 작업이 끝난 뒤 실제 환경에 남은 결과는 별도로 검증해야 한다고 봅니다.

출처: Anthropic Demystifying evals for AI agents

즉, 에이전트의 성능은 어떤 과정을 거쳐 ‘실제로 무엇을 완료 했는지’로 평가해야 합니다.

Experience the Unexperienced

팔레트는 AI 에이전트의 경쟁력은 모델의 크기보다 업무 완수의 신뢰성과 통제 가능성, 경제성에서 결정된다고 생각합니다. 최근, 많은 LLM이 앞다투어 새로운 모델을 출시합니다. LLM은 에이전트를 구성하는 하나의 요소일 뿐입니다.
새로운 모델을 선택하기 전에 에이전트가 맡을 업무와 완료 조건, 권한의 범위, 결과를 검증하는 방법부터 명확히 해야 합니다.

팔레트는 AI가 무엇을 할 수 있는지 보여주는 데서 멈추지 않습니다. 우리 업무에서 AI가 책임지는 것, 완수하는 과정을 함께 설계합니다. AI가 무엇을 할 수 있는지를 넘어, 우리 업무에서 무엇을 책임지고 끝까지 완수해야 하는지 팔레트와 함께 설계해 보세요.

  • #AI
  • #agent
  • #AI_agent
Contact Experience Agent Experience Creative