AI·자동화 트렌드
AI 에이전트 승인 게이트, 개수 아니라 '위치'가 답이다
AI 에이전트 인간 승인(Human-in-the-loop) 설계법 — 게이트는 개수가 아니라 위치입니다
승인 카드가 슬랙에 쌓입니다. 첫 주에는 다들 열어보고, 셋째 주에는 제목만 보고 누르죠. 사고는 정확히 그 지점에서 납니다.
AI 에이전트의 인간 승인은 되돌릴 수 없거나 조직 밖으로 나가는 행동에만 걸어야 합니다. 나머지는 놓아주세요. 승인 게이트를 늘릴수록 각 게이트의 실질 강도는 떨어집니다. 이 글은 그 위치를 정하는 기준을 다룹니다.
Human-in-the-loop(HITL)이란 무엇인가요?
에이전트가 행동을 실행하기 전에 사람의 승인·수정을 거치도록 설계에 심어둔 구조입니다. 헷갈리는 세 모드를 먼저 갈라두면 논의가 빨라져요.
Human-in-the-loop은 에이전트가 멈춰 서서 기다립니다. 승인이 없으면 실행 자체가 없어요. Human-on-the-loop은 에이전트가 먼저 실행하고 사람은 지켜보다 중단·롤백합니다. 완전자동화(Human-out-of-the-loop)에서 사람은 사후 로그로만 만나고요. 셋은 우열 관계가 아니라 작업별 선택지입니다. 에이전트 하나 안에서 세 모드가 섞이는 게 정상이에요.
| 운영 모드 | 사람의 역할 | 대표 실패 모드 |
|---|---|---|
| Human-in-the-loop | 실행 전 승인·수정 | 승인 피로, 형식적 통과 |
| Human-on-the-loop | 실행 후 감시·중단 | 되돌리기 전에 외부 전파 |
| 완전자동화 | 사후 로그 감사 | 실패 누적을 늦게 발견 |
왜 지금 에이전트에 승인 설계가 필요한가요?
에이전트가 글을 쓰는 단계에서 도구를 실행하는 단계로 넘어왔기 때문입니다. 텍스트 생성의 실패는 오타지만, 도구 실행의 실패는 발송된 메일이고 삭제된 레코드예요.
Anthropic은 에이전트 설계 지침에서 도구 실행 경로에 사람 체크포인트를 두고 에이전트가 스스로 멈추는 조건을 명시하라고 권합니다.1 OpenAI는 에이전트 거버넌스 문서에서 행동 공간 제한, 자동 모니터링, 중단 가능성(interruptibility)을 실천 항목으로 제시했고요.2 두 문서의 방점은 "모델을 더 똑똑하게"가 아니라 "실행 권한을 어떻게 나눌 것인가"에 찍혀 있습니다.
승인 게이트를 다 걸면 왜 위험한가요?
승인이 무의미해집니다. 안전해지는 게 아니라요.
인지공학에서는 이 현상을 자동화 편향이라고 부릅니다. 사람이 자동화 시스템의 제안을 과신해 자기 검증을 생략하는 경향으로, 항공·의료에서 오래 연구돼 왔어요.3 자동화 보조가 붙은 환경에서는 오류가 두 방향으로 늘어납니다. 시스템이 알려주지 않은 문제를 사람도 놓치는 누락 오류(omission), 시스템의 잘못된 제안을 그대로 받아들이는 수용 오류(commission)입니다.4 승인 버튼 하나로 둘 다 막을 수는 없습니다.
보충. EU 인공지능법 제14조는 고위험 AI의 인간 감독 조치를 규정하면서, 감독자가 자동화 편향을 인지하도록 하는 것을 요구 사항에 명시적으로 넣었습니다.5 규제조차 "사람을 붙였다"는 사실만으로는 감독으로 인정하지 않는다는 뜻이에요.
어떤 작업에 승인을 걸어야 하나요?
축은 둘뿐입니다. 가역성과 영향 범위.
가역성은 "10초 안에 원상복구되는가"로 묻습니다. 초안 문서는 지우면 끝이니 가역적이고, 고객에게 나간 메일은 회수 버튼이 있어도 이미 읽혔을 수 있으니 비가역이에요. 영향 범위는 "실패가 조직 밖으로 나가는가"입니다. 내부 노션 페이지와 결제 API 호출을 같은 등급에 두면 안 됩니다.
AX Lab은 에이전트 워크플로를 설계할 때 이 두 축을 되돌림 3등급(Reversibility Tiering) 으로 정리해 씁니다. 아래 등급 경계는 관측된 통계가 아니라 설계 기준값이에요. 팀 사정에 맞게 조정하되, 조정한 값을 문서에 남기는 게 핵심입니다.
| 등급 | 판단 기준 | 개입 형태 |
|---|---|---|
| R1 | 되돌림 10초 이내 + 영향 범위 내부 | 승인 없이 자동 실행, 로그만 기록 |
| R2 | 되돌릴 수 있으나 비용·흔적 발생 | 실행 후 감시, 중단·롤백 버튼 필수 |
| R3 | 되돌릴 수 없음 또는 외부 전파 | 실행 전 승인, 승인자·시각 기록 |
등급을 나눴는데 왜 여전히 형식적으로 통과될까요?
승인 화면이 판단할 재료를 안 주기 때문입니다. R3 게이트가 실제로 작동하려면 조건 세 가지가 붙어요.
첫째, 승인 화면에 무엇이 어떻게 바뀌는지 변경 차이가 보여야 합니다. "실행할까요?"만 뜨는 창은 승인이 아니라 확인 버튼이에요. 둘째, 거절이 실제로 일어나야 합니다. 한 달간 거절·수정이 0%인 게이트는 이미 형식이니 R2로 내리세요. 셋째, 승인 이력이 남아야 합니다. 누가 언제 무엇을 통과시켰는지 없으면 사후 개선의 출발점이 사라집니다.
언제 승인을 없애고 자동화로 넘어가나요?
거절률이 기준입니다. 특정 R3 작업에서 최근 30일·최소 30건의 승인 이력 중 거절·수정이 0에 가깝다면, 사람은 판단하는 게 아니라 통과시키고 있는 겁니다. 그때 R2로 내리고 롤백 경로를 대신 강화하세요.
거절이 잦다면 게이트를 그대로 두지 말고 원인을 고치세요. 프롬프트인지, 도구 권한 범위인지, 입력 데이터 품질인지. 승인 단계는 문제를 막아주지만 고쳐주지는 않아요. 🙂
NIST AI 리스크 관리 프레임워크도 인간-AI 구성(Human-AI Configuration)을 별도 관리 항목으로 두고, 누가 어떤 권한으로 개입하는지 역할과 책임을 문서화하라고 요구합니다.6 자동화 확대는 신뢰의 문제가 아니라 기록의 문제입니다.
한눈 요약
- 승인 게이트는 개수가 아니라 위치로 설계하세요. 비가역·외부 전파 행동에만 겁니다.
- 판단 축은 가역성(10초 복구 가능한가)과 영향 범위(조직 밖으로 나가는가) 둘입니다.
- R1은 자동 실행, R2는 실행 후 감시와 롤백, R3는 실행 전 승인으로 나눕니다.
- 게이트 작동 조건은 변경 차이 노출, 실제 거절 발생, 승인 이력 보존 세 가지입니다.
- 30일·30건 기준 거절률이 0에 수렴하면 그 게이트는 R2로 내립니다.
에이전트 도입 회의를 열기 전에 팀 작업 목록을 R1·R2·R3로 한 번 나눠보세요. 그 한 장이 자동화 로드맵의 첫 페이지가 됩니다.
AX Lab은 비개발자 실무자를 대상으로 5시간 만에 결과물 하나를 완성하는 클로드 바이브 코딩 원데이 클래스를 운영합니다. 자세한 안내는 axlab.dosanprivate.com에서 확인하세요.
FAQ
Q. Human-in-the-loop과 Human-on-the-loop의 차이가 뭔가요? A. 개입 시점입니다. in-the-loop은 실행 전에 멈춰 승인을 받고, on-the-loop은 실행 후 감시하다 중단·롤백합니다. 되돌릴 수 있는 작업이면 on-the-loop을 기본값으로 두고, 비가역·외부 전파 작업만 in-the-loop으로 올리세요.
Q. 승인 단계가 많으면 자동화 효과가 사라지지 않나요? A. 사라집니다. 그래서 위치로 설계해요. 되돌림 10초 이내이면서 영향이 내부에 머무는 작업(R1)은 승인 대상에서 빼고, R3만 남기세요.
Q. 승인자가 내용을 안 보고 누르는 문제는 어떻게 막나요? A. 승인 화면에 변경 차이를 노출하고, 거절률을 운영 지표로 추적하세요. 자동화 편향은 개인의 성실성 문제가 아니라 설계로 다뤄야 할 구조적 현상입니다.3
Q. 처음 도입할 때 가장 흔한 실수는 뭔가요? A. 모든 단계에 승인을 걸고 시작하는 겁니다. 몇 주면 전원이 제목만 보고 누르게 되고, 그렇게 쌓인 승인 로그는 감사 자료로도 쓰기 어려워집니다.
출처
Footnotes
-
Anthropic, 『Building Effective Agents』 (Anthropic Engineering, 2024). 에이전트 워크플로 설계에서 사람 체크포인트와 중단 조건을 권고. https://www.anthropic.com/engineering/building-effective-agents ↩
-
OpenAI, 『Practices for Governing Agentic AI Systems』 (2023). 행동 공간 제한, 자동 모니터링, 중단 가능성 등 에이전트 거버넌스 실천 항목. https://openai.com/index/practices-for-governing-agentic-ai-systems/ ↩
-
Parasuraman, R. & Riley, V., "Humans and Automation: Use, Misuse, Disuse, Abuse", 『Human Factors』 제39권 2호 (1997). 자동화 과신(overreliance) 개념의 고전 연구. ↩ ↩2
-
Skitka, L. J., Mosier, K. L. & Burdick, M., "Does automation bias decision-making?", 『International Journal of Human-Computer Studies』 제51권 5호 (1999). 자동화 보조 환경에서의 누락 오류·수용 오류 관찰. ↩
-
EU 인공지능법(AI Act) 제14조 「Human oversight」. 고위험 AI 감독자의 자동화 편향 인지 요건 포함. https://artificialintelligenceact.eu/article/14/ ↩
-
NIST, 『AI Risk Management Framework (AI RMF 1.0)』 (2023). 인간-AI 구성 및 감독 역할·책임의 문서화 요구. https://www.nist.gov/itl/ai-risk-management-framework ↩