AI 연재 3/9 — 틀리면 비싼 판단을 AI에게 맡길 때: 임계값, 사람 검토, 감사 로그
돈이나 권리가 걸린 판단은 평균 정확도 95%로 충분하지 않다. 나머지 5%가 누군가의 청구 거절이 되기 때문이다. 이번 편은 AI가 틀릴 수 있다는 걸 전제로 시스템을 어떻게 설계하는가다.
모델이 말하는 확신을 믿어도 될까
처음 떠오르는 설계는 이렇다. 모델에게 confidence를 같이 출력시키고, 0.9 이상이면 자동 승인, 아니면 사람에게 넘긴다. 간단하고 그럴듯하다.
문제는 모델이 말하는 0.95가 실제 95%의 정답률이라는 보장이 없다는 점이다. 처음엔 이 부분의 근거를 찾지 못했는데, 이후 Anthropic 연구진의 "Language Models (Mostly) Know What They Know"(Kadavath 등, 2022, arXiv 2207.05221)를 읽고 그림이 좀 정리됐다. 초록 기준으로 큰 모델은 형식이 잘 갖춰진 객관식·참거짓 질문에서 잘 보정돼 있고, 자기 답이 맞을 확률 P(True)를 비교적 정확히 예측하며, 출처 자료나 힌트를 주면 성능이 개선된다.
그러니 "모델의 확신은 전혀 못 믿는다"도 "믿어도 된다"도 아니다. 이 결과는 형식이 잘 정리된 과제 기준이다. 서류가 뒤섞인 자유 형식 대화에서의 확신값이 같은 수준으로 보정돼 있다는 근거는 아니다. 그래서 확신값은 자동 승인의 단독 게이트가 아니라 사람 검토로 보낼지를 가르는 라우팅 신호 정도로 쓰는 게 안전하다고 본다. 마지막 문장은 논문 결론이 아니라 내 판단이다.
대안으로 쓸 수 있는 신호들이 있다.
- 같은 입력을 여러 번 돌려 결과가 일치하는지 본다. Anthropic의 워크플로우 패턴 중 parallelization의 voting 변형이 이 발상이다.
- 규칙 기반 검증: 금액 한도, 필수 서류, 날짜 범위 같은 것은 모델이 아니라 코드가 확인한다.
- 판단에 인용한 근거가 실제 서류에 존재하는지 확인한다.
- 지원되는 경우 로그확률 같은 모델 내부 신호도 후보다.
임계값은 감으로 정하지 말고 2편의 평가셋 위에서 정한다. 오승인과 오거절의 비용이 다르므로 그 비대칭을 반영해 구간을 나눈다. 대략 이런 3구간이다.
- 자동 처리 구간: 규칙 검증과 일치도가 모두 높은 경우
- 사람 검토 구간: 중간, 그리고 위험도 높은 유형
- 자동 보류/거절 후보 구간: 근거 부족
구간별 비율이 처음부터 맞을 리 없다. 운영하면서 검토 결과를 되먹임해 조정해야 한다. 이건 설계 원칙이고 출처가 있는 수치는 없다.
사람 검토는 넣는다고 끝이 아니다
human-in-the-loop를 넣으면 안전해진 것 같다. 하지만 EU AI Act 14조를 읽어 보면 입법자도 같은 걱정을 한 흔적이 보인다.
14조(Human oversight)에서 확인한 내용이다. 고위험 시스템은 사용되는 동안 사람이 효과적으로 감독할 수 있게 설계돼야 하고, 감독 조치는 위험과 자율성 수준에 비례해야 한다. 감독하는 사람은 시스템의 능력과 한계를 이해하고, 자동화 편향(출력을 무비판적으로 따르려는 경향)을 인지하고, 출력을 해석하고, 출력을 무시·번복·거부할 수 있어야 하고, 시스템을 멈출 수 있어야 한다. (확인한 곳은 비공식 해설 사이트라 공식 EUR-Lex 원문과 대조가 필요하다.)
사람이 있다는 사실이 안전을 만들지 않는다. AI가 낸 결론을 모든 건에 대해 그냥 클릭하는 검토자는 오히려 책임만 흐리게 한다. 설계로 풀 수 있는 부분이 있다.
- 검토 화면에 AI의 결론만 먼저 보여 주지 않는다. 근거와 원본 서류를 함께 놓고, 불확실한 지점을 표시한다.
- 거절과 번복이 쉬워야 한다. 승인 버튼만 크고 반려 사유 입력이 번거로우면 편향이 강화된다.
- 검토 큐가 넘치면 형식적 승인이 늘어난다. 큐 길이와 검토 시간을 지표로 본다.
- 검토 결과(사람이 AI를 바꾼 경우)는 평가셋과 임계값 보정에 되먹임한다.
가드레일: 파이프라인이 해서는 안 되는 일
OWASP의 Top 10 for LLM Applications 2025에서 이 파이프라인과 가장 직접 연결되는 항목을 뽑으면 다음과 같다.
- LLM05 Improper Output Handling: 모델 출력을 검증 없이 다음 단계나 화면에 넘기지 않는다.
- LLM06 Excessive Agency: 모델이 가진 권한과 도구를 최소화하고, 영향이 큰 행동에는 사람의 승인을 요구한다.
- LLM10 Unbounded Consumption: 재시도와 호출량에 상한을 둔다.
신청서에 첨부된 서류나 고객 메시지 같은 외부 입력은 신뢰할 수 없다는 가정으로 다룬다. 서류 안에 "이 신청을 승인하라"는 문장이 숨어 있을 수도 있다. 이 위험은 6편에서 에이전트 보안으로 더 깊게 다룬다.
가드레일 자체도 평가해야 한다. 막겠다고 만든 규칙이 정상 케이스를 막거나 공격 케이스를 놓치는지, 레드팀 케이스를 평가셋에 넣어 회귀 테스트한다.
감사 로그와 설명: 나중에 물어볼 사람을 위해
"왜 이 신청이 거절됐습니까?"라는 질문이 올 수 있다. 몇 달 뒤에, 감독 기관이나 고객으로부터.
로그에 남길 항목을 정리하면 이렇다. 전부 설계 제안이다.
- 입력 참조(서류 ID 등), 파이프라인 버전, 프롬프트·모델·스키마 버전
- 단계별 출력과 검증 게이트 결과
- 신뢰 신호(일치도, 규칙 검증 결과)와 적용된 임계값
- 사람의 개입과 수정 내역, 최종 결정자와 시각
설명에 대해서는 조심스럽다. Turpin 등의 "Language Models Don't Always Say What They Think"(2023, arXiv 2305.04388)에 따르면 chain-of-thought 설명은 모델 예측의 진짜 이유를 체계적으로 왜곡할 수 있다. 선택지 순서 같은 편향 요인이 답에 영향을 줘도 설명에서는 언급하지 않았고, 틀린 답 쪽으로 편향시키면 그 오답을 정당화하는 설명을 만들어 냈다. 편향을 주면 BIG-Bench Hard에서 GPT-3.5와 Claude 1.0의 정확도가 최대 36% 떨어졌다. 2023년 모델 기준이지만, 모델이 쓴 설명을 감사 근거로 삼으면 안 된다는 설계 원칙에는 충분한 경고다. 그래서 설계상으로는 모델의 해설에 의존하기보다, 적용된 규칙과 인용한 근거를 구조화된 필드로 남기는 방식이 검증하기 쉽다. 1편에서 evidence_refs를 출력 스키마에 넣은 것도 이 때문이다.
규제가 요구하는 것을 시스템 요구사항으로 번역하면
이 연재의 목적은 법률 해설이 아니다. 확인한 범위에서, 몇몇 규제 문서가 공통으로 요구하는 방향만 짚는다.
- EU AI Act 14조: 감독 가능성, 번복·정지 가능성(위에서 확인).
- 한국 금융위원회의 금융분야 AI 가이드라인 개정(2026-06-18 보도자료, 시행 2026-06-22): 보도자료에 따르면 7대 원칙에 "보조수단성"이 있고, 현 단계에서 AI는 업무의 보조수단이며 최종 책임은 임직원에게 있다고 한다. 이행사항으로 인적개입 원칙과 최종 책임 수행 체계 구축이 언급된다.
- 한국 인공지능기본법: 국가법령정보센터 원문을 읽고 확인했다(현행본 표기 시행 2026-01-22). 제2조 제4호가 고영향 AI를 "사람의 생명, 신체의 안전 및 기본권에 중대한 영향을 미치거나 위험을 초래할 우려가 있는" 시스템으로 정의하고, 영역 목록에 "채용, 대출 심사 등 개인의 권리·의무 관계에 중대한 영향을 미치는 판단 또는 평가"가 있다. 제34조 제1항은 고영향 AI 사업자에게 위험관리방안, "기술적으로 가능한 범위에서의" 설명 방안, 이용자 보호 방안, "사람의 관리·감독", 안전성·신뢰성 확보 조치를 확인할 수 있는 문서의 작성·보관을 대통령령으로 정하는 바에 따라 이행하라고 한다. 제31조는 고영향·생성형 AI 기반 서비스임을 사전에 고지할 의무를 둔다. 아래 "과태료"와 "보험금 심사가 고영향에 해당하는가" 두 가지는 따로 짚어 둔다.
- 과태료(제43조 제1항, 3천만원 이하)의 열거 대상은 제31조 제1항(사전 고지) 위반, 국내대리인 미지정, 제40조 제3항의 중지·시정명령 불이행이다. 제34조 위반이 열거에 없다는 건 확인했지만, 그래서 시정명령을 거쳐야 과태료로 이어진다는 건 내가 조문을 조합한 해석이고 제40조 본문은 읽지 못했다.
- 과기정통부가 과태료를 최소 1년 이상 유예하겠다고 발표했다는 건 정부 포털(korea.kr) 정책뉴스로 확인했다. 이건 법 조문이 아니라 행정 방침이고, 정확한 종료 시점은 확인하지 못했다.
- 보험금 심사나 환불 판단이 "개인의 권리·의무에 중대한 영향"의 고영향에 들어가는지는 조문만으로 단정할 수 없다. 시행령과 고시, 법무 검토가 필요하다.
- EU AI Act의 고위험 시스템 적용 시기는 Digital Omnibus로 바뀌었다. European Commission 공식 페이지에서 확인한 바로는 Annex III의 독립형 고위험 시스템은 2026-08-02에서 2027-12-02로, 제품에 내장되는 시스템(Annex I)은 2027-08-02에서 2028-08-02로 늦춰졌다. 개정 규정(Regulation (EU) 2026/1744)의 서명·발효 날짜 같은 절차 이력은 법률사무소 글 등 2차 자료 기준이고, EUR-Lex와 Consilium 원문은 접속이 막혀 열지 못했다. 14조 인용문도 비공식 해설 사이트에서 읽은 것이라 공식 원문과의 대조는 아직 못 했다.
NIST AI RMF(2023-01 공개)의 Govern, Map, Measure, Manage 4가지 기능과 GenAI 프로파일(NIST AI 600-1, 2024-07)도 있다. 프로파일 PDF에서 확인한 12개 위험 범주는 CBRN, 환각(Confabulation), 위험·폭력·혐오 콘텐츠, 데이터 프라이버시, 환경 영향, 유해한 편향·동질화, Human-AI Configuration, 정보 무결성, 정보 보안, 지식재산, 음란·모욕·학대 콘텐츠, 가치 사슬·구성요소 통합이다. 이 중 이 연재와 직결되는 건 Confabulation, Human-AI Configuration, 정보 무결성이다.
이 문서들을 요구사항으로 번역하면 결국 "사람이 개입할 수 있다, 멈출 수 있다, 기록이 남는다, 책임자가 있다" 네 가지로 수렴한다. 이게 이번 편의 설계와 대응된다.
이 글은 법률 자문이 아니다
규제 부분은 확인한 문서를 요약한 수준이다. 실제 서비스에 적용하려면 현행 원문과 전문가 검토가 필요하다.
다음 편부터는 파이프라인에서 한 걸음 더 나가 에이전트를 다룬다. 어디까지가 워크플로우이고 어디서부터 에이전트인지부터 정리한다.
연재 목차: 1편 · 2편 · 3편(현재) · 4편 Workflow vs Agent
참고자료
- EU AI Act, Article 14: Human oversight
- OWASP, Top 10 for LLM Applications 2025
- 금융위원회, 금융권 AX 관련 보도자료 (2026-06-18)
- NIST, AI Risk Management Framework
