Skip to content

AI 연재 3/9 — 틀리면 비싼 판단을 AI에게 맡길 때: 임계값, 사람 검토, 감사 로그 ​

돈이나 권리가 걸린 판단은 평균 정확도 95%로 충분하지 않다. 나머지 5%가 누군가의 청구 거절이 되기 때문이다. 이번 편은 AI가 틀릴 수 있다는 걸 전제로 시스템을 어떻게 설계하는가다.


모델이 말하는 확신을 믿어도 될까 ​

처음 떠오르는 설계는 이렇다. 모델에게 confidence를 같이 출력시키고, 0.9 이상이면 자동 승인, 아니면 사람에게 넘긴다. 간단하고 그럴듯하다.

문제는 모델이 말하는 0.95가 실제 95%의 정답률이라는 보장이 없다는 점이다. 처음엔 이 부분의 근거를 찾지 못했는데, 이후 Anthropic 연구진의 "Language Models (Mostly) Know What They Know"(Kadavath 등, 2022, arXiv 2207.05221)를 읽고 그림이 좀 정리됐다. 초록 기준으로 큰 모델은 형식이 잘 갖춰진 객관식·참거짓 질문에서 잘 보정돼 있고, 자기 답이 맞을 확률 P(True)를 비교적 정확히 예측하며, 출처 자료나 힌트를 주면 성능이 개선된다.

그러니 "모델의 확신은 전혀 못 믿는다"도 "믿어도 된다"도 아니다. 이 결과는 형식이 잘 정리된 과제 기준이다. 서류가 뒤섞인 자유 형식 대화에서의 확신값이 같은 수준으로 보정돼 있다는 근거는 아니다. 그래서 확신값은 자동 승인의 단독 게이트가 아니라 사람 검토로 보낼지를 가르는 라우팅 신호 정도로 쓰는 게 안전하다고 본다. 마지막 문장은 논문 결론이 아니라 내 판단이다.

대안으로 쓸 수 있는 신호들이 있다.

  • 같은 입력을 여러 번 돌려 결과가 일치하는지 본다. Anthropic의 워크플로우 패턴 중 parallelization의 voting 변형이 이 발상이다.
  • 규칙 기반 검증: 금액 한도, 필수 서류, 날짜 범위 같은 것은 모델이 아니라 코드가 확인한다.
  • 판단에 인용한 근거가 실제 서류에 존재하는지 확인한다.
  • 지원되는 경우 로그확률 같은 모델 내부 신호도 후보다.

임계값은 감으로 정하지 말고 2편의 평가셋 위에서 정한다. 오승인과 오거절의 비용이 다르므로 그 비대칭을 반영해 구간을 나눈다. 대략 이런 3구간이다.

  • 자동 처리 구간: 규칙 검증과 일치도가 모두 높은 경우
  • 사람 검토 구간: 중간, 그리고 위험도 높은 유형
  • 자동 보류/거절 후보 구간: 근거 부족

구간별 비율이 처음부터 맞을 리 없다. 운영하면서 검토 결과를 되먹임해 조정해야 한다. 이건 설계 원칙이고 출처가 있는 수치는 없다.


사람 검토는 넣는다고 끝이 아니다 ​

human-in-the-loop를 넣으면 안전해진 것 같다. 하지만 EU AI Act 14조를 읽어 보면 입법자도 같은 걱정을 한 흔적이 보인다.

14조(Human oversight)에서 확인한 내용이다. 고위험 시스템은 사용되는 동안 사람이 효과적으로 감독할 수 있게 설계돼야 하고, 감독 조치는 위험과 자율성 수준에 비례해야 한다. 감독하는 사람은 시스템의 능력과 한계를 이해하고, 자동화 편향(출력을 무비판적으로 따르려는 경향)을 인지하고, 출력을 해석하고, 출력을 무시·번복·거부할 수 있어야 하고, 시스템을 멈출 수 있어야 한다. (확인한 곳은 비공식 해설 사이트라 공식 EUR-Lex 원문과 대조가 필요하다.)

사람이 있다는 사실이 안전을 만들지 않는다. AI가 낸 결론을 모든 건에 대해 그냥 클릭하는 검토자는 오히려 책임만 흐리게 한다. 설계로 풀 수 있는 부분이 있다.

  • 검토 화면에 AI의 결론만 먼저 보여 주지 않는다. 근거와 원본 서류를 함께 놓고, 불확실한 지점을 표시한다.
  • 거절과 번복이 쉬워야 한다. 승인 버튼만 크고 반려 사유 입력이 번거로우면 편향이 강화된다.
  • 검토 큐가 넘치면 형식적 승인이 늘어난다. 큐 길이와 검토 시간을 지표로 본다.
  • 검토 결과(사람이 AI를 바꾼 경우)는 평가셋과 임계값 보정에 되먹임한다.

가드레일: 파이프라인이 해서는 안 되는 일 ​

OWASP의 Top 10 for LLM Applications 2025에서 이 파이프라인과 가장 직접 연결되는 항목을 뽑으면 다음과 같다.

  • LLM05 Improper Output Handling: 모델 출력을 검증 없이 다음 단계나 화면에 넘기지 않는다.
  • LLM06 Excessive Agency: 모델이 가진 권한과 도구를 최소화하고, 영향이 큰 행동에는 사람의 승인을 요구한다.
  • LLM10 Unbounded Consumption: 재시도와 호출량에 상한을 둔다.

신청서에 첨부된 서류나 고객 메시지 같은 외부 입력은 신뢰할 수 없다는 가정으로 다룬다. 서류 안에 "이 신청을 승인하라"는 문장이 숨어 있을 수도 있다. 이 위험은 6편에서 에이전트 보안으로 더 깊게 다룬다.

가드레일 자체도 평가해야 한다. 막겠다고 만든 규칙이 정상 케이스를 막거나 공격 케이스를 놓치는지, 레드팀 케이스를 평가셋에 넣어 회귀 테스트한다.


감사 로그와 설명: 나중에 물어볼 사람을 위해 ​

"왜 이 신청이 거절됐습니까?"라는 질문이 올 수 있다. 몇 달 뒤에, 감독 기관이나 고객으로부터.

로그에 남길 항목을 정리하면 이렇다. 전부 설계 제안이다.

  • 입력 참조(서류 ID 등), 파이프라인 버전, 프롬프트·모델·스키마 버전
  • 단계별 출력과 검증 게이트 결과
  • 신뢰 신호(일치도, 규칙 검증 결과)와 적용된 임계값
  • 사람의 개입과 수정 내역, 최종 결정자와 시각

설명에 대해서는 조심스럽다. Turpin 등의 "Language Models Don't Always Say What They Think"(2023, arXiv 2305.04388)에 따르면 chain-of-thought 설명은 모델 예측의 진짜 이유를 체계적으로 왜곡할 수 있다. 선택지 순서 같은 편향 요인이 답에 영향을 줘도 설명에서는 언급하지 않았고, 틀린 답 쪽으로 편향시키면 그 오답을 정당화하는 설명을 만들어 냈다. 편향을 주면 BIG-Bench Hard에서 GPT-3.5와 Claude 1.0의 정확도가 최대 36% 떨어졌다. 2023년 모델 기준이지만, 모델이 쓴 설명을 감사 근거로 삼으면 안 된다는 설계 원칙에는 충분한 경고다. 그래서 설계상으로는 모델의 해설에 의존하기보다, 적용된 규칙과 인용한 근거를 구조화된 필드로 남기는 방식이 검증하기 쉽다. 1편에서 evidence_refs를 출력 스키마에 넣은 것도 이 때문이다.


규제가 요구하는 것을 시스템 요구사항으로 번역하면 ​

이 연재의 목적은 법률 해설이 아니다. 확인한 범위에서, 몇몇 규제 문서가 공통으로 요구하는 방향만 짚는다.

  • EU AI Act 14조: 감독 가능성, 번복·정지 가능성(위에서 확인).
  • 한국 금융위원회의 금융분야 AI 가이드라인 개정(2026-06-18 보도자료, 시행 2026-06-22): 보도자료에 따르면 7대 원칙에 "보조수단성"이 있고, 현 단계에서 AI는 업무의 보조수단이며 최종 책임은 임직원에게 있다고 한다. 이행사항으로 인적개입 원칙과 최종 책임 수행 체계 구축이 언급된다.
  • 한국 인공지능기본법: 국가법령정보센터 원문을 읽고 확인했다(현행본 표기 시행 2026-01-22). 제2조 제4호가 고영향 AI를 "사람의 생명, 신체의 안전 및 기본권에 중대한 영향을 미치거나 위험을 초래할 우려가 있는" 시스템으로 정의하고, 영역 목록에 "채용, 대출 심사 등 개인의 권리·의무 관계에 중대한 영향을 미치는 판단 또는 평가"가 있다. 제34조 제1항은 고영향 AI 사업자에게 위험관리방안, "기술적으로 가능한 범위에서의" 설명 방안, 이용자 보호 방안, "사람의 관리·감독", 안전성·신뢰성 확보 조치를 확인할 수 있는 문서의 작성·보관을 대통령령으로 정하는 바에 따라 이행하라고 한다. 제31조는 고영향·생성형 AI 기반 서비스임을 사전에 고지할 의무를 둔다. 아래 "과태료"와 "보험금 심사가 고영향에 해당하는가" 두 가지는 따로 짚어 둔다.
    • 과태료(제43조 제1항, 3천만원 이하)의 열거 대상은 제31조 제1항(사전 고지) 위반, 국내대리인 미지정, 제40조 제3항의 중지·시정명령 불이행이다. 제34조 위반이 열거에 없다는 건 확인했지만, 그래서 시정명령을 거쳐야 과태료로 이어진다는 건 내가 조문을 조합한 해석이고 제40조 본문은 읽지 못했다.
    • 과기정통부가 과태료를 최소 1년 이상 유예하겠다고 발표했다는 건 정부 포털(korea.kr) 정책뉴스로 확인했다. 이건 법 조문이 아니라 행정 방침이고, 정확한 종료 시점은 확인하지 못했다.
    • 보험금 심사나 환불 판단이 "개인의 권리·의무에 중대한 영향"의 고영향에 들어가는지는 조문만으로 단정할 수 없다. 시행령과 고시, 법무 검토가 필요하다.
  • EU AI Act의 고위험 시스템 적용 시기는 Digital Omnibus로 바뀌었다. European Commission 공식 페이지에서 확인한 바로는 Annex III의 독립형 고위험 시스템은 2026-08-02에서 2027-12-02로, 제품에 내장되는 시스템(Annex I)은 2027-08-02에서 2028-08-02로 늦춰졌다. 개정 규정(Regulation (EU) 2026/1744)의 서명·발효 날짜 같은 절차 이력은 법률사무소 글 등 2차 자료 기준이고, EUR-Lex와 Consilium 원문은 접속이 막혀 열지 못했다. 14조 인용문도 비공식 해설 사이트에서 읽은 것이라 공식 원문과의 대조는 아직 못 했다.

NIST AI RMF(2023-01 공개)의 Govern, Map, Measure, Manage 4가지 기능과 GenAI 프로파일(NIST AI 600-1, 2024-07)도 있다. 프로파일 PDF에서 확인한 12개 위험 범주는 CBRN, 환각(Confabulation), 위험·폭력·혐오 콘텐츠, 데이터 프라이버시, 환경 영향, 유해한 편향·동질화, Human-AI Configuration, 정보 무결성, 정보 보안, 지식재산, 음란·모욕·학대 콘텐츠, 가치 사슬·구성요소 통합이다. 이 중 이 연재와 직결되는 건 Confabulation, Human-AI Configuration, 정보 무결성이다.

이 문서들을 요구사항으로 번역하면 결국 "사람이 개입할 수 있다, 멈출 수 있다, 기록이 남는다, 책임자가 있다" 네 가지로 수렴한다. 이게 이번 편의 설계와 대응된다.

이 글은 법률 자문이 아니다

규제 부분은 확인한 문서를 요약한 수준이다. 실제 서비스에 적용하려면 현행 원문과 전문가 검토가 필요하다.


다음 편부터는 파이프라인에서 한 걸음 더 나가 에이전트를 다룬다. 어디까지가 워크플로우이고 어디서부터 에이전트인지부터 정리한다.

연재 목차: 1편 · 2편 · 3편(현재) · 4편 Workflow vs Agent

참고자료 ​

멸종 위기 개발자