AI 지식 · 심층 가이드
AI 지식 보안 & 윤리 완전 정리
프롬프트 인젝션과 PII 반출, 출력 가드레일, 저작권 리스크까지 LLM 기능을 외부에 공개하기 전에 반드시 점검해야 할 항목을 실무 관점으로 묶었습니다.
LLM 애플리케이션의 공격면은 기존 웹 서비스와 겹치지 않는 부분이 있습니다. 입력 검증을 아무리 해도 자연어는 통과시켜야 하고, 통과된 자연어가 곧 실행 지시가 될 수 있습니다. 신뢰 경계가 코드가 아니라 문장 안에 그어진다는 점이 다릅니다. 여기에 학습 데이터와 생성물의 권리 문제, 개인정보의 국경 밖 전송처럼 법무 영역과 겹치는 항목이 붙어서, 엔지니어링만으로 닫히지 않는 리스크가 남습니다.
AI 보안 위협 모델이 인젝션과 탈옥, 데이터 추출을 한 장의 지도로 펼쳐 놓습니다. 그중 실제 사고로 이어지는 빈도가 높은 쪽이 개인정보(PII) 처리와 GDPR인데, 로그와 프롬프트 양쪽에 개인정보가 남는 경로를 자주 놓칩니다. 방어의 실행 계층은 AI 출력 검증과 가드레일이고, 이 방어가 실제로 버티는지는 AI 레드팀 테스트로 공격해 봐야 알 수 있습니다. 코드 생성 기능을 제품에 넣는다면 AI 저작권과 법적 이슈를 먼저 확인하는 편이 낫습니다.
가드레일을 입력 쪽에만 두는 구성이 흔한데, 실제 피해는 출력에서 발생합니다. 모델이 만들어 낸 문자열이 그대로 HTML로 렌더링되면 그 안의 스크립트나 링크가 살아나고, 도구 호출 인자로 흘러가면 파일 경로나 쿼리가 됩니다. 즉 LLM 출력은 사용자 입력과 같은 등급의 비신뢰 데이터로 다뤄야 합니다. 개인정보 쪽에서는 마스킹을 프롬프트 조립 직전에만 적용하고 요청 로그와 트레이싱 도구에는 원문이 그대로 쌓이는 구성이 자주 발견됩니다. 관찰성 도구가 외부 SaaS라면 그 자체가 국외 이전 경로가 되므로, 로깅 파이프라인까지 포함해 데이터 흐름도를 그려 두어야 합니다.
01AI 보안 위협 모델
LLM 앱의 주요 보안 위협: ①Prompt Injection ②Jailbreak(안전 장치 우회) ③Training Data Extraction ④Model Inversion ⑤供给链 공격(악성 데이터셋). OWASP LLM Top 10을 기준으로 위협 모델링을 수행하세요.
02개인정보(PII) 처리와 GDPR
LLM API에 PII를 전송하면 법적 문제. 전략: ①익명화(이름, 이메일, 전화번호 마스킹) ②가명화(토큰으로 대체, 복호화 가능) ③로컬 모델 사용(프라이버시 보장) ④데이터 처리 계약 체결. Presidio(Microsoft)로 자동 PII 감지/처리.
03AI 출력 검증과 가드레일
LLM 응답이 안전한지 검증하는 레이어. NeMo Guardrails: 주제 제한, 사실 검증. Llama Guard: 안전성 분류. 커스텀 규칙: 금지 단어, 형식 검증, 링크 차단. 입력(Input Guard) + 출력(Output Guard) 이중 검증이 권장됩니다.
04AI 저작권과 법적 이슈
LLM 생성물의 저작권은 나라마다 다릅니다. 학습 데이터 저작권 소송 진행 중(NYT vs OpenAI). 코드 생성: Copilot이 GPL 코드를 그대로 생성할 수 있음. 리스크 관리: ①생성물 검토 ②라이선스 컴플라이언스 도구 ③AI 생성 명시.
05AI 편향성 감지와 완화
학습 데이터의 편향이 모델에 반영. 유형: 성별, 인종, 연령 편향. 감지: Fairlearn, AI Fairness 360. 완화: ①데이터 재균형 ②후처리 보정 ③다양성 프롬프트 ④정기 감사. "AI가 객관적"이라는 가정은 위험합니다.
06AI 거버넌스 프레임워크
기업에서 AI 책임 있게 사용하기. ①AI 사용 정책 수립 ②승인된 도구 목록 ③데이터 분류(공개/내부/기밀) ④AI 결정에 대한 인간 검토 ⑤감사 로그 ⑥직원 교육. EU AI Act 준수를 위한 고위험 AI 시스템 등록이 필요합니다.
07AI 레드팀 테스트
AI 시스템의 취약점을 의도적으로 공격해 발견. 방법: ①Jailbreak 시도 ②Prompt Injection 공격 ③민감 정보 추출 시도 ④극단적 시나리오 테스트. Microsoft PyRIT, Garak 도구 활용. 배포 전 레드팀 테스트는 안전 AI의 기본입니다.
08AI 워터마킹과 생성물 탐지
AI 생성 텍스트 감지 기술. 통계적 워터마킹: 생성 시 특정 토큰 패턴 삽입. Perplexity 기반 감지: AI 텍스트는 매우 낮은 perplexity. GPTZero, Originality.ai 서비스. 한계: 사람이 수정하면 감지 어려움. 학술 부정직 탐지에 활용됩니다.
정리하며
- LLM 출력은 사용자 입력과 동급의 비신뢰 데이터로 취급해 렌더링과 실행 전에 검증합니다
- PII 마스킹은 프롬프트뿐 아니라 요청 로그와 트레이싱 저장소까지 적용 범위를 넓힙니다
- 가드레일은 입력과 출력 양쪽에 두고, 레드팀 시나리오로 실제 우회 가능성을 확인합니다
- 관찰성 SaaS도 데이터 국외 이전 경로이므로 로깅 파이프라인을 흐름도에 포함합니다
더 깊이 들어가고 싶다면 AI 지식 학습 라이브러리에서 다른 주제 가이드를 이어서 보거나, 언어 비교에서 같은 개념이 다른 언어에서 어떻게 표현되는지 확인해 보세요.