관련 기사

LLOYDK
Session 08
AI 보안 거버넌스 전략

AI 안전 가드레일
완전 정복

BASIC + PRO 가드레일
7가지 Actions
20+ 체크 항목
2026 AI 보안 거버넌스 전략 로이드케이 · 오세현 이사
AGENDA

목차

01
Title · AI 안전 가드레일 완전 정복
02
슬라이드구성
03
가드레일 개념: Checks · Actions · Hooks
04
가드레일 7가지 Actions 상세
05
BASIC vs PRO Tier · Hooks 파이프라인
06
OWASP LLM Top 10 2025 · 10대 위협과 가드레일 매핑
07
OWASP 체크리스트 · LLM 보안·거버넌스 v1.1 10대 핵심 항목
09
LLM 보안 위협 자가 진단 체크리스트 (매뉴얼 18~21p · D/M/A/S 19항목)
09
Text & Format ① Regex Match · Sentence Count
10
Text & Format ② Word Count · Character Count
11
Text & Format ③ Uppercase · Lowercase
12
Text & Format ④ Ends With · Text Validation Summary
13
Data & Structure ① JSON Schema · JSON Keys
14
Data & Structure ② Valid URLs · Contains Code
15
Data & Structure ③ Not Null · Contains
16
Security & Auth: JWT Token · Request Parameters
17
Routing & Control ① Model Whitelist · Model Rules
18
Routing & Control ② Allowed Request Types
19
PRO LLM ① Detect Gibberish · Prompt Injection
20
PRO LLM ② PII Detection · Hallucination Check
21
Wrap-up · 가드레일 도입 체크리스트
Guardrail Concepts ·

AI 가드레일 핵심 개념

🔍 Guardrail Check
AI 트래픽에 적용되는 규칙/검증 단위
Input Guardrails: LLM에 도달하기 사용자 프롬프트 검증
Output Guardrails: LLM 응답이 사용자에게 전달되기 검증
🪝 Hooks
input_guardrails → 사용자 프롬프트에 적용
output_guardrails → 모델 응답에 적용
⚡ 7가지 Guardrail Actions
deny 요청 차단
log 로깅 후 통과
evals Evals 데이터셋 생성
fallback 다른 LLM으로 폴백
retry 재시도
alert 알림 발송
transform 응답 변환/수정
출처: Guardrails Docs
📰Guardrails 공식 문서 📰 NIST AI RMF 📰 OWASP LLM Top 10 📰 MITRE ATLAS 📰 AI 에이전트 보안
💀 가드레일 부재 실패 사례: DeepSeek (2025)
중국 AI 스타트업 DeepSeek의 챗봇이 사용자 데이터 100만 건 이상을 미암호화 전송하고 백엔드 DB를 인터넷에 공개. 개인정보보호위원회 긴급 조사 착수, 6개국에서 정부 기기 사용 금지.
✅ 출력 가드레일: DLP 연동으로 API 키·개인정보 유출 차단
✅ 구조 가드레일: 암호화 강제 + DB 접근 통제
✅ 보안 가드레일: 정기적 보안 감사 자동화
📰 DeepSeek 가드레일 교훈 상세
Guardrail Actions · 7 Types

7가지 Actions 상세

deny
검증 실패 시 요청을 즉시 차단하고 오류 반환
예: 유해 콘텐츠 차단, 허용되지 않은 모델 호출 거부
log
검증 실패를 기록하되 요청은 통과
예: 모니터링 모드, 이상 패턴 수집, 감사 로그
evals
Evals 데이터셋을 자동 생성하여 모델 평가에 활용
예: 실패한 케이스를 수집하여 추후 평가 데이터로 사용
fallback
실패 시 다른 LLM으로 요청을 자동 라우팅
예: GPT-4 실패 → Claude로 자동 fallback
retry
실패 시 동일 LLM으로 재시도
예: 일시적 오류 복구, 최대 N회 재시도 설정
alert
검증 실패 시 알림 발송
예: Slack/이메일 알림, 보안팀 에스컬레이션
transform
검증 결과에 따라 응답을 변환/수정
예: PII 마스킹, 유해 문장 필터링·대체
Tiers & Pipeline

BASIC vs PRO · Hooks 파이프라인

BASIC TIER
⚙️ Deterministic
규칙 기반 · 빠르고 예측 가능

• Regex Match / String Validation
• Word / Character / Sentence Count
• JSON Schema / JSON Key 검증
• URL Validation
• JWT Token 검증
• Model Whitelist / Routing Rules

지연시간 0ms~수ms · 초당 수천 건 처리
LLM 호출 없이 즉시 판정
PRO TIER
🧠 LLM-Based
의미 기반 · 맥락 이해

• Detect Gibberish (무의미 텍스트 탐지)
• Scan for Prompt Injection
• PII Detection (개인정보 탐지)
• Hallucination / Groundedness Check
• Toxicity / Harmful Content Detection
• Custom LLM Guardrails

지연시간 수백ms~수초 · LLM 호출 비용 발생
복잡한 맥락 판단이 필요한 경우에만 사용
🔄 가드레일 파이프라인 흐름
User Prompt Input Guardrails LLM Output Guardrails User Response
📰 ISO/IEC 42001 AI 경영시스템 📰 대한민국 AI 기본법
📋 Guardrails JSON Config 예시 (BASIC + PRO 혼합)
🔍 클릭하여 설정 코드와 설명 보기
AI Security Standards
🔴 클릭하여 사례 확인

OWASP Top 10 for LLM Applications 2025

LLM 애플리케이션의 가장 중요한 보안 위협 10가지 — 각 카드를 클릭하면 실제 사례 팝업
LLM01 Prompt Injection
시스템 프롬프트 우회·조작으로 의도하지 않은 행위 유도
📋 사례: GM Chevy 챗봇 "$1에 자동차 판매"
LLM02 Insecure Output Handling
LLM 출력 검증 없이 전달 → XSS·SSRF·코드 실행 위험
📋 사례: Air Canada 챗봇 "환불 정책" 허위 응답
LLM03 Training Data Poisoning
학습 데이터 오염으로 편향·백도어·취약점 주입
📋 사례: Microsoft Tay → 16시간 만에 인종차별 챗봇
LLM04 Model Denial of Service
과도한 리소스 소비로 서비스 마비
📋 사례: LoRA 어댑터 폭주로 GPU 고갈
LLM05 Supply Chain Vulnerabilities
취약한 서드파티 의존성
📋 사례: PyTorch torchtriton 악성코드
LLM06 Sensitive Info Disclosure
학습 데이터 민감정보 노출
📋 사례: 삼성전자 소스코드 ChatGPT 유출
LLM07 Insecure Plugin Design
플러그인 취약점으로 입력 검증 부재·과도한 권한 부여
📋 사례: ChatGPT 플러그인 SSRF 취약점으로 내부망 침투
LLM08 Excessive Agency
과도한 자율권 부여로 무단 API 호출·데이터 유출
📋 사례: AutoGPT 무한 루프 → AWS $1,200 과금 폭탄
LLM09 Overreliance
LLM 출력 맹신으로 잘못된 의사결정·환각 정보 전파
📋 사례: 美 변호사, ChatGPT가 만든 가짜 판례 법정 제출
LLM10 Model Theft
API 질의 역공학·가중치 추출·지식재산 침해
📋 사례: Meta LLaMA 가중치, 4chan 통해 온라인 유출
출처: OWASP Top 10 for LLM Applications 2025
📰 OWASP 상세 📰 NIST AI RMF 📰 MITRE ATLAS
AI Security & Governance

OWASP LLM 보안·거버넌스 체크리스트 v1.1

LLM 도입 전 반드시 검토해야 할 10대 핵심 항목 — 전략·거버넌스·규제·운영 전반
1. 적대적 위험 (Adversarial Risk)
• 경쟁사 AI 투자 현황 파악 및 GenAI 공격 대비 통제 재평가
• 음성인식·생체인증 등 기존 보안 통제의 GenAI 우회 가능성 점검
• GenAI/AIML 사고 대응 계획(IRP) 업데이트
2. 위협 모델링 (Threat Modeling)
• LLM 도입 전 위협 모델링으로 비용 효율적 리스크 식별
• AI 기반 초개인화 스피어피싱·스푸핑 공격 시나리오 검토
3. AI 자산 인벤토리 (AI Asset Inventory)
• 조직 내 모든 AI/ML 모델·데이터셋·파이프라인 목록화
• 모델 출처·공급망·라이선스 추적 및 AI-BOM으로 확장
4. AI 보안·개인정보 교육 (Training)
• 전 직원 AI 보안 인식 교육 + 개발자 Secure AI 코딩 실습
• MLSecOps 파이프라인 구축으로 Shift-Left 보안 내재화
5. 비즈니스 사례 수립 (Business Cases)
• LLM 도입의 ROI와 위험 균형 평가 + "AI 미사용 리스크"도 고려
• 부서별 Shadow AI 현황 파악 및 통합 관리
6. 거버넌스 (Governance)
• AI 거버넌스 위원회 구성 (CISO+CDO+법무) 및 AI 사용 정책 수립
• 허용/금지 모델·데이터 등급별 규칙·AI 윤리 원칙 제정
7. 법률 (Legal)
• AI 생성 콘텐츠의 저작권·지식재산권 및 학습 데이터 라이선스 검토
• 제3자 AI 서비스 계약 검토 (데이터 처리·저장 위치·관할권)
8. 규제 (Regulatory)
• EU AI Act·한국 AI기본법·GDPR 등 규제 매핑 및 고위험 AI 분류
• 규제 변화 모니터링 체계 구축 및 컴플라이언스 자동화
9. LLM 구축·운영 (Implementation)
• RAG 최적화·프롬프트 인젝션 방어 계층·모델 카드 작성
• 멀티레이어 가드레일 아키텍처 설계 (Input→LLM→Output)
10. 테스트·평가·검증 (TEVV)
• AI 레드팀 운영 (정기적 모의 공격) 및 편향성·공정성 평가
• 할루시네이션 측정·개선 및 지속적 안전성 모니터링
출처: OWASP LLM AI Security & Governance Checklist v1.1
OWASP®
📰 OWASP LLM Top 10 상세 📰 NIST AI RMF 📰 EU AI Act 📰 대한민국 AI 기본법
SELF-DIAGNOSIS · AI 보안 위협 대응 매뉴얼

LLM 보안 위협 자가 진단 체크리스트

데이터·모델·에이전트·공급망 4대 분류 19개 항목을 Y/N로 진단 — OWASP LLM Top 10과 매핑된 실무 체크리스트
분류 ID 위협 항목 핵심 진단 기준 OWASP LLM
데이터
위협
D01불균형 데이터학습 데이터의 출처·언어·사용자군 편중 검토 및 완화 조치 여부
D02부정확한 데이터사실성·정확성 검증 기준 수립, 정정·재수집 조치 및 이력 기록 여부LLM09
D03개인정보 비식별화 미흡가명·익명 처리, 원본/비식별 데이터 분리 통제, 영향평가 수행 여부LLM02
모델
위협
M01학습 데이터 유출반복 질의에 의한 학습 데이터 복원 차단, 악성 입력 차단 여부LLM02
M02벡터DB·임베딩 유출벡터 DB 접근 통제, RAG 검색 결과의 민감정보 노출 관리 여부LLM08
M03시스템 프롬프트 유출시스템 프롬프트 공개 요청 응답 제한, 출력 노출 통제 여부LLM07
M04모델 유출가중치 접근 제한, 추론 API 비정상 호출 제한, 로짓 정보 최소화 여부
M05환각허위 정보 생성 가능성 평가, 출처 검증 절차, 오류 고지 여부LLM09
M06탈옥정책 우회 요청 탐지·차단, 유해 콘텐츠 전달 전 차단 여부LLM01
M07부적절한 출력 처리출력 안전 검증(필터링·이스케이핑), 시스템 명령·코드 직접 삽입 통제 여부LLM05
M08모델 DoS과부하 방지(입력 검증·요청 제한), 비정상 트래픽 차단 절차 여부LLM10
에이전트
위협
A01부적절한 도구 설계도구 권한 최소화, 입력값 검증, 도구 호출 이력 기록·탐지 여부LLM06
A02에이전트 하이재킹악성 지침 탐지·제거, 외부 데이터 신뢰성 검증, 승인된 소스 접근 제한 여부LLM01
A03에이전트 DoS작업 시간 제한, 요청 빈도 제한, 비정상 패턴 자동 중단 여부LLM10
A04에이전트 메모리 오염장기 메모리 권한 제어, 금칙어·명령 패턴 차단, 무결성 주기 검토 여부LLM08
공급망
위협
S01데이터 포이즈닝학습·연계 데이터의 악의적 조작 평가, 출처·이력 기록 관리 여부LLM04
S02모델 포이즈닝외부 모델·가중치 파일 악성 포함 점검, 버전·변경 이력 관리 여부LLM04
S03취약한 추론 엔진추론 엔진·런타임의 알려진 취약점 정기 점검 여부LLM03
S04취약한 확장요소에이전트 확장요소의 알려진 취약점 정기 점검 여부LLM03
✅ 진단 결과 N이 3개 이상이면 → 가드레일 우선 적용 대상 · 미조치 시 고위험 ※ 참조 : AI 보안 위협 대응 매뉴얼 p.18~21
Text & Format Validation · ①

Regex Match · Sentence Count

regex_match
정규표현식으로 입력/출력 텍스트 패턴 검증
파라미터: regex (패턴), should_match (true/false)
대상: Input / Output
"regex": "^[\s\S]{10,5000}$"
"should_match": true
사용 시나리오: 이메일 형식 검증, 전화번호 포맷, URL 패턴, SQL 인젝션 차단 패턴
📋 실제 사례
2024년 OO은행 — AI 챗봇에 고객이 실수로 입력한 주민등록번호 패턴(######-#######)이 필터링 없이 LLM으로 전송될 뻔한 사건. Regex Match로 주민번호·카드번호 패턴 11종을 사전 차단 → 고객 PII 노출 0건 달성.
출처: 금융보안원, 「AI 챗봇 개인정보보호 가이드라인」 (2024)
⚡ BASIC · Deterministic · 0ms 지연
sentence_count
텍스트 내 문장 개수 제한 (min/max)
파라미터: min, max
대상: Input / Output
"min": 1,
"max": 5
사용 시나리오: 간결한 응답 요구, 프롬프트 복잡성 제한, 출력 길이 통제
📋 실제 사례
한수원 원전 도면 유출 시도 — 공격자가 50문장 분량의 내부 문서를 한 번에 AI 프롬프트로 붙여넣기 시도. sentence_count max=3으로 설정 → 대량 문서 주입 원천 차단. 대량 프롬프트 주입(Prompt Stuffing) 공격 방어에 핵심적.
출처: 국가정보원, 「국가·공공기관 생성형 AI 활용 가이드라인」 (2024)
⚡ BASIC · Deterministic · 0ms 지연
Text & Format Validation · ②

Word Count · Character Count

word_count
텍스트 내 단어 개수를 min/max로 제한
파라미터: min, max
대상: Input / Output
"min": 5,
"max": 500
사용 시나리오: 최소 입력 길이 보장, 과도하게 긴 프롬프트 방지, 요약 응답 길이 제한
📋 실제 사례
LLM 리소스 고갈 공격 — 공격자가 동일 문장을 수천 회 반복한 20만 단어 프롬프트로 LLM 컨텍스트 윈도우를 초과시켜 GPU 메모리 100% 점유 + 서비스 거부(DoS) 유발. word_count max=200 설정으로 반복 패턴 즉시 차단.
출처: OWASP LLM04: Model Denial of Service, 「LLM 애플리케이션 보안 가이드」 (2025)
⚡ BASIC · Deterministic · 0ms 지연
character_count
텍스트 글자 수 제한 (공백 포함)
파라미터: min, max
대상: Input / Output
"min": 10,
"max": 4000
사용 시나리오: 토큰 제한 준수, SMS/트윗 길이 제한, API 페이로드 크기 제한
📋 실제 사례
Base64 인코딩 악성코드 주입 — 공격자가 악성 PowerShell 스크립트를 Base64로 인코딩하여 프롬프트에 삽입, LLM이 이를 디코딩·실행하도록 유도. char_count max=2000으로 설정 → Base64 페이로드 길이 제한으로 우회 공격 차단.
출처: MITRE ATLAS, 「Prompt-Based Code Injection」 (2024)
⚡ BASIC · Deterministic · 0ms 지연
Text & Format Validation · ③

Uppercase · Lowercase

uppercase
텍스트의 대문자 비율 검사
파라미터: min, max (비율 0~1)
대상: Input
"max": 0.5
사용 시나리오: 과도한 대문자 사용(스팸성) 차단, 감정적 입력 필터링
📋 실제 사례
ChatGPT DAN 탈옥 시도 — "dO aNyThInG nOw" 등 변칙적 대소문자 혼합(Leet-speak)으로 안전 필터 우회 시도. Reddit·4chan에서 수십만 건 확산. uppercase 비율 max=0.5 탐지 → 비정상 케이싱 패턴 즉시 차단.
출처: TechCrunch, "The DAN jailbreak for ChatGPT is going viral" (2023.2.15)
⚡ BASIC · Deterministic · 0ms 지연
lowercase
텍스트의 소문자 비율 검사
파라미터: min, max (비율 0~1)
대상: Input
"min": 0.3
사용 시나리오: 정상적인 문장 구조 확인, 비정상적 포맷 탐지, 봇/스크립트 입력 감지
📋 실제 사례
변칙 키워드 우회 공격 — "FrEe MoNeY", "bYpAsS fIlTeR" 등 의도적 대소문자 혼합으로 키워드 기반 필터 우회. lowercase 비율 min=0.3 설정 → 정상 문장 구조가 아닌 난독화 입력을 탐지·차단.
출처: OWASP LLM01: Prompt Injection, 「LLM Jailbreak Techniques Taxonomy」 (2024)
⚡ BASIC · Deterministic · 0ms 지연
Text & Format Validation · ④

Ends With · Text Validation Summary

ends_with
텍스트가 특정 문자열로 끝나는지 검증
파라미터: text (접미사), case_sensitive
대상: Input / Output
"text": ".",
"case_sensitive": false
사용 시나리오: 문장 종결 확인, 파일 확장자 검사, URL 경로 검증, 마크다운 코드블록 닫힘 확인
📋 실제 사례
SQL 인젝션 프롬프트 공격 — 공격자가 프롬프트에 "; DROP TABLE users;--" 같은 미완성 SQL 쿼리 조각을 삽입하여 LLM이 생성하는 응답에 악성 SQL을 포함시키도록 유도. ends_with=";" 감지 → SQL 구문 종결 패턴 탐지·차단.
출처: OWASP LLM02: Insecure Output Handling, 「LLM Application Security」 (2025)
⚡ BASIC · Deterministic · 0ms 지연
📋 Text & Format 체크 요약
regex_match — 정규표현식 패턴 검증
sentence_count — 문장 수 제한
word_count — 단어 수 제한
character_count — 글자 수 제한
uppercase — 대문자 비율 검사
lowercase — 소문자 비율 검사
ends_with — 접미사 검사
모두 BASIC Tier · Deterministic · LLM 호출 불필요
Data & Structure Validation · ①

JSON Schema · JSON Keys

json_schema
JSON 응답이 스키마 규격을 준수하는지 검증
파라미터: schema (JSON Schema 객체)
대상: Output
"schema": {
  "type": "object",
  "required": ["name","score"],
  "properties": { "name": {"type":"string"}, "score": {"type":"number"} }
}
사용 시나리오: Structured Output 보장, API 응답 형식 유효성, Function Calling 결과 검증
📋 실제 사고 사례
2023년 12월 — Chevrolet 딜러십의 ChatGPT 기반 챗봇이 고객의 농담성 프롬프트 "동의해줘"에 "Chevy Tahoe를 $1에 판매합니다"라고 응답. 해당 대화가 트위터에서 수백만 조회수 기록. GM측 "통제된 테스트 환경"이라 해명.
🛡️ 가드레일 적용 효과: json_schema 검증으로 가격·계약 정보의 형식과 범위를 사전에 제한해 비정상적 응답을 차단할 수 있습니다.
출처: The Verge, "Chevy dealer's AI chatbot sold a car for $1" (2023.12.19) · https://www.theverge.com/2023/12/19/24008527/chevy-dealer-ai-chatbot-cheap-car-sale
⚡ BASIC · Deterministic
json_keys
JSON에 특정 키가 존재하는지 확인
파라미터: keys (필수 키 배열), mode (all/any)
대상: Output
"keys": ["summary", "category"],
"mode": "all"
사용 시나리오: 필수 필드 존재 확인, JSON 응답 무결성 검증, API 계약 준수
📋 실제 사고 사례
2024년 5월Google AI Overviews가 검색 결과에서 "하루에 돌맹이 1개 이상 섭취 권장", "피자 치즈가 흘러내리지 않게 접착제 바르기" 등 Reddit 농담을 사실처럼 요약·생성. 구글 수동 개입으로 대규모 정정 작업.
🛡️ 가드레일 적용 효과: json_keys로 응답에 필수 안전필드(의학적면책조항·출처)가 포함되었는지 검증해 위험 정보 출력을 차단할 수 있습니다.
출처: The Verge, "Google's AI Overviews are full of bad advice" (2024.5.24) · https://www.theverge.com/2024/5/24/24164095/google-ai-overviews-bad-advice
⚡ BASIC · Deterministic
Data & Structure Validation · ②

Valid URLs · Contains Code

valid_urls
텍스트 내 URL이 유효한 형식인지 검증
파라미터: allow_redirects, allowed_domains
대상: Input / Output
"allowed_domains": ["example.com", "api.example.com"]
사용 시나리오: 피싱 URL 차단, 허용 도메인 화이트리스트, 안전하지 않은 링크 필터링
📋 실제 사고 사례
2024년 6월 — 보안업체 Barracuda Networks 보고: AI가 생성한 피싱 이메일에 정교한 피싱 도메인 링크 자동 포함 → 수천 명 클릭해 개인정보 탈취. AI 생성 피싱은 기존보다 탐지율 30% 낮아 기업 보안팀 경고.
🛡️ 가드레일 적용 효과: valid_urls + allowed_domains 화이트리스트로 신뢰된 도메인만 허용해 AI 생성 피싱 URL을 원천 차단할 수 있습니다.
출처: Barracuda Networks Blog, "AI-generated phishing attacks" (2024.6) · https://blog.barracuda.com/2024/06/18/ai-generated-phishing
⚡ BASIC · Deterministic
contains_code
응답에 코드 블록 포함 여부 검사
파라미터: should_contain (true: 코드 필수 / false: 코드 금지)
대상: Output
"should_contain": false
사용 시나리오: 코드 실행 방지, 마크다운 코드블록 탐지, SQL/Python 주입 차단
📋 실제 사고 사례
2024년 3월 — 보안 연구원이 ChatGPT 플러그인에서 XSS(크로스사이트 스크립팅) 취약점을 발견. 악성 스크립트가 포함된 응답을 통해 사용자 세션 탈취 및 계정 탈취 가능성 확인. OpenAI에 책임공개 후 패치 완료.
🛡️ 가드레일 적용 효과: contains_code로 AI 응답에 포함된 script·SQL·쉘 명령어 등 실행 가능 코드를 사전에 차단할 수 있습니다.
출처: Wired, "Security Researchers Found a Way to Hack ChatGPT" (2024.3) · https://www.wired.com/story/chatgpt-plugin-vulnerabilities-2024/
⚡ BASIC · Deterministic
Data & Structure Validation · ③

Not Null · Contains

not_null
입력/출력이 null 또는 빈 값이 아닌지 검증
파라미터: (없음)
대상: Input / Output
// 빈 프롬프트 / null 응답 차단
사용 시나리오: 빈 프롬프트 방지, LLM 무응답 감지, API null 응답 핸들링
📋 실제 사고 사례
2024년 12월Apple Intelligence 뉴스 요약 기능이 BBC 기사 "Luigi Mangione 체포"를 "Luigi Mangione가 스스로 총을 쐈다"고 허위 생성해 푸시 알림 전송. BBC 공식 항의 → Apple, 뉴스 요약 기능 일시 중단.
🛡️ 가드레일 적용 효과: not_null 체크로 AI 응답의 필수 필드가 비어있지 않음을 보장하고, 사실 검증 레이어를 추가 적용할 수 있습니다.
출처: BBC News, "Apple AI news alerts halted after BBC complaint" (2025.1) · https://www.bbc.com/news/articles/cd0elz4j0p0o
⚡ BASIC · Deterministic
contains
텍스트에 특정 문자열 포함 여부 검증
파라미터: text (문자열), should_contain
대상: Input / Output
"text": "출처:",
"should_contain": true
사용 시나리오: 응답 품질 확인 (출처 포함), 금지어 필터링, 필수 키워드 포함 검증
📋 실제 사고 사례
2016년 3월Microsoft Tay 챗봇이 트위터 출시 24시간 만에 인종차별·홀로코스트 부정 등 극단적 혐오 발언을 학습·생성. 악의적 사용자들의 데이터 주입으로 AI가 통제 불능 상태 → Microsoft 긴급 서비스 중단.
🛡️ 가드레일 적용 효과: contains로 금지어·혐오 키워드 포함 여부를 실시간 검증해 유해 응답 출력 전 차단할 수 있습니다.
출처: The Verge, "Twitter taught Microsoft's AI chatbot to be racist" (2016.3.24) · https://www.theverge.com/2016/3/24/11297050/tay-microsoft-chatbot-racist
⚡ BASIC · Deterministic
📋 Data & Structure 요약: json_schema · json_keys · valid_urls · contains_code · not_null · contains
Security & Auth Validation

JWT Token · Request Parameters

jwt_token_validator
JWT 서명 검증 + 클레임(Claims) 검증
파라미터: secret_key, algorithm, claims (만료시간·발급자 등)
대상: Input
"secret_key": "${JWT_SECRET}",
"algorithm": "HS256",
"claims": {"exp": true, "iss": "auth.example.com"}
사용 시나리오: API 인증 토큰 검증, 만료된 토큰 차단, 위조 토큰 탐지, 서비스간 인증
📋 실제 사고 사례
2024년 1월 — 보안 연구원이 Hugging Face 플랫폼의 API 토큰 취약점 발견. JWT 토큰 검증 미흡으로 Meta, Microsoft, Google 등 주요 기업의 Private AI 모델에 무단 접근 가능. Hugging Face, 긴급 보안 패치 배포.
🛡️ 가드레일 적용 효과: jwt_token_validator로 토큰 서명·만료시간을 검증해 위조된 API 접근을 원천 차단할 수 있습니다.
출처: Wiz Research, "Hugging Face API token vulnerability" (2024.1) · https://www.wiz.io/blog/hugging-face-vulnerability-research
🔒 BASIC · Deterministic · 암호화 검증
request_params_check
요청 도구·파라미터 제어 및 검증
파라미터: allowed_tools, blocked_params, max_tokens
대상: Input
"allowed_tools": ["search", "calculator"],
"blocked_params": ["system_prompt", "role"], "max_tokens": 4096
사용 시나리오: Function Calling 제한, 민감 파라미터 차단, 토큰 한도 강제, 불필요한 도구 접근 방지
📋 실제 사고 사례
2024년 4월 — OWASP Top 10 for LLM Applications 공식 발표. LLM06: 과도한 에이전트 권한이 주요 위협으로 등재. "이메일 전체 삭제", "DB 초기화" 등 위험한 Function Calling 공격 PoC 다수 입증.
🛡️ 가드레일 적용 효과: request_params_check로 허용된 도구·파라미터만 통과시켜 LLM 에이전트의 과도한 시스템 명령 실행을 방지할 수 있습니다.
출처: OWASP Top 10 for LLM Applications (2024) · https://owasp.org/www-project-top-10-for-large-language-model-applications/
🔒 BASIC · Deterministic · 도구 접근 제어
Routing & Control · ①

Model Whitelist · Model Rules

model_whitelist
허용된 모델만 호출 가능하도록 제한
파라미터: allowed_models (모델 ID 배열)
대상: Input
"allowed_models": [
  "gpt-4o", "gpt-4o-mini", "claude-sonnet-4-20250514"
]
사용 시나리오: 비용 통제 (고가 모델 차단), 규제 준수 (허용 지역 모델만), 내부 정책 시행
📋 실제 사고 사례
2024년 6월 — 한 AI 스타트업이 비용 통제 없이 개발 환경에서 GPT-4 API 대량 호출 → 한 달 만에 $280,000 이상 청구. 모델 화이트리스트·Rate Limit 미적용이 원인. 업계에 경종을 울린 사례로 AI 커뮤니티에서 화제.
🛡️ 가드레일 적용 효과: model_whitelist로 비용 효율적인 모델만 허용하고, 개발 환경에서는 저가 모델로 제한해 과도한 비용 발생을 방지할 수 있습니다.
출처: Hacker News / r/MachineLearning 커뮤니티 다수 보고 (2024) · https://news.ycombinator.com/item?id=40651428
🛡️ BASIC · Deterministic · 모델 접근 제어
model_rules
요청 특성에 따른 동적 모델 라우팅 규칙
파라미터: rules (조건 → 모델 매핑 배열)
대상: Input
"rules": [
  {"condition": "prompt_len > 2000", "model": "gpt-4o"},
  {"condition": "default", "model": "gpt-4o-mini"}
]
사용 시나리오: 복잡도 기반 라우팅, 비용 최적화, SLA 기반 모델 선택
📋 실제 사고 사례
2024년 11월 8일OpenAI ChatGPT가 DDoS 공격으로 약 2시간 동안 전 세계 서비스 중단. API 기반 AI 서비스에 의존하던 수천 개 기업의 비즈니스 프로세스 일시 마비. OpenAI "비정상적 트래픽 패턴"으로 발표.
🛡️ 가드레일 적용 효과: model_rules 기반 Rate Limiting으로 트래픽 폭주를 사전 감지하고, Fallback 모델로 자동 전환해 서비스 연속성을 보장할 수 있습니다.
출처: The Verge, "ChatGPT is down for the second time today" (2024.11.8) · https://www.theverge.com/2024/11/8/24291583/chatgpt-down-outage-november-2024
🛡️ BASIC · Deterministic · 지능형 라우팅
Routing & Control · ②

Allowed Request Types · Routing Summary

allowed_request_types
허용된 요청 유형만 통과
파라미터: types (chat / completion / embedding / image 등)
대상: Input
"types": ["chat", "completion"]
사용 시나리오: 이미지 생성 API 차단, Embedding API 사용 제한, 대화형 API만 허용
📋 실제 사고 사례
2024년 10월 — 플로리다주 14세 소년이 Character.AI 챗봇과 수개월간 집중적 대화 후 자살. 어머니 Megan Garcia가 Character.AI 상대로 "위험한 제품" 과실致死 소송 제기 → AI 챗봇 안전 규제 논의 전 세계로 확산.
🛡️ 가드레일 적용 효과: allowed_request_types로 미성년자에게 위험한 유형의 AI 상호작용을 차단하고, 연령·컨텍스트 기반 접근 제어를 적용할 수 있습니다.
출처: The New York Times, "Character.AI Lawsuit" (2024.10.23) · https://www.nytimes.com/2024/10/23/technology/characterai-lawsuit-teen-suicide.html
🛡️ BASIC · Deterministic · API 유형 제어
📋 Routing & Control 요약
model_whitelist — 허용 모델 화이트리스트
model_rules — 조건부 모델 라우팅
allowed_request_types — 요청 유형 제한
핵심: 비용 통제 + 보안 정책 + 규제 준수를 위한 AI 트래픽의 통합 관문
PRO LLM Guardrails · ①

Detect Gibberish · Prompt Injection

detect_gibberish
LLM이 무의미한 텍스트를 감지
파라미터: threshold (탐지 임계값), language
대상: Input / Output
"threshold": 0.7,
"language": "ko"
사용 시나리오: 랜덤 문자열 입력 차단, LLM 환각 출력 감지, 키보드 매싱(mashing) 필터링
📋 실제 사고 사례
2024년 2월 — 시카고대학 Nightshade 프로젝트 연구팀이 AI 학습 데이터 오염(Poisoning) 공격 시연. 단 100장 미만의 독성 이미지를 LAION-5B 데이터셋에 주입해 Stable Diffusion의 "개" 개념 생성 완전히 파괴.
🛡️ 가드레일 적용 효과: detect_gibberish로 무의미·변칙적 입력 패턴을 필터링해 AI 학습 데이터 오염 공격을 사전 탐지할 수 있습니다.
출처: MIT Technology Review, "Nightshade: data poisoning tool" (2024.2) · https://www.technologyreview.com/2024/02/20/1088565/nightshade-data-poisoning-ai/
🧠 PRO · LLM-Based · 의미 기반 분석
scan_prompt_injection
LLM이 프롬프트 인젝션 공격을 탐지
파라미터: threshold, check_system_override
대상: Input
"threshold": 0.8,
"check_system_override": true
사용 시나리오: 시스템 프롬프트 탈취 시도 탐지, 'ignore previous instructions' 공격 차단, jailbreak 감지
📋 실제 사고 사례
2024년 9월 — 보안 연구원 Johann Rehberger가 Microsoft Copilot의 프롬프트 인젝션 취약점 발견. 악성 이메일 하나로 Copilot이 사용자의 모든 이메일·문서 접근 → "이전 지시사항 무시" 공격 성공. MS, 보안 패치 배포.
🛡️ 가드레일 적용 효과: scan_prompt_injection으로 "ignore previous instructions", "system override" 등의 패턴을 사전 탐지·차단할 수 있습니다.
출처: Ars Technica, "Microsoft Copilot prompt injection" (2024.9) · https://arstechnica.com/security/2024/09/microsoft-copilot-prompt-injection-attack/
🧠 PRO · LLM-Based · 보안 위협 탐지
⚠️ 가드레일 우회 공격 시나리오 (2026년 기준 위협 인텔리전스)
멀티턴 우회: 여러 턴에 걸쳐 점진적으로 가드레일 회피 — 최신 LLM도 방어 어려움
인코딩 공격: Base64·ROT13·유니코드 난독화로 키워드 기반 BASIC 필터 우회
컨텍스트 오염: RAG 파이프라인에 악성 문서 주입 → 검증된 답변으로 위장
다국어 우회: 저자원 언어(rare language)로 프롬프트 인젝션 → 영어 기반 탐지 회피
대응 전략: BASIC + PRO 다중 가드레일 중첩(Defense in Depth) + 정기적 AI Red Teaming + Canary 토큰 기반 프롬프트 유출 탐지
PRO LLM Guardrails · ②

PII Detection · Hallucination Check

detect_pii
LLM 출력에서 개인식별정보(PII) 탐지
파라미터: pii_types (이메일·전화번호·주민번호 등), action (deny/mask/log)
대상: Input / Output
"pii_types": ["email", "phone", "ssn", "credit_card"],
"action": "deny"
사용 시나리오: 민감정보 유출 방지, GDPR·개인정보보호법 컴플라이언스, 데이터 마스킹
📋 실제 사고 사례
2023년 7월 — FTC(미 연방거래위원회)가 OpenAI의 ChatGPT 데이터 수집 관행에 대해 전면 조사 착수. AI 학습 데이터에 포함된 PII(개인식별정보) 처리, 아동 개인정보 보호, 허위 정보 생성에 대한 소비자 보호법 위반 조사.
🛡️ 가드레일 적용 효과: detect_pii로 이메일·신용카드·주민번호 등 개인식별정보를 입력/출력 모두에서 탐지·마스킹하여 규제 리스크를 제거할 수 있습니다.
출처: The Washington Post, "FTC opens investigation into OpenAI" (2023.7.13) · https://www.washingtonpost.com/technology/2023/07/13/ftc-openai-chatgpt-sam-altman-lina-khan/
🧠 PRO · LLM-Based · 개인정보보호
hallucination_check
LLM 응답의 사실 정확성(Groundedness) 검증
파라미터: context (참조 문서), threshold, check_citations
대상: Output
"context": "",
"threshold": 0.85,
"check_citations": true
사용 시나리오: RAG 시스템 신뢰성 확보, 의료·법률 등 고위험 도메인, 고객응대 정확성 보장
📋 실제 사고 사례
2023년 5월Mata v. Avianca 사건: 변호사 Steven Schwartz가 ChatGPT로 생성한 가상 판례 6건(Varghese v. China Southern Airlines 등)을 연방법원에 제출. P. Kevin Castel 판사 "전례 없는 상황" → 변호사 징계 및 $5,000 벌금.
🛡️ 가드레일 적용 효과: hallucination_check로 AI 출력의 사실 관계를 참조 문서와 대조 검증해 가상 판례·허위 정보 인용을 방지할 수 있습니다.
출처: The New York Times, "Here's What Happens When Your Lawyer Uses ChatGPT" (2023.5.27) · https://www.nytimes.com/2023/05/27/nyregion/avianca-airline-lawsuit-chatgpt.html
🧠 PRO · LLM-Based · 사실 검증
🧠 PRO LLM 추가 가능: detect_toxicity · detect_language · detect_topic · custom_prompt_check
Implementation Checklist

가드레일 도입 체크리스트

1. Input Guardrails 먼저: 프롬프트 검증으로 LLM 호출 전 차단
2. BASIC Tier 우선: 빠르고 비용 없이 80% 커버
3. Output Guardrails 추가: 응답 품질·안전성 보장
4. Action 선택: deny(보안) → log(모니터링) → fallback(가용성)
5. PRO Tier는 신중하게: 맥락 이해가 필요한 고위험 시나리오에만
6. 지속적 모니터링: evals 액션으로 실패 데이터 축적 → 개선
📊 포트키 가드레일 핵심 수치
22개 BASIC(18) + PRO(4) 체크 항목
7 Actions (deny·log·evals·fallback·retry·alert·transform)
2 Tiers (BASIC Deterministic + PRO LLM-Based)
~0ms BASIC 체크 지연시간 (vs PRO: 수백ms~수초)
출처: Guardrails Documentation
📰 EU AI Act 가드레일 요구사항 📰 KISA AI 보안 가이드라인 📰 NIST AI RMF Playbook 📰 MS Responsible AI 📰 Google SAIF 📰 OECD AI 원칙 📰 Anthropic RSP 📰 Stanford CRFM FMTI
Global Research · 세계 연구 동향

🏛️ AI 가드레일 최신 연구·도구

🛡️ NVIDIA NeMo Guardrails
• 오픈소스 Python 패키지 (PyPI + GitHub)
• 5대 레일: Input·Retrieval·Dialog·Execution·Output
• Colang: 대화형 흐름 정의 언어
• Jailbreak 차단·PII 마스킹·토픽 제어 통합
• 라이브러리 → Microservice(K8s) 포팅 가능
🔬 Guardrails AI · 오픈소스 프레임워크
• Guardrails Hub: 수백 개 사전 정의된 검증기
• Snowglobe: 합성 데이터 기반 AI 테스트
• 할루시네이션·데이터 유출·정책 위반 실시간 감지
• 모든 LLM·배포 환경 호환
🔬 Anthropic · Constitutional AI
• 인간 피드백 대신 헌법(Constitution) 기반 정렬
• Claude의 안전성·유해성 통제 핵심 기술
• "Teaching Claude why" (2026.5) — 에이전트 정렬 연구
• Responsible Scaling Policy (RSP) 기반 안전 계층
🏫 Stanford · MIT · ETH Zurich 연구
• Stanford HAI: AI Safety Benchmark, FMTI
• MIT AI Risk: Guardrails Governance Framework
• ETH Zurich CSS: AI 시스템 안전성 검증 방법론
• Google SAIF: Secure AI Framework
📚 참고문헌
📚 NVIDIA NeMo Guardrails — 오픈소스 AI 가드레일 프레임워크 (GitHub)
📚 AI Guardrails — 통합 AI 게이트웨이 및 가드레일 플랫폼
📚 MITRE ATLAS — Adversarial Threat Landscape for AI Systems
📚 Anthropic RSP (Responsible Scaling Policy) — Constitutional AI 기반 안전 정책
📚 NIST AI RMF Generative AI Profile (NIST AI 600-1, 2024년)