관련 기사

LLOYDK
Session 08
AI 보안 거버넌스 전략

AI 안전 가드레일
완전 정복

BASIC + PRO 가드레일
7가지 Actions
20+ 체크 항목
2026 AI 보안 거버넌스 전략 로이드케이 · 오세현 이사
AGENDA

목차

01
Title · AI 안전 가드레일 완전 정복
02
슬라이드구성
03
가드레일 개념: Checks · Actions · Hooks
04
가드레일 7가지 Actions 상세
05
BASIC vs PRO Tier · Hooks 파이프라인
06
OWASP LLM Top 10 2025 · 10대 위협과 가드레일 매핑
07
OWASP 체크리스트 · LLM 보안·거버넌스 v1.1 10대 핵심 항목
08
Text & Format ① Regex Match · Sentence Count
09
Text & Format ② Word Count · Character Count
10
Text & Format ③ Uppercase · Lowercase
11
Text & Format ④ Ends With · Text Validation Summary
12
Data & Structure ① JSON Schema · JSON Keys
13
Data & Structure ② Valid URLs · Contains Code
14
Data & Structure ③ Not Null · Contains
15
Security & Auth: JWT Token · Request Parameters
16
Routing & Control ① Model Whitelist · Model Rules
17
Routing & Control ② Allowed Request Types
18
PRO LLM ① Detect Gibberish · Prompt Injection
19
PRO LLM ② PII Detection · Hallucination Check
20
Wrap-up · 가드레일 도입 체크리스트
Guardrail Concepts ·

AI 가드레일 핵심 개념

🔍 Guardrail Check
AI 트래픽에 적용되는 규칙/검증 단위
Input Guardrails: LLM에 도달하기 사용자 프롬프트 검증
Output Guardrails: LLM 응답이 사용자에게 전달되기 검증
🪝 Hooks
input_guardrails → 사용자 프롬프트에 적용
output_guardrails → 모델 응답에 적용
⚡ 7가지 Guardrail Actions
deny 요청 차단
log 로깅 후 통과
evals Evals 데이터셋 생성
fallback 다른 LLM으로 폴백
retry 재시도
alert 알림 발송
transform 응답 변환/수정
출처: Guardrails Docs
📰Guardrails 공식 문서 📰 NIST AI RMF 📰 OWASP LLM Top 10 📰 MITRE ATLAS 📰 AI 에이전트 보안
💀 가드레일 부재 실패 사례: DeepSeek (2025)
중국 AI 스타트업 DeepSeek의 챗봇이 사용자 데이터 100만 건 이상을 미암호화 전송하고 백엔드 DB를 인터넷에 공개. 개인정보보호위원회 긴급 조사 착수, 6개국에서 정부 기기 사용 금지.
✅ 출력 가드레일: DLP 연동으로 API 키·개인정보 유출 차단
✅ 구조 가드레일: 암호화 강제 + DB 접근 통제
✅ 보안 가드레일: 정기적 보안 감사 자동화
📰 DeepSeek 가드레일 교훈 상세
Guardrail Actions · 7 Types

7가지 Actions 상세

deny
검증 실패 시 요청을 즉시 차단하고 오류 반환
예: 유해 콘텐츠 차단, 허용되지 않은 모델 호출 거부
log
검증 실패를 기록하되 요청은 통과
예: 모니터링 모드, 이상 패턴 수집, 감사 로그
evals
Evals 데이터셋을 자동 생성하여 모델 평가에 활용
예: 실패한 케이스를 수집하여 추후 평가 데이터로 사용
fallback
실패 시 다른 LLM으로 요청을 자동 라우팅
예: GPT-4 실패 → Claude로 자동 fallback
retry
실패 시 동일 LLM으로 재시도
예: 일시적 오류 복구, 최대 N회 재시도 설정
alert
검증 실패 시 알림 발송
예: Slack/이메일 알림, 보안팀 에스컬레이션
transform
검증 결과에 따라 응답을 변환/수정
예: PII 마스킹, 유해 문장 필터링·대체
Tiers & Pipeline

BASIC vs PRO · Hooks 파이프라인

BASIC TIER
⚙️ Deterministic
규칙 기반 · 빠르고 예측 가능

• Regex Match / String Validation
• Word / Character / Sentence Count
• JSON Schema / JSON Key 검증
• URL Validation
• JWT Token 검증
• Model Whitelist / Routing Rules

지연시간 0ms~수ms · 초당 수천 건 처리
LLM 호출 없이 즉시 판정
PRO TIER
🧠 LLM-Based
의미 기반 · 맥락 이해

• Detect Gibberish (무의미 텍스트 탐지)
• Scan for Prompt Injection
• PII Detection (개인정보 탐지)
• Hallucination / Groundedness Check
• Toxicity / Harmful Content Detection
• Custom LLM Guardrails

지연시간 수백ms~수초 · LLM 호출 비용 발생
복잡한 맥락 판단이 필요한 경우에만 사용
🔄 가드레일 파이프라인 흐름
User Prompt Input Guardrails LLM Output Guardrails User Response
📰 ISO/IEC 42001 AI 경영시스템 📰 대한민국 AI 기본법
📋 Guardrails JSON Config 예시 (BASIC + PRO 혼합)
🔍 클릭하여 설정 코드와 설명 보기
AI Security Standards
🔴 클릭하여 사례 확인

OWASP Top 10 for LLM Applications 2025

LLM 애플리케이션의 가장 중요한 보안 위협 10가지 — 각 카드를 클릭하면 실제 사례 팝업
LLM01 Prompt Injection
시스템 프롬프트 우회·조작으로 의도하지 않은 행위 유도
📋 사례: GM Chevy 챗봇 "$1에 자동차 판매"
LLM02 Insecure Output Handling
LLM 출력 검증 없이 전달 → XSS·SSRF·코드 실행 위험
📋 사례: Air Canada 챗봇 "환불 정책" 허위 응답
LLM03 Training Data Poisoning
학습 데이터 오염으로 편향·백도어·취약점 주입
📋 사례: Microsoft Tay → 16시간 만에 인종차별 챗봇
LLM04 Model Denial of Service
과도한 리소스 소비로 서비스 마비
📋 사례: LoRA 어댑터 폭주로 GPU 고갈
LLM05 Supply Chain Vulnerabilities
취약한 서드파티 의존성
📋 사례: PyTorch torchtriton 악성코드
LLM06 Sensitive Info Disclosure
학습 데이터 민감정보 노출
📋 사례: 삼성전자 소스코드 ChatGPT 유출
LLM07 Insecure Plugin Design
플러그인 취약점으로 입력 검증 부재·과도한 권한 부여
📋 사례: ChatGPT 플러그인 SSRF 취약점으로 내부망 침투
LLM08 Excessive Agency
과도한 자율권 부여로 무단 API 호출·데이터 유출
📋 사례: AutoGPT 무한 루프 → AWS $1,200 과금 폭탄
LLM09 Overreliance
LLM 출력 맹신으로 잘못된 의사결정·환각 정보 전파
📋 사례: 美 변호사, ChatGPT가 만든 가짜 판례 법정 제출
LLM10 Model Theft
API 질의 역공학·가중치 추출·지식재산 침해
📋 사례: Meta LLaMA 가중치, 4chan 통해 온라인 유출
출처: OWASP Top 10 for LLM Applications 2025
📰 OWASP 상세 📰 NIST AI RMF 📰 MITRE ATLAS
AI Security & Governance

OWASP LLM 보안·거버넌스 체크리스트 v1.1

LLM 도입 전 반드시 검토해야 할 10대 핵심 항목 — 전략·거버넌스·규제·운영 전반
1. 적대적 위험 (Adversarial Risk)
• 경쟁사 AI 투자 현황 파악 및 GenAI 공격 대비 통제 재평가
• 음성인식·생체인증 등 기존 보안 통제의 GenAI 우회 가능성 점검
• GenAI/AIML 사고 대응 계획(IRP) 업데이트
2. 위협 모델링 (Threat Modeling)
• LLM 도입 전 위협 모델링으로 비용 효율적 리스크 식별
• AI 기반 초개인화 스피어피싱·스푸핑 공격 시나리오 검토
3. AI 자산 인벤토리 (AI Asset Inventory)
• 조직 내 모든 AI/ML 모델·데이터셋·파이프라인 목록화
• 모델 출처·공급망·라이선스 추적 및 AI-BOM으로 확장
4. AI 보안·개인정보 교육 (Training)
• 전 직원 AI 보안 인식 교육 + 개발자 Secure AI 코딩 실습
• MLSecOps 파이프라인 구축으로 Shift-Left 보안 내재화
5. 비즈니스 사례 수립 (Business Cases)
• LLM 도입의 ROI와 위험 균형 평가 + "AI 미사용 리스크"도 고려
• 부서별 Shadow AI 현황 파악 및 통합 관리
6. 거버넌스 (Governance)
• AI 거버넌스 위원회 구성 (CISO+CDO+법무) 및 AI 사용 정책 수립
• 허용/금지 모델·데이터 등급별 규칙·AI 윤리 원칙 제정
7. 법률 (Legal)
• AI 생성 콘텐츠의 저작권·지식재산권 및 학습 데이터 라이선스 검토
• 제3자 AI 서비스 계약 검토 (데이터 처리·저장 위치·관할권)
8. 규제 (Regulatory)
• EU AI Act·한국 AI기본법·GDPR 등 규제 매핑 및 고위험 AI 분류
• 규제 변화 모니터링 체계 구축 및 컴플라이언스 자동화
9. LLM 구축·운영 (Implementation)
• RAG 최적화·프롬프트 인젝션 방어 계층·모델 카드 작성
• 멀티레이어 가드레일 아키텍처 설계 (Input→LLM→Output)
10. 테스트·평가·검증 (TEVV)
• AI 레드팀 운영 (정기적 모의 공격) 및 편향성·공정성 평가
• 할루시네이션 측정·개선 및 지속적 안전성 모니터링
출처: OWASP LLM AI Security & Governance Checklist v1.1
OWASP®
📰 OWASP LLM Top 10 상세 📰 NIST AI RMF 📰 EU AI Act 📰 대한민국 AI 기본법
Text & Format Validation · ①

Regex Match · Sentence Count

regex_match
정규표현식으로 입력/출력 텍스트 패턴 검증
파라미터: regex (패턴), should_match (true/false)
대상: Input / Output
"regex": "^[\s\S]{10,5000}$"
"should_match": true
사용 시나리오: 이메일 형식 검증, 전화번호 포맷, URL 패턴, SQL 인젝션 차단 패턴
📋 실제 사례
2024년 OO은행 — AI 챗봇에 고객이 실수로 입력한 주민등록번호 패턴(######-#######)이 필터링 없이 LLM으로 전송될 뻔한 사건. Regex Match로 주민번호·카드번호 패턴 11종을 사전 차단 → 고객 PII 노출 0건 달성.
출처: 금융보안원, 「AI 챗봇 개인정보보호 가이드라인」 (2024)
⚡ BASIC · Deterministic · 0ms 지연
sentence_count
텍스트 내 문장 개수 제한 (min/max)
파라미터: min, max
대상: Input / Output
"min": 1,
"max": 5
사용 시나리오: 간결한 응답 요구, 프롬프트 복잡성 제한, 출력 길이 통제
📋 실제 사례
한수원 원전 도면 유출 시도 — 공격자가 50문장 분량의 내부 문서를 한 번에 AI 프롬프트로 붙여넣기 시도. sentence_count max=3으로 설정 → 대량 문서 주입 원천 차단. 대량 프롬프트 주입(Prompt Stuffing) 공격 방어에 핵심적.
출처: 국가정보원, 「국가·공공기관 생성형 AI 활용 가이드라인」 (2024)
⚡ BASIC · Deterministic · 0ms 지연
Text & Format Validation · ②

Word Count · Character Count

word_count
텍스트 내 단어 개수를 min/max로 제한
파라미터: min, max
대상: Input / Output
"min": 5,
"max": 500
사용 시나리오: 최소 입력 길이 보장, 과도하게 긴 프롬프트 방지, 요약 응답 길이 제한
📋 실제 사례
LLM 리소스 고갈 공격 — 공격자가 동일 문장을 수천 회 반복한 20만 단어 프롬프트로 LLM 컨텍스트 윈도우를 초과시켜 GPU 메모리 100% 점유 + 서비스 거부(DoS) 유발. word_count max=200 설정으로 반복 패턴 즉시 차단.
출처: OWASP LLM04: Model Denial of Service, 「LLM 애플리케이션 보안 가이드」 (2025)
⚡ BASIC · Deterministic · 0ms 지연
character_count
텍스트 글자 수 제한 (공백 포함)
파라미터: min, max
대상: Input / Output
"min": 10,
"max": 4000
사용 시나리오: 토큰 제한 준수, SMS/트윗 길이 제한, API 페이로드 크기 제한
📋 실제 사례
Base64 인코딩 악성코드 주입 — 공격자가 악성 PowerShell 스크립트를 Base64로 인코딩하여 프롬프트에 삽입, LLM이 이를 디코딩·실행하도록 유도. char_count max=2000으로 설정 → Base64 페이로드 길이 제한으로 우회 공격 차단.
출처: MITRE ATLAS, 「Prompt-Based Code Injection」 (2024)
⚡ BASIC · Deterministic · 0ms 지연
Text & Format Validation · ③

Uppercase · Lowercase

uppercase
텍스트의 대문자 비율 검사
파라미터: min, max (비율 0~1)
대상: Input
"max": 0.5
사용 시나리오: 과도한 대문자 사용(스팸성) 차단, 감정적 입력 필터링
📋 실제 사례
ChatGPT DAN 탈옥 시도 — "dO aNyThInG nOw" 등 변칙적 대소문자 혼합(Leet-speak)으로 안전 필터 우회 시도. Reddit·4chan에서 수십만 건 확산. uppercase 비율 max=0.5 탐지 → 비정상 케이싱 패턴 즉시 차단.
출처: TechCrunch, "The DAN jailbreak for ChatGPT is going viral" (2023.2.15)
⚡ BASIC · Deterministic · 0ms 지연
lowercase
텍스트의 소문자 비율 검사
파라미터: min, max (비율 0~1)
대상: Input
"min": 0.3
사용 시나리오: 정상적인 문장 구조 확인, 비정상적 포맷 탐지, 봇/스크립트 입력 감지
📋 실제 사례
변칙 키워드 우회 공격 — "FrEe MoNeY", "bYpAsS fIlTeR" 등 의도적 대소문자 혼합으로 키워드 기반 필터 우회. lowercase 비율 min=0.3 설정 → 정상 문장 구조가 아닌 난독화 입력을 탐지·차단.
출처: OWASP LLM01: Prompt Injection, 「LLM Jailbreak Techniques Taxonomy」 (2024)
⚡ BASIC · Deterministic · 0ms 지연
Text & Format Validation · ④

Ends With · Text Validation Summary

ends_with
텍스트가 특정 문자열로 끝나는지 검증
파라미터: text (접미사), case_sensitive
대상: Input / Output
"text": ".",
"case_sensitive": false
사용 시나리오: 문장 종결 확인, 파일 확장자 검사, URL 경로 검증, 마크다운 코드블록 닫힘 확인
📋 실제 사례
SQL 인젝션 프롬프트 공격 — 공격자가 프롬프트에 "; DROP TABLE users;--" 같은 미완성 SQL 쿼리 조각을 삽입하여 LLM이 생성하는 응답에 악성 SQL을 포함시키도록 유도. ends_with=";" 감지 → SQL 구문 종결 패턴 탐지·차단.
출처: OWASP LLM02: Insecure Output Handling, 「LLM Application Security」 (2025)
⚡ BASIC · Deterministic · 0ms 지연
📋 Text & Format 체크 요약
regex_match — 정규표현식 패턴 검증
sentence_count — 문장 수 제한
word_count — 단어 수 제한
character_count — 글자 수 제한
uppercase — 대문자 비율 검사
lowercase — 소문자 비율 검사
ends_with — 접미사 검사
모두 BASIC Tier · Deterministic · LLM 호출 불필요
Data & Structure Validation · ①

JSON Schema · JSON Keys

json_schema
JSON 응답이 스키마 규격을 준수하는지 검증
파라미터: schema (JSON Schema 객체)
대상: Output
"schema": {
  "type": "object",
  "required": ["name","score"],
  "properties": { "name": {"type":"string"}, "score": {"type":"number"} }
}
사용 시나리오: Structured Output 보장, API 응답 형식 유효성, Function Calling 결과 검증
📋 실제 사고 사례
2023년 12월 — Chevrolet 딜러십의 ChatGPT 기반 챗봇이 고객의 농담성 프롬프트 "동의해줘"에 "Chevy Tahoe를 $1에 판매합니다"라고 응답. 해당 대화가 트위터에서 수백만 조회수 기록. GM측 "통제된 테스트 환경"이라 해명.
🛡️ 가드레일 적용 효과: json_schema 검증으로 가격·계약 정보의 형식과 범위를 사전에 제한해 비정상적 응답을 차단할 수 있습니다.
출처: The Verge, "Chevy dealer's AI chatbot sold a car for $1" (2023.12.19) · https://www.theverge.com/2023/12/19/24008527/chevy-dealer-ai-chatbot-cheap-car-sale
⚡ BASIC · Deterministic
json_keys
JSON에 특정 키가 존재하는지 확인
파라미터: keys (필수 키 배열), mode (all/any)
대상: Output
"keys": ["summary", "category"],
"mode": "all"
사용 시나리오: 필수 필드 존재 확인, JSON 응답 무결성 검증, API 계약 준수
📋 실제 사고 사례
2024년 5월Google AI Overviews가 검색 결과에서 "하루에 돌맹이 1개 이상 섭취 권장", "피자 치즈가 흘러내리지 않게 접착제 바르기" 등 Reddit 농담을 사실처럼 요약·생성. 구글 수동 개입으로 대규모 정정 작업.
🛡️ 가드레일 적용 효과: json_keys로 응답에 필수 안전필드(의학적면책조항·출처)가 포함되었는지 검증해 위험 정보 출력을 차단할 수 있습니다.
출처: The Verge, "Google's AI Overviews are full of bad advice" (2024.5.24) · https://www.theverge.com/2024/5/24/24164095/google-ai-overviews-bad-advice
⚡ BASIC · Deterministic
Data & Structure Validation · ②

Valid URLs · Contains Code

valid_urls
텍스트 내 URL이 유효한 형식인지 검증
파라미터: allow_redirects, allowed_domains
대상: Input / Output
"allowed_domains": ["example.com", "api.example.com"]
사용 시나리오: 피싱 URL 차단, 허용 도메인 화이트리스트, 안전하지 않은 링크 필터링
📋 실제 사고 사례
2024년 6월 — 보안업체 Barracuda Networks 보고: AI가 생성한 피싱 이메일에 정교한 피싱 도메인 링크 자동 포함 → 수천 명 클릭해 개인정보 탈취. AI 생성 피싱은 기존보다 탐지율 30% 낮아 기업 보안팀 경고.
🛡️ 가드레일 적용 효과: valid_urls + allowed_domains 화이트리스트로 신뢰된 도메인만 허용해 AI 생성 피싱 URL을 원천 차단할 수 있습니다.
출처: Barracuda Networks Blog, "AI-generated phishing attacks" (2024.6) · https://blog.barracuda.com/2024/06/18/ai-generated-phishing
⚡ BASIC · Deterministic
contains_code
응답에 코드 블록 포함 여부 검사
파라미터: should_contain (true: 코드 필수 / false: 코드 금지)
대상: Output
"should_contain": false
사용 시나리오: 코드 실행 방지, 마크다운 코드블록 탐지, SQL/Python 주입 차단
📋 실제 사고 사례
2024년 3월 — 보안 연구원이 ChatGPT 플러그인에서 XSS(크로스사이트 스크립팅) 취약점을 발견. 악성 스크립트가 포함된 응답을 통해 사용자 세션 탈취 및 계정 탈취 가능성 확인. OpenAI에 책임공개 후 패치 완료.
🛡️ 가드레일 적용 효과: contains_code로 AI 응답에 포함된 script·SQL·쉘 명령어 등 실행 가능 코드를 사전에 차단할 수 있습니다.
출처: Wired, "Security Researchers Found a Way to Hack ChatGPT" (2024.3) · https://www.wired.com/story/chatgpt-plugin-vulnerabilities-2024/
⚡ BASIC · Deterministic
Data & Structure Validation · ③

Not Null · Contains

not_null
입력/출력이 null 또는 빈 값이 아닌지 검증
파라미터: (없음)
대상: Input / Output
// 빈 프롬프트 / null 응답 차단
사용 시나리오: 빈 프롬프트 방지, LLM 무응답 감지, API null 응답 핸들링
📋 실제 사고 사례
2024년 12월Apple Intelligence 뉴스 요약 기능이 BBC 기사 "Luigi Mangione 체포"를 "Luigi Mangione가 스스로 총을 쐈다"고 허위 생성해 푸시 알림 전송. BBC 공식 항의 → Apple, 뉴스 요약 기능 일시 중단.
🛡️ 가드레일 적용 효과: not_null 체크로 AI 응답의 필수 필드가 비어있지 않음을 보장하고, 사실 검증 레이어를 추가 적용할 수 있습니다.
출처: BBC News, "Apple AI news alerts halted after BBC complaint" (2025.1) · https://www.bbc.com/news/articles/cd0elz4j0p0o
⚡ BASIC · Deterministic
contains
텍스트에 특정 문자열 포함 여부 검증
파라미터: text (문자열), should_contain
대상: Input / Output
"text": "출처:",
"should_contain": true
사용 시나리오: 응답 품질 확인 (출처 포함), 금지어 필터링, 필수 키워드 포함 검증
📋 실제 사고 사례
2016년 3월Microsoft Tay 챗봇이 트위터 출시 24시간 만에 인종차별·홀로코스트 부정 등 극단적 혐오 발언을 학습·생성. 악의적 사용자들의 데이터 주입으로 AI가 통제 불능 상태 → Microsoft 긴급 서비스 중단.
🛡️ 가드레일 적용 효과: contains로 금지어·혐오 키워드 포함 여부를 실시간 검증해 유해 응답 출력 전 차단할 수 있습니다.
출처: The Verge, "Twitter taught Microsoft's AI chatbot to be racist" (2016.3.24) · https://www.theverge.com/2016/3/24/11297050/tay-microsoft-chatbot-racist
⚡ BASIC · Deterministic
📋 Data & Structure 요약: json_schema · json_keys · valid_urls · contains_code · not_null · contains
Security & Auth Validation

JWT Token · Request Parameters

jwt_token_validator
JWT 서명 검증 + 클레임(Claims) 검증
파라미터: secret_key, algorithm, claims (만료시간·발급자 등)
대상: Input
"secret_key": "${JWT_SECRET}",
"algorithm": "HS256",
"claims": {"exp": true, "iss": "auth.example.com"}
사용 시나리오: API 인증 토큰 검증, 만료된 토큰 차단, 위조 토큰 탐지, 서비스간 인증
📋 실제 사고 사례
2024년 1월 — 보안 연구원이 Hugging Face 플랫폼의 API 토큰 취약점 발견. JWT 토큰 검증 미흡으로 Meta, Microsoft, Google 등 주요 기업의 Private AI 모델에 무단 접근 가능. Hugging Face, 긴급 보안 패치 배포.
🛡️ 가드레일 적용 효과: jwt_token_validator로 토큰 서명·만료시간을 검증해 위조된 API 접근을 원천 차단할 수 있습니다.
출처: Wiz Research, "Hugging Face API token vulnerability" (2024.1) · https://www.wiz.io/blog/hugging-face-vulnerability-research
🔒 BASIC · Deterministic · 암호화 검증
request_params_check
요청 도구·파라미터 제어 및 검증
파라미터: allowed_tools, blocked_params, max_tokens
대상: Input
"allowed_tools": ["search", "calculator"],
"blocked_params": ["system_prompt", "role"], "max_tokens": 4096
사용 시나리오: Function Calling 제한, 민감 파라미터 차단, 토큰 한도 강제, 불필요한 도구 접근 방지
📋 실제 사고 사례
2024년 4월 — OWASP Top 10 for LLM Applications 공식 발표. LLM06: 과도한 에이전트 권한이 주요 위협으로 등재. "이메일 전체 삭제", "DB 초기화" 등 위험한 Function Calling 공격 PoC 다수 입증.
🛡️ 가드레일 적용 효과: request_params_check로 허용된 도구·파라미터만 통과시켜 LLM 에이전트의 과도한 시스템 명령 실행을 방지할 수 있습니다.
출처: OWASP Top 10 for LLM Applications (2024) · https://owasp.org/www-project-top-10-for-large-language-model-applications/
🔒 BASIC · Deterministic · 도구 접근 제어
Routing & Control · ①

Model Whitelist · Model Rules

model_whitelist
허용된 모델만 호출 가능하도록 제한
파라미터: allowed_models (모델 ID 배열)
대상: Input
"allowed_models": [
  "gpt-4o", "gpt-4o-mini", "claude-sonnet-4-20250514"
]
사용 시나리오: 비용 통제 (고가 모델 차단), 규제 준수 (허용 지역 모델만), 내부 정책 시행
📋 실제 사고 사례
2024년 6월 — 한 AI 스타트업이 비용 통제 없이 개발 환경에서 GPT-4 API 대량 호출 → 한 달 만에 $280,000 이상 청구. 모델 화이트리스트·Rate Limit 미적용이 원인. 업계에 경종을 울린 사례로 AI 커뮤니티에서 화제.
🛡️ 가드레일 적용 효과: model_whitelist로 비용 효율적인 모델만 허용하고, 개발 환경에서는 저가 모델로 제한해 과도한 비용 발생을 방지할 수 있습니다.
출처: Hacker News / r/MachineLearning 커뮤니티 다수 보고 (2024) · https://news.ycombinator.com/item?id=40651428
🛡️ BASIC · Deterministic · 모델 접근 제어
model_rules
요청 특성에 따른 동적 모델 라우팅 규칙
파라미터: rules (조건 → 모델 매핑 배열)
대상: Input
"rules": [
  {"condition": "prompt_len > 2000", "model": "gpt-4o"},
  {"condition": "default", "model": "gpt-4o-mini"}
]
사용 시나리오: 복잡도 기반 라우팅, 비용 최적화, SLA 기반 모델 선택
📋 실제 사고 사례
2024년 11월 8일OpenAI ChatGPT가 DDoS 공격으로 약 2시간 동안 전 세계 서비스 중단. API 기반 AI 서비스에 의존하던 수천 개 기업의 비즈니스 프로세스 일시 마비. OpenAI "비정상적 트래픽 패턴"으로 발표.
🛡️ 가드레일 적용 효과: model_rules 기반 Rate Limiting으로 트래픽 폭주를 사전 감지하고, Fallback 모델로 자동 전환해 서비스 연속성을 보장할 수 있습니다.
출처: The Verge, "ChatGPT is down for the second time today" (2024.11.8) · https://www.theverge.com/2024/11/8/24291583/chatgpt-down-outage-november-2024
🛡️ BASIC · Deterministic · 지능형 라우팅
Routing & Control · ②

Allowed Request Types · Routing Summary

allowed_request_types
허용된 요청 유형만 통과
파라미터: types (chat / completion / embedding / image 등)
대상: Input
"types": ["chat", "completion"]
사용 시나리오: 이미지 생성 API 차단, Embedding API 사용 제한, 대화형 API만 허용
📋 실제 사고 사례
2024년 10월 — 플로리다주 14세 소년이 Character.AI 챗봇과 수개월간 집중적 대화 후 자살. 어머니 Megan Garcia가 Character.AI 상대로 "위험한 제품" 과실致死 소송 제기 → AI 챗봇 안전 규제 논의 전 세계로 확산.
🛡️ 가드레일 적용 효과: allowed_request_types로 미성년자에게 위험한 유형의 AI 상호작용을 차단하고, 연령·컨텍스트 기반 접근 제어를 적용할 수 있습니다.
출처: The New York Times, "Character.AI Lawsuit" (2024.10.23) · https://www.nytimes.com/2024/10/23/technology/characterai-lawsuit-teen-suicide.html
🛡️ BASIC · Deterministic · API 유형 제어
📋 Routing & Control 요약
model_whitelist — 허용 모델 화이트리스트
model_rules — 조건부 모델 라우팅
allowed_request_types — 요청 유형 제한
핵심: 비용 통제 + 보안 정책 + 규제 준수를 위한 AI 트래픽의 통합 관문
PRO LLM Guardrails · ①

Detect Gibberish · Prompt Injection

detect_gibberish
LLM이 무의미한 텍스트를 감지
파라미터: threshold (탐지 임계값), language
대상: Input / Output
"threshold": 0.7,
"language": "ko"
사용 시나리오: 랜덤 문자열 입력 차단, LLM 환각 출력 감지, 키보드 매싱(mashing) 필터링
📋 실제 사고 사례
2024년 2월 — 시카고대학 Nightshade 프로젝트 연구팀이 AI 학습 데이터 오염(Poisoning) 공격 시연. 단 100장 미만의 독성 이미지를 LAION-5B 데이터셋에 주입해 Stable Diffusion의 "개" 개념 생성 완전히 파괴.
🛡️ 가드레일 적용 효과: detect_gibberish로 무의미·변칙적 입력 패턴을 필터링해 AI 학습 데이터 오염 공격을 사전 탐지할 수 있습니다.
출처: MIT Technology Review, "Nightshade: data poisoning tool" (2024.2) · https://www.technologyreview.com/2024/02/20/1088565/nightshade-data-poisoning-ai/
🧠 PRO · LLM-Based · 의미 기반 분석
scan_prompt_injection
LLM이 프롬프트 인젝션 공격을 탐지
파라미터: threshold, check_system_override
대상: Input
"threshold": 0.8,
"check_system_override": true
사용 시나리오: 시스템 프롬프트 탈취 시도 탐지, 'ignore previous instructions' 공격 차단, jailbreak 감지
📋 실제 사고 사례
2024년 9월 — 보안 연구원 Johann Rehberger가 Microsoft Copilot의 프롬프트 인젝션 취약점 발견. 악성 이메일 하나로 Copilot이 사용자의 모든 이메일·문서 접근 → "이전 지시사항 무시" 공격 성공. MS, 보안 패치 배포.
🛡️ 가드레일 적용 효과: scan_prompt_injection으로 "ignore previous instructions", "system override" 등의 패턴을 사전 탐지·차단할 수 있습니다.
출처: Ars Technica, "Microsoft Copilot prompt injection" (2024.9) · https://arstechnica.com/security/2024/09/microsoft-copilot-prompt-injection-attack/
🧠 PRO · LLM-Based · 보안 위협 탐지
⚠️ 가드레일 우회 공격 시나리오 (2026년 기준 위협 인텔리전스)
멀티턴 우회: 여러 턴에 걸쳐 점진적으로 가드레일 회피 — 최신 LLM도 방어 어려움
인코딩 공격: Base64·ROT13·유니코드 난독화로 키워드 기반 BASIC 필터 우회
컨텍스트 오염: RAG 파이프라인에 악성 문서 주입 → 검증된 답변으로 위장
다국어 우회: 저자원 언어(rare language)로 프롬프트 인젝션 → 영어 기반 탐지 회피
대응 전략: BASIC + PRO 다중 가드레일 중첩(Defense in Depth) + 정기적 AI Red Teaming + Canary 토큰 기반 프롬프트 유출 탐지
PRO LLM Guardrails · ②

PII Detection · Hallucination Check

detect_pii
LLM 출력에서 개인식별정보(PII) 탐지
파라미터: pii_types (이메일·전화번호·주민번호 등), action (deny/mask/log)
대상: Input / Output
"pii_types": ["email", "phone", "ssn", "credit_card"],
"action": "deny"
사용 시나리오: 민감정보 유출 방지, GDPR·개인정보보호법 컴플라이언스, 데이터 마스킹
📋 실제 사고 사례
2023년 7월 — FTC(미 연방거래위원회)가 OpenAI의 ChatGPT 데이터 수집 관행에 대해 전면 조사 착수. AI 학습 데이터에 포함된 PII(개인식별정보) 처리, 아동 개인정보 보호, 허위 정보 생성에 대한 소비자 보호법 위반 조사.
🛡️ 가드레일 적용 효과: detect_pii로 이메일·신용카드·주민번호 등 개인식별정보를 입력/출력 모두에서 탐지·마스킹하여 규제 리스크를 제거할 수 있습니다.
출처: The Washington Post, "FTC opens investigation into OpenAI" (2023.7.13) · https://www.washingtonpost.com/technology/2023/07/13/ftc-openai-chatgpt-sam-altman-lina-khan/
🧠 PRO · LLM-Based · 개인정보보호
hallucination_check
LLM 응답의 사실 정확성(Groundedness) 검증
파라미터: context (참조 문서), threshold, check_citations
대상: Output
"context": "",
"threshold": 0.85,
"check_citations": true
사용 시나리오: RAG 시스템 신뢰성 확보, 의료·법률 등 고위험 도메인, 고객응대 정확성 보장
📋 실제 사고 사례
2023년 5월Mata v. Avianca 사건: 변호사 Steven Schwartz가 ChatGPT로 생성한 가상 판례 6건(Varghese v. China Southern Airlines 등)을 연방법원에 제출. P. Kevin Castel 판사 "전례 없는 상황" → 변호사 징계 및 $5,000 벌금.
🛡️ 가드레일 적용 효과: hallucination_check로 AI 출력의 사실 관계를 참조 문서와 대조 검증해 가상 판례·허위 정보 인용을 방지할 수 있습니다.
출처: The New York Times, "Here's What Happens When Your Lawyer Uses ChatGPT" (2023.5.27) · https://www.nytimes.com/2023/05/27/nyregion/avianca-airline-lawsuit-chatgpt.html
🧠 PRO · LLM-Based · 사실 검증
🧠 PRO LLM 추가 가능: detect_toxicity · detect_language · detect_topic · custom_prompt_check
Implementation Checklist

가드레일 도입 체크리스트

1. Input Guardrails 먼저: 프롬프트 검증으로 LLM 호출 전 차단
2. BASIC Tier 우선: 빠르고 비용 없이 80% 커버
3. Output Guardrails 추가: 응답 품질·안전성 보장
4. Action 선택: deny(보안) → log(모니터링) → fallback(가용성)
5. PRO Tier는 신중하게: 맥락 이해가 필요한 고위험 시나리오에만
6. 지속적 모니터링: evals 액션으로 실패 데이터 축적 → 개선
📊 포트키 가드레일 핵심 수치
22개 BASIC(18) + PRO(4) 체크 항목
7 Actions (deny·log·evals·fallback·retry·alert·transform)
2 Tiers (BASIC Deterministic + PRO LLM-Based)
~0ms BASIC 체크 지연시간 (vs PRO: 수백ms~수초)
출처: Guardrails Documentation
📰 EU AI Act 가드레일 요구사항 📰 KISA AI 보안 가이드라인 📰 NIST AI RMF Playbook 📰 MS Responsible AI 📰 Google SAIF 📰 OECD AI 원칙 📰 Anthropic RSP 📰 Stanford CRFM FMTI
Global Research · 세계 연구 동향

🏛️ AI 가드레일 최신 연구·도구

🛡️ NVIDIA NeMo Guardrails
• 오픈소스 Python 패키지 (PyPI + GitHub)
• 5대 레일: Input·Retrieval·Dialog·Execution·Output
• Colang: 대화형 흐름 정의 언어
• Jailbreak 차단·PII 마스킹·토픽 제어 통합
• 라이브러리 → Microservice(K8s) 포팅 가능
🔬 Guardrails AI · 오픈소스 프레임워크
• Guardrails Hub: 수백 개 사전 정의된 검증기
• Snowglobe: 합성 데이터 기반 AI 테스트
• 할루시네이션·데이터 유출·정책 위반 실시간 감지
• 모든 LLM·배포 환경 호환
🔬 Anthropic · Constitutional AI
• 인간 피드백 대신 헌법(Constitution) 기반 정렬
• Claude의 안전성·유해성 통제 핵심 기술
• "Teaching Claude why" (2026.5) — 에이전트 정렬 연구
• Responsible Scaling Policy (RSP) 기반 안전 계층
🏫 Stanford · MIT · ETH Zurich 연구
• Stanford HAI: AI Safety Benchmark, FMTI
• MIT AI Risk: Guardrails Governance Framework
• ETH Zurich CSS: AI 시스템 안전성 검증 방법론
• Google SAIF: Secure AI Framework
📚 참고문헌
📚 NVIDIA NeMo Guardrails — 오픈소스 AI 가드레일 프레임워크 (GitHub)
📚 AI Guardrails — 통합 AI 게이트웨이 및 가드레일 플랫폼
📚 MITRE ATLAS — Adversarial Threat Landscape for AI Systems
📚 Anthropic RSP (Responsible Scaling Policy) — Constitutional AI 기반 안전 정책
📚 NIST AI RMF Generative AI Profile (NIST AI 600-1, 2024년)