input_guardrails → 사용자 프롬프트에 적용output_guardrails → 모델 응답에 적용
| 분류 | ID | 위협 항목 | 핵심 진단 기준 | OWASP LLM |
|---|---|---|---|---|
| 데이터 위협 | D01 | 불균형 데이터 | 학습 데이터의 출처·언어·사용자군 편중 검토 및 완화 조치 여부 | — |
| D02 | 부정확한 데이터 | 사실성·정확성 검증 기준 수립, 정정·재수집 조치 및 이력 기록 여부 | LLM09 | |
| D03 | 개인정보 비식별화 미흡 | 가명·익명 처리, 원본/비식별 데이터 분리 통제, 영향평가 수행 여부 | LLM02 | |
| 모델 위협 | M01 | 학습 데이터 유출 | 반복 질의에 의한 학습 데이터 복원 차단, 악성 입력 차단 여부 | LLM02 |
| M02 | 벡터DB·임베딩 유출 | 벡터 DB 접근 통제, RAG 검색 결과의 민감정보 노출 관리 여부 | LLM08 | |
| M03 | 시스템 프롬프트 유출 | 시스템 프롬프트 공개 요청 응답 제한, 출력 노출 통제 여부 | LLM07 | |
| M04 | 모델 유출 | 가중치 접근 제한, 추론 API 비정상 호출 제한, 로짓 정보 최소화 여부 | — | |
| M05 | 환각 | 허위 정보 생성 가능성 평가, 출처 검증 절차, 오류 고지 여부 | LLM09 | |
| M06 | 탈옥 | 정책 우회 요청 탐지·차단, 유해 콘텐츠 전달 전 차단 여부 | LLM01 | |
| M07 | 부적절한 출력 처리 | 출력 안전 검증(필터링·이스케이핑), 시스템 명령·코드 직접 삽입 통제 여부 | LLM05 | |
| M08 | 모델 DoS | 과부하 방지(입력 검증·요청 제한), 비정상 트래픽 차단 절차 여부 | LLM10 | |
| 에이전트 위협 | A01 | 부적절한 도구 설계 | 도구 권한 최소화, 입력값 검증, 도구 호출 이력 기록·탐지 여부 | LLM06 |
| A02 | 에이전트 하이재킹 | 악성 지침 탐지·제거, 외부 데이터 신뢰성 검증, 승인된 소스 접근 제한 여부 | LLM01 | |
| A03 | 에이전트 DoS | 작업 시간 제한, 요청 빈도 제한, 비정상 패턴 자동 중단 여부 | LLM10 | |
| A04 | 에이전트 메모리 오염 | 장기 메모리 권한 제어, 금칙어·명령 패턴 차단, 무결성 주기 검토 여부 | LLM08 | |
| 공급망 위협 | S01 | 데이터 포이즈닝 | 학습·연계 데이터의 악의적 조작 평가, 출처·이력 기록 관리 여부 | LLM04 |
| S02 | 모델 포이즈닝 | 외부 모델·가중치 파일 악성 포함 점검, 버전·변경 이력 관리 여부 | LLM04 | |
| S03 | 취약한 추론 엔진 | 추론 엔진·런타임의 알려진 취약점 정기 점검 여부 | LLM03 | |
| S04 | 취약한 확장요소 | 에이전트 확장요소의 알려진 취약점 정기 점검 여부 | LLM03 |
regex (패턴), should_match (true/false)min, maxmin, maxmin, maxmin, max (비율 0~1)min, max (비율 0~1)text (접미사), case_sensitiveschema (JSON Schema 객체)keys (필수 키 배열), mode (all/any)allow_redirects, allowed_domainsshould_contain (true: 코드 필수 / false: 코드 금지)text (문자열), should_containsecret_key, algorithm, claims (만료시간·발급자 등)allowed_tools, blocked_params, max_tokensallowed_models (모델 ID 배열)rules (조건 → 모델 매핑 배열)types (chat / completion / embedding / image 등)threshold (탐지 임계값), languagethreshold, check_system_overridepii_types (이메일·전화번호·주민번호 등), action (deny/mask/log)context (참조 문서), threshold, check_citations