Version 2025-09-22
By Spencer Brawner
Secure RAG: Architecture and Hardening
RAG security AI security Retrieval augmented generation Context security Source validation Data sanitization
TL;DR
RAG blends model reasoning with retrieved context. Risks arise when retrieved content carries hidden instructions, sensitive data, or untrusted links. Harden by sanitizing inputs, signing/whitelisting sources, chunking and metadata controls, query filtering, and output validation. Log retrievals for forensics.
Section 01 // Key Facts
5 facts documented Key Facts
Section 02 // Implementation
5 steps Implementation Steps
- 01
Trust model for sources → signed sources, allow-lists.
- 02
Pre-processing filters → strip directives, PII filters.
- 03
Chunk & tag → chunk size policy, metadata schema.
- 04
Query filters & rate limits → rules, quotas.
- 05
Output validation & logging → validators, retrieval logs.
Section 03 // Glossary
6 terms Glossary
Section 04 // References
2 sources References
-
[1]
NIST AI Risk Management Framework https://www.nist.gov/itl/ai-risk-management-framework
-
[2]
ISO 42001 AI Management Systems Standard https://www.iso.org/standard/78380.html
Section 05 // Facts
3 claims Machine-Readable Facts
[
{
"id": "f-surface",
"claim": "RAG increases attack surface through retrieved or user-provided context.",
"source": "https://www.nist.gov/itl/ai-risk-management-framework"
},
{
"id": "f-sanitize",
"claim": "Sanitization and source allow-lists mitigate prompt injection via context.",
"source": "https://www.nist.gov/itl/ai-risk-management-framework"
},
{
"id": "f-logs",
"claim": "Retrieval logging supports incident investigation and assurance.",
"source": "https://www.iso.org/standard/78380.html"
}
]