Enterprise retrieval-augmented generation (RAG) now runs through API gateways, service meshes, vector stores, relational catalogs, model endpoints, evidence validators, and audit systems. Static gateway rules are not enough for this setting because each request may require different retrieval partitions, privacy views, context budgets, model contracts, and latency targets. This paper proposes SAM-RAG, a self-optimizing API mesh for distributed RAG at enterprise scale. SAM-RAG combines governed API-gateway intents, cross-cloud workload placement, hybrid semantic-relational retrieval, distributed RAG partitioning, contract-driven tool interoperability, privacy enforcement, and low-memory sequence context selection. It extends Policy-Verified Agentic DataOps for Regulated Multi-Cloud Analytics, Retrieval-Grounded Documentation Agents for Enterprise Compliance Evidence, Cross-Cloud LLMOps Scheduler for Privacy-Budgeted RAG and Inference, and Contract-Driven Multi-Agent Incident Response for Cloud-Native Platforms into a request-time optimization layer for RAG traffic. In a simulated enterprise benchmark, SAM-RAG improves evidence-supported answer rate from 0.846 to 0.931, reduces P95 request latency from 6.8 s to 3.9 s, lowers policy-violation rate from 3.7% to 0.3%, and cuts manual incident escalations for RAG routes by 41.2%.
Kannan et al. (Fri,) studied this question.