LLM Guard యొక్క రిపోజిటరీ జూలై 9, 2026న ఆర్కైవ్ మోడ్కు మార్చబడింది, దీనితో కోడ్ మరియు మోడల్ అప్డేట్లన్నీ ముగిశాయి.
ఈ మార్పు ఎందుకు ముఖ్యం
మేనేజ్డ్ సర్వీస్ కోసం డబ్బు చెల్లించకుండా, డెవలపర్లు "rails" (ఒక లార్జ్ లాంగ్వేజ్ మోడల్ (LLM) ముందు లేదా వెనుక ఉండే తనిఖీలు) జోడించడానికి అనుమతించే కొన్ని ఉచిత, కమ్యూనిటీ-నిర్వహించబడే టూల్కిట్లలో LLM Guard ఒకటి. ఈ ప్రాజెక్ట్ నిలిచిపోవడంతో, ఆ రక్షణ కవచాలు (safeguards) మాయమవుతాయి. అదే సమయంలో, విస్తృతమైన AI-సెక్యూరిటీ మార్కెట్ ఏకీకృతం అవుతోంది: Protect AIని Palo Alto Networks, Lakeraని Check Point విలీనం చేశాయి, మరియు OpenAI promptfooను కొనుగోలు చేసింది. మార్కెట్ స్వతంత్ర ప్రాజెక్ట్ల సమూహం నుండి కొన్ని ప్లాట్ఫారమ్-లెవల్ ఆఫర్ల వైపు మారుతోంది, మరియు డెవలపర్లు తమ తదుపరి రక్షణ వ్యవస్థను ఎక్కడ ఏర్పాటు చేయాలో నిర్ణయించుకోవాలి.
పరిష్కరించాల్సిన మూడు గార్డ్రైల్ సమస్యలు
- Input rails – యూజర్ ప్రాంప్ట్ మోడల్కు చేరుకోకముందే దానిని పరిశీలించే ఫిల్టర్లు, ఇవి ఇంజెక్షన్ ప్రయత్నాలను మరియు జైల్బ్రేక్ పద్ధతులను అడ్డుకుంటాయి.
- Output rails – మోడల్ యొక్క ప్రతిస్పందనను అంచనా వేసే స్కానర్లు, ఇవి విషపూరిత భాష (toxic language), కాపీరైట్ చేయబడిన మెటీరియల్ లేదా అనుకోకుండా వ్యక్తిగత డేటా బయటపడకుండా నిరోధిస్తాయి.
- Red-team testing – మోడల్ మరియు దాని గార్డ్లు తెలిసిన అటాక్ ప్యాటర్న్లకు వ్యతిరేకంగా ఎలా పనిచేస్తాయో ధృవీకరించడానికి డెవలప్మెంట్ సమయంలో (సాధారణంగా CI/CD పైప్లైన్లలో) నడిపే అడ్వర్సరియల్ టెస్ట్ సూట్. ఈ దశ ప్రొడక్షన్కు వెళ్లే ముందే బలహీనతలను బయటపెడుతుంది; ఇది రన్టైమ్ ఫిల్టర్ కాదు.
రెడ్-టీమ్ టెస్టింగ్ను లైవ్ బ్లాక్గా పరిగణించడం వల్ల తప్పుడు భద్రతా భావం (false sense of security) కలగవచ్చు.
ఇంకా అందుబాటులో ఉన్న ఓపెన్-సోర్స్ ప్రత్యామ్నాయాలు
| Tool | License | ఉత్తమ వినియోగం |
|---|---|---|
| NeMo Guardrails | Apache 2.0 | సంక్లిష్టమైన మల్టీ-టర్న్ డైలాగ్లు మరియు రిట్రీవల్-ఆగ్మెంటెడ్ జనరేషన్; గార్డ్రైల్ లాజిక్ను ప్రకటించడానికి Colang అనే డొమైన్-స్పెసిఫిక్ లాంగ్వేజ్ని ఉపయోగిస్తుంది. |
| Guardrails AI | Apache 2.0 | ఇన్క్రిమెంటల్ వాలిడేషన్ – బూతులు లేదా అనుమతించబడని అంశాల వంటి నిర్దిష్ట రిస్క్ కోసం ఒక సమయంలో ఒక రూల్ను జోడించవచ్చు. |
| Presidio | MIT | వ్యక్తిగత గుర్తింపు సమాచారం (PII) యొక్క ఆఫ్లైన్ డిటెక్షన్ మరియు మాస్కింగ్; ఇది ఇప్పుడు కమ్యూనిటీ యాజమాన్యంలో ఉంది, కానీ తప్పుడు పాజిటివ్లను (false positives) నివారించడానికి మీరు స్వయంగా ఎంటిటీ లిస్ట్ను నిర్వచించాలి. |
| Llama Prompt Guard 2 | ప్రాంప్ట్ ఇంజెక్షన్లు మరియు జైల్బ్రేక్ ప్రయత్నాలను గుర్తించడంపై దృష్టి సారించిన సెల్ఫ్-హోస్టెడ్ క్లాసిఫైయర్. | |
| promptfoo | MIT | CI పైప్లైన్లతో ఇంటిగ్రేట్ అయ్యే రెడ్-టీమ్ ఫ్రేమ్వర్క్; ఇది మీ మోడల్పై వందలాది అటాక్ వెక్టర్లను రన్ చేసి, విజయవంతమైన వాటిని రిపోర్ట్ చేయగలదు. |
ఈ ప్రాజెక్ట్లకు ఇంకా కమ్యూనిటీ సహకారం అందుతోంది మరియు వాటి సోర్స్ కోడ్ సెల్ఫ్-హోస్టింగ్ లేదా కస్టమ్ పైప్లైన్లలో ఎంబెడ్ చేసుకోవడానికి ఉచితంగా అందుబాటులో ఉంది.
పరిశీలించదగిన మేనేజ్డ్ గార్డ్రైల్స్
మీరు టర్న్కీ సొల్యూషన్ను కోరుకుంటే, రెండు ప్రధాన క్లౌడ్ ప్రొవైడర్లు ఇప్పుడు తమ LLM ఆఫర్లలో గార్డ్రైల్స్ను బండిల్ చేస్తున్నారు:
- Amazon Bedrock Guardrails – ప్రతి రిక్వెస్ట్కు టోగుల్ చేయగల కాన్ఫిగర్ చేయదగిన పాలసీలు.
- Azure Prompt Shields – Azure OpenAI సర్వీస్తో ఇంటిగ్రేట్ చేయబడిన ఇటువంటి రన్టైమ్ ఫిల్టర్లు.
రెండూ ప్రతి రిక్వెస్ట్కు ఫీజు వసూలు చేస్తాయి; పది లక్షల కాల్స్ త్వరగా వందల డాలర్లకు చేరుకోవచ్చు. బడ్జెట్ పట్ల జాగ్రత్తగా ఉండే టీమ్లు వాటిని పెద్ద ఎత్తున అమలు చేసే ముందు ఆశించిన ట్రాఫిక్ను మోడల్ చేయాలి.
మీ సెక్యూరిటీ స్టాక్ను ఎలా పునర్నిర్మించాలి
- “lethal trifecta”ను మ్యాప్ చేయండి. మీ అప్లికేషన్ (a) ప్రైవేట్ డేటా స్టోర్లు, (b) నమ్మకం లేని యూజర్ ఇన్పుట్ మరియు (c) ఎక్స్టర్నల్ నెట్వర్క్ కాల్స్ను ఎక్కడ తాకుతుందో గుర్తించండి. వీటిలో ఏదైనా ఒక దానిని తొలగించడం వల్ల ఏ ఒక్క గార్డ్రైల్ కంటే ఎక్కువ అటాక్ సర్ఫేస్ను తగ్గిస్తుంది.
- Presidioని త్వరగా ఉపయోగించండి. మీరు మోడల్కు అందించాలనుకుంటున్న ఏ డేటాకైనా దీనిని రన్ చేయండి. ఎంటిటీ లిస్ట్ను అనుకూలీకరించండి – డిఫాల్ట్ సెట్ అనేక సాధారణ స్ట్రింగ్లను PIIగా గుర్తించవచ్చు, ఇది డౌన్స్ట్రీమ్ ప్రాసెసింగ్ను దెబ్బతీస్తుంది.
- ఇన్పుట్ రైల్ను జోడించండి. Llama Prompt Guard 2 వంటి లైట్వెయిట్ క్లాసిఫైయర్ లేదా Guardrails AI నుండి రూల్-బేస్డ్ గార్డ్తో ప్రారంభించండి. స్పష్టమైన ఇంజెక్షన్ ప్యాటర్న్లు మోడల్కు చేరుకోకముందే వాటిని అడ్డుకోండి.
- అవుట్పుట్ చెక్లను లేయర్లుగా అమర్చండి. NeMo Guardrails లేదా Guardrails AI మోడల్ యొక్క సమాధానాన్ని పోస్ట్-ప్రాసెస్ చేయగలవు, తద్వారా తప్పించుకున్న విషపూరిత భాష లేదా రహస్య సమాచారాన్ని తొలగించవచ్చు.
- promptfooని CIలో ఇంటిగ్రేట్ చేయండి. దాని రిపోర్ట్లను చెక్లిస్ట్గా పరిగణించండి; కొత్తగా కనుగొనబడిన ప్రతి బైపాస్ను మీ ఇన్పుట్ లేదా అవుట్పుట్ రైల్లో ఒక రూల్గా కోడిఫై చేయాలి.
- ప్రతి బ్లాక్ను లాగ్ చేయండి. అసలు రిక్వెస్ట్, తిరస్కరణకు కారణం మరియు తీసుకున్న చర్యను నిల్వ చేయండి. లాగ్లు లేకపోతే మీరు థ్రెషోల్డ్లను సర్దుబాటు చేయలేరు లేదా కంప్లయన్స్ ఆడిట్ చేయలేరు.
కౌంటర్-పాయింట్: మేనేజ్డ్ సర్వీసెస్ వర్సెస్ ఓపెన్ సోర్స్
Managed guardrails spare you the operational overhead of self-hosting, patching and scaling classifiers. However, they lock you into a provider’s pricing and policy model, which may not match niche regulatory requirements. Open-source tools give you full control and can run on-premise, but they demand engineering effort to keep them updated and to monitor for new attack techniques. Teams should weigh the cost of staff time against the per-request fees of a cloud guardrail.
What to watch next
- Vendor roadmaps. Keep an eye on Palo Alto’s and Check Point’s AI-security product announcements; they are likely to fold the capabilities of the acquired tools into broader suites.
- Community activity. Gauge the health of projects like NeMo Guardrails and Presidio by recent pull-request activity and release frequency. A stagnant repo may signal that a newer alternative is emerging.
- Regulatory guidance. As governments tighten rules on AI-generated content and data protection, any guardrail strategy must be auditable. Logging and traceability will become mandatory in many jurisdictions.
Takeaway
With LLM Guard officially retired, developers must stitch together a mix of input filters, output sanitizers and adversarial testing to keep their LLM-powered applications safe. Open-source projects such as NeMo Guardrails, Guardrails AI, Presidio, Llama Prompt Guard 2 and promptfoo provide the building blocks, while cloud-native guardrails offer convenience at a price. The decisive factor is not which tool you pick, but whether you establish a systematic process—audit, protect, test, and log—that stays ahead of the evolving threat environment.
