ਇੱਕ ਵੱਡੇ ਭਾਸ਼ਾ ਮਾਡਲ (large language model) ਨੂੰ ਕੀਤੀ ਗਈ ਹਰ ਕਾਲ ਤੁਹਾਡੇ ਬਜਟ ਨੂੰ ਖਤਮ ਕਰਦੀ ਹੈ ਅਤੇ ਤੁਹਾਡੇ ਉਪਭੋਗਤਾਵਾਂ ਦੇ ਸਬਰ ਦੀ ਪ੍ਰੀਖਿਆ ਲੈਂਦੀ ਹੈ। ਜੇਕਰ ਪੰਜਾਹ ਲੋਕ ਲਗਭਗ ਇੱਕੋ ਜਿਹੀ ਗੱਲ ਪੁੱਛਦੇ ਹਨ, ਤਾਂ ਰਵਾਇਤੀ ਬੁਨਿਆਦੀ ਢਾਂਚਾ ਤੁਹਾਨੂੰ ਪੰਜਾਹ ਵੱਖ-ਵੱਖ API ਰਿਕਵੈਸਟਾਂ ਪ੍ਰੋਸੈਸ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕਰਦਾ ਹੈ। ਅਜਿਹਾ ਇਸ ਲਈ

LiteLLM ਇੱਕ ਯੂਨੀਵਰਸਲ API ਵਜੋਂ ਕੰਮ ਕਰਦਾ ਹੈ। ਤੁਸੀਂ ਇੱਕ ਇੰਟਰਫੇਸ ਵਿੱਚ ਲਿਖਦੇ ਹੋ ਅਤੇ ਇਹ ਤੁਹਾਡੀ ਪਸੰਦ ਦੇ ਕਿਸੇ ਵੀ ਬੈਕਐਂਡ (backend) ਵਿੱਚ ਬੇਨਤੀਆਂ ਨੂੰ ਅਨੁਵਾਦ ਕਰ ਦਿੰਦਾ ਹੈ। ਇਸਦਾ ਕੈਸ਼ਿੰਗ ਮੋਡਿਊਲ ਕਈ ਐਪਲੀਕੇਸ਼ਨ ਸਰਵਰਾਂ ਵਿੱਚ ਸਾਂਝੇ ਕੈਸ਼ਾਂ ਲਈ Redis, ਜਾਂ ਹਲਕੇ ਸਿੰਗਲ-ਨੋਡ ਡਿਪਲਾਈਮੈਂਟਾਂ ਲਈ ਲੋਕਲ ਮੈਮੋਰੀ ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ। ਇਹ ਲਚਕਤਾ ਉਹਨਾਂ ਟੀਮਾਂ ਲਈ ਇਸਨੂੰ ਆਕਰਸ਼ਕ ਬਣਾਉਂਦੀ ਹੈ ਜੋ ਆਪਣੇ ਸਟੈਕ ਨੂੰ ਦੁਬਾਰਾ ਡਿਜ਼ਾਈਨ ਕੀਤੇ ਬਿਨਾਂ ਪ੍ਰੋਟੋਟਾਈਪ ਤੋਂ ਪ੍ਰੋਡਕਸ਼ਨ ਵੱਲ ਵਧ ਰਹੀਆਂ ਹਨ।

LangChain ਤੁਹਾਨੂੰ ਫਰੇਮਵਰਕ-ਪੱਧਰੀ ਪਹੁੰਚ ਦਿੰਦਾ ਹੈ। ਜੇਕਰ ਤੁਸੀਂ ਪਹਿਲਾਂ ਹੀ LangChain ਨਾਲ ਚੇਨਾਂ (chains) ਅਤੇ ਏਜੰਟਾਂ (agents) ਦਾ ਪ੍ਰਬੰਧ ਕਰਦੇ ਹੋ, ਤਾਂ ਤੁਸੀਂ Chroma ਜਾਂ FAISS ਵਰਗੇ ਵੈਕਟਰ ਸਟੋਰਾਂ (vector stores) ਦੁਆਰਾ ਸਮਰਥਿਤ ਕਸਟਮ ਸੈਮੈਂਟਿਕ ਕੈਸ਼ਾਂ (semantic caches) ਨੂੰ ਜੋੜ ਸਕਦੇ ਹੋ। Chroma ਸਥਾਨਕ ਪ੍ਰਯੋਗਾਂ ਅਤੇ ਛੋਟੇ ਡੇਟਾਸੈਟਾਂ ਲਈ ਵਧੀਆ ਕੰਮ ਕਰਦਾ ਹੈ। FAISS ਉਦੋਂ ਸ਼ਾਨਦਾਰ ਹੁੰਦਾ ਹੈ ਜਦੋਂ ਤੁਹਾਨੂੰ ਵੱਖਰੀ ਡਾਟਾਬੇਸ ਸੇਵਾ ਚਲਾਏ ਬਿਨਾਂ ਤੇਜ਼, ਇਨ-ਮੈਮੋਰੀ ਅਪ੍ਰੌਕਸੀਮੇਟ ਸਰਚ (approximate search) ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।

Pinecone ਜਾਂ Milvus ਵਰਗੇ ਵੈਕਟਰ ਡਾਟਾਬੇਸਾਂ ਦੀ ਵਰਤੋਂ ਕਰਨ ਵਾਲੇ ਸਵੈ-ਪ੍ਰਬੰਧਿਤ ਸੈੱਟਅੱਪ (Self-managed setups) ਉਹਨਾਂ ਟੀਮਾਂ ਲਈ ਹਨ ਜਿਨ੍ਹਾਂ