ಒಬ್ಬ ಡೆವಲಪರ್ 350 ಮಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್‌ಗಳಿರುವ ಭಾಷಾ ಮಾದರಿಯನ್ನು (language model) ತೆಗೆದುಕೊಂಡು, ಅದನ್ನು ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡಿ, ಯಾವುದೇ ಸರ್ವರ್ ಕರೆಗಳು, API ಕೀಗಳು ಅಥವಾ ಕ್ಲೌಡ್ ಬಿಲ್ ಇಲ್ಲದೆ ಯಾವುದೇ ಆಧುನಿಕ ವೆಬ್ ಬ್ರೌಸರ್‌ನಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಸಂಪೂರ್ಣವಾಗಿ ಕಾರ್ಯक्षम AI ಅಸಿಸ್ಟೆಂಟ್ ಆಗಿ ನಿಯೋಜಿಸಿದ್ದಾರೆ.

ಈ ಯೋಜನೆಯು ಮಾದರಿಯ ತೂಕಗಳನ್ನು (weights) ಒಂದು ಸ್ಟ್ಯಾಟಿಕ್ ವೆಬ್‌ಪೇಜ್‌ನೊಂದಿಗೆ ಒದಗಿಸುತ್ತದೆ, ಇದು ಏಜೆಂಟ್ ಪರಿಕರಗಳನ್ನು (tools) ಆಯ್ಕೆ ಮಾಡಲು, ಆರ್ಗ್ಯುಮೆಂಟ್‌ಗಳನ್ನು ಬೈಂಡ್ ಮಾಡಲು, “ಎರಡನೆಯದು” ಎಂಬಂತಹ ಉಲ್ಲೇಖಗಳನ್ನು ಪರಿಹರಿಸಲು ಮತ್ತು ಮಾಹಿತಿ ಇಲ್ಲದಿದ್ದಾಗ ಉತ್ತರಿಸಲು ನಿರಾಕರಿಸಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ—ಇವೆಲ್ಲವೂ ನಿಮ್ಮ ಡೇಟಾ ನಿಮ್ಮದೇ ಸಾಧನದಲ್ಲಿ ಉಳಿಯುವಂತೆ ಮಾಡುತ್ತದೆ.

ಬ್ರೌಸರ್-ಆಧಾರಿತ ಏಜೆಂಟ್ ಅನ್ನು ಹೇಗೆ ನಿರ್ಮಿಸಲಾಯಿತು

ಇದರ ಆರಂಭಿಕ ಹಂತವು LiquidAI ನ LFM2.5 ಕುಟುಂಬದ, ವಿಶೇಷವಾಗಿ 230M ಮತ್ತು 350M ಪ್ಯಾರಾಮೀಟರ್ ಆವೃತ್ತಿಗಳಾಗಿತ್ತು.

ಉತ್ಪನ್ನಗಳ ಕ್ಯಾಟಲಾಗ್‌ಗಳು ಅಥವಾ ಬೆಲೆ ಪಟ್ಟಿಗಳನ್ನು ಮಾದರಿಗೆ ತುಂಬುವ ಬದಲು, ತರಬೇತುದಾರರು ಅದಕ್ಕೆ ಸಂವಹನದ ಮಾದರಿಗಳನ್ನು (patterns) ಕಲಿಸಿದರು. ಏಜೆಂಟ್‌ಗೆ ನಿರ್ದಿಷ್ಟ SKU ಎಂದಿಗೂ ತಿಳಿದಿರುವುದಿಲ್ಲ; ಬದಲಾಗಿ ಅದು ಈ ಕೆಳಗಿನವುಗಳನ್ನು ಕಲಿಯುತ್ತದೆ:

  • ಒಂದು ನಿರ್ದಿಷ್ಟ ವಿನಂತಿಗೆ ಸೂಕ್ತವಾದ ಪರಿಕರವನ್ನು (tool) ಆಯ್ಕೆ ಮಾಡುವುದು.
  • ಆ ಪರಿಕರಕ್ಕೆ ಸರಿಯಾದ ಆರ್ಗ್ಯುಮೆಂಟ್‌ಗಳು ಮತ್ತು ಐಡೆಂಟಿಫೈಯರ್‌ಗಳನ್ನು ಬೈಂಡ್ ಮಾಡುವುದು.
  • ಅಸ್ಪಷ್ಟ ಉಲ್ಲೇಖಗಳನ್ನು ಅರ್ಥೈಸಿಕೊಳ್ಳುವುದು (“ಒಂದು ಡಜನ್,” “ಎರಡನೆಯದು”).
  • ಬಾಹ್ಯ ಪಠ್ಯವನ್ನು ಪಡೆದು ಅದನ್ನು ಪ್ರಶ್ನೆಗಳಿಗೆ ಉತ್ತರಿಸಲು ಬಳಸುವುದು.
  • ಅಗತ್ಯ ಮಾಹಿತಿ ಇಲ್ಲದಿದ್ದಾಗ ನಿರಾಕರಿಸುವುದು.
  • ಸಂಭಾಷಣೆಯನ್ನು ವಿಷಯಕ್ಕೆ ಅನುಗುಣವಾಗಿ ಇರಿಸಿಕೊಳ್ಳುವುದು.

ಪರಿಕರಗಳ ಸೆಟ್ (toolset) ಉದ್ದೇಶಪೂರ್ವಕವಾಗಿ ಸ್ಟ್ಯಾಟಿಕ್ ಆಗಿದೆ: list_items, get_item, search_knowledge, add_to_cart, remove_from_cart, clear_cart, checkout, ಮತ್ತು navigate. ಈ ಪಟ್ಟಿಯನ್ನು ಸ್ಥಿರವಾಗಿರಿಸುವುದರಿಂದ ಮಾದರಿಯು tool IDs ಅನ್ನು ನೆನಪಿಟ್ಟುಕೊಳ್ಳುವುದನ್ನು ತಡೆಯುತ್ತದೆ ಮತ್ತು ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಡೇಟಾವನ್ನು ಚಿಕ್ಕದಾಗಿಡುತ್ತದೆ.

ಮೂರು ಎಂಜಿನಿಯರಿಂಗ್ ಆಯ್ಕೆಗಳು ವ್ಯವಸ್ಥೆಯನ್ನು ಲೈಟ್‌ವೇಟ್ ಆಗಿಡುತ್ತವೆ:

  1. Frozen tool roster – ಮಾದರಿಯು ನಿರ್ದಿಷ್ಟ ಕ್ರಿಯೆಗಳ ಪಟ್ಟಿಯನ್ನು ನೋಡುತ್ತದೆ, ಆದ್ದರಿಂದ ಅದಕ್ಕೆ ಪರಿಕರಗಳ ಹೆಸರುಗಳ ದೊಡ್ಡ ಶಬ್ದಕೋಶದ ಅಗತ್ಯವಿಲ್ಲ.
  2. RAG as a tool – Retrieval-augmented generation (RAG) ಇತರ ಯಾವುದೇ ಫಂಕ್ಷನ್‌ನಂತೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ. ಏಜೆಂಟ್ ಪಠ್ಯವನ್ನು ಪಡೆಯಲು search_knowledge ಅನ್ನು ಕರೆಯುತ್ತದೆ, ನಂತರ ಆ ಪಠ್ಯವನ್ನು ನೇರವಾಗಿ ತನ್ನ ಪ್ರತಿಕ್ರಿಯೆಯಲ್ಲಿ ಸೇರಿಸುತ್ತದೆ, ಇದು ವಿಳಂಬ (latency) ಮತ್ತು ಮೆಮೊರಿ ಓವರ್‌ಹೆಡ್ ಅನ್ನು ಹೆಚ್ಚಿಸುವ ಪ್ರತ್ಯೇಕ ರಿಟ್ರಿೀವಲ್ ಪೈಪ್‌ಲೈನ್ ಅನ್ನು ತಪ್ಪಿಸುತ್ತದೆ.
  3. Grammar-constrained decoding – ಜನರೇಷನ್ ಸಮಯದಲ್ಲಿ, ಡಿಕೋಡರ್ ಸರಳ ವ್ಯಾಕರಣವನ್ನು ಅನುಸರಿಸುತ್ತದೆ, ಇದು ಔಟ್‌ಪುಟ್ ಅನ್ನು ಮಾನ್ಯವಾದ tool-call ರಚನೆಗೆ ಬಲವಂತ ಮಾಡುತ್ತದೆ. ಈ ನಿರ್ಬಂಧವು ವ್ಯರ್ಥ ಟೋಕನ್‌ಗಳನ್ನು ತೆಗೆದುಹಾಕುತ್ತದೆ ಮತ್ತು ತಪ್ಪಾದ ಕಮಾಂಡ್‌ಗಳನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.

ತರಬೇತಿಯಲ್ಲಿ ಸಿಂಥೆಟಿಕ್ ಡೇಟಾ ಡಿಸ್ಟಿಲೇಶನ್ (synthetic data distillation) ಬಳಸಲಾಯಿತು. ಲೇಖಕರು 18 ಸಂವಹನ ರೆಸಿಪಿಗಳನ್ನು (interaction recipes) ವ್ಯಾಖ್ಯಾನಿಸಿದರು, ಪ್ರತಿಯೊಂದೂ ಒಬ್ಬ ಸಾಮಾನ್ಯ ಬಳಕೆದಾರ ಮತ್ತು ಅಸಿಸ್ಟೆಂಟ್ ನಡುವಿನ ವಿನಿಮಯವನ್ನು ವಿವರಿಸುತ್ತದೆ. ದೊಡ್ಡದಾದ “ಟೀಚರ್” ಮಾದರಿಯು ನೈಸರ್ಗಿಕ ಭಾಷೆಯ ಭಾಗವನ್ನು ಸೃಷ್ಟಿಸಿತು, ಆದರೆ ನಿರ್ದಿಷ್ಟ tool-call ಫಾರ್ಮ್ಯಾಟ್ ಅನ್ನು ಒಂದು ಡೆಟರ್ಮಿನಿಸ್ಟಿಕ್ ಸ್ಕ್ರಿಪ್ಟ್ ತಯಾರಿಸಿತು. ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಪ್ರಕ್ರಿಯೆಯು ಅಂದಾಜು 30 ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳನ್ನು ಬಳಸಿಕೊಂಡಿತು ಮತ್ತು 16 GB ಮೆಮೊರಿ ಹೊಂದಿರುವ ಒಂದೇ GPU ನಲ್ಲಿ ಹೊಂದಿಕೆಯಾಯಿತು.

ಸಾಧನದಲ್ಲಿಯೇ (on-device) ಇರುವುದು ಏಕೆ ಮುಖ್ಯ

  • Privacy – ಎಲ್ಲಾ ಬಳಕೆದಾರರ ಪ್ರಾಂಪ್ಟ್‌ಗಳು ಬ್ರೌಸರ್‌ನ ಮೆಮೊರಿಯಲ್ಲಿಯೇ ಇರುತ್ತವೆ. ಯಾವುದೇ ಟೆಲಿಮೆಟ್ರಿ ಸಾಧನದಿಂದ ಹೊರಹೋಗುವುದಿಲ್ಲ, ಇದು ಸೂಕ್ಷ್ಮವಾದ ಪ್ರಶ್ನೆಗಳಿಗೆ ಬಹಳ ಮುಖ್ಯವಾಗಿದೆ.
  • Offline capability – ಮಾದರಿಯನ್ನು ಸ್ಥಳೀಯವಾಗಿ ಕ್ಯಾಶ್ ಮಾಡಲಾಗಿರುವುದರಿಂದ, ಅಸಿಸ್ಟೆಂಟ್ ಇಂಟರ್ನೆಟ್ ಸಂಪರ್ಕವಿಲ್ಲದೆಯೂ ಕೆಲಸ ಮಾಡುತ್ತದೆ, ಇದು ಕ್ಷೇತ್ರ ಕಾರ್ಯ ಅಥವಾ ಪ್ರಯಾಣದ ಸಂದರ್ಭಗಳಲ್ಲಿ ಸಾಧ್ಯತೆಗಳನ್ನು ತೆರೆಯುತ್ತದೆ.
  • Cost – ಸ್ಟ್ಯಾಟಿಕ್ ಮಾದರಿ ಫೈಲ್‌ಗಳನ್ನು ಒದಗಿಸುವುದರಿಂದ ಪದೇ ಪದೇ GPU-ಚಾಲಿತ ಇನ್ಫರೆನ್ಸ್ ಸರ್ವರ್‌ಗಳು ಅಥವಾ ಪ್ರತಿ ಕರೆಯ ಮೇಲಿನ API ಶುಲ್ಕಗಳನ್ನು ತಪ್ಪಿಸಬಹುದು.
  • Accessibility – ಸಂಕೀರ್ಣವಾದ ವೆಬ್ ಇಂಟರ್‌ಫೇಸ್‌ಗಳ ಧ್ವನಿ-ಚಾಲಿತ ನ್ಯಾವಿಗೇಷನ್ ಕಡಿಮೆ ಸಾಮರ್ಥ್ಯದ ಸಾಧನಗಳಲ್ಲೂ ಸಾಧ್ಯವಾಗುತ್ತದೆ, ಇದು ಸಹಾಯಕ ತಂತ್ರಜ್ಞಾನವನ್ನು ಅವಲಂಬಿಸಿರುವ ಬಳಕೆದಾರರಿಗೆ ವೆಬ್ ಅಪ್ಲಿಕೇಶನ್‌ಗಳ ವ್ಯಾಪ್ತಿಯನ್ನು ವಿಸ್ತರಿಸುತ್ತದೆ.

ಈ ಪ್ರಯೋಜನಗಳು ಸಂಭಾಷಣೆಯನ್ನು “ಒಂದು ಬೃಹತ್ ಮಾದರಿಯು ಇದಕ್ಕೆ ಉತ್ತರಿಸಬಲ್ಲದೇ?” ಎಂಬುದರಿಂದ “ಉಪಯುಕ್ತ ಸಹಾಯವನ್ನು ನೀಡುವಾಗ ಒಂದು ಮಾದರಿಯು ಎಷ್ಟು ಚಿಕ್ಕದಾಗಿರಬಹುದು?” ಎಂಬುದಕ್ಕೆ ಬದಲಾಯಿಸುತ್ತವೆ.

ಸಂಭಾವ್ಯ ಮಿತಿಗಳು

ಇಷ್ಟು ಗಾತ್ರದ ಮಾದರಿಯು ವಿಶ್ವಕೋಶದಂತಹ ಸತ್ಯಗಳನ್ನು (encyclopedic facts) ನೆನಪಿಟ್ಟುಕೊಳ್ಳಲು ಸಾಧ್ಯವಿಲ್ಲ. ಬಳಕೆದಾರರು ನಿರ್ದಿಷ್ಟ ಉತ್ಪನ್ನದ ಬೆಲೆ ಅಥವಾ ಇತ್ತೀಚಿನ ಸುದ್ದಿಯ ಹೆಡ್‌ಲೈನ್ ಕೇಳಿದಾಗ, ಅಸಿಸ್ಟೆಂಟ್ search_knowledge ಮೂಲಕ ಮಾಹಿತಿಯನ್ನು ಪಡೆಯುತ್ತದೆ ಅಥವಾ ವಿನಯಪೂರ್ವಕವಾಗಿ ನಿರಾಕರಿಸುತ್ತದೆ. ಈ ವಿನ್ಯಾಸವು ಗೌಪ್ಯತೆಯನ್ನು ರಕ್ಷಿಸುತ್ತದೆ ಆದರೆ ವ್ಯವಸ್ಥೆಯನ್ನು ಅದರ ಬಾಹ್ಯ ಜ್ಞಾನದ ಮೂಲದ ಗುಣಮಟ್ಟ ಮತ್ತು ತಾಜಾತನಕ್ಕೆ ಕಟ್ಟುಹಾಕುತ್ತದೆ.

ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು

ಸಾರ್ವಜನಿಕ ಡೆಮೊ ಒಂದು ಸರಳ GitHub Pages URL ನಲ್ಲಿ ಲಭ್ಯವಿದೆ ಮತ್ತು ಅದರ ಸೋರ್ಸ್ ಕೋಡ್ ಮುಕ್ತವಾಗಿ ಲಭ್ಯವಿದೆ.

ಸಾರಾಂಶ: ಸಾಧಾರಣ ಗಾತ್ರದ LLM ಗೆ ಕಟ್ಟುನಿಟ್ಟಾದ tool grammar ಅನ್ನು ಅನುಸರಿಸಲು ಕಲಿಸುವ ಮೂಲಕ ಮತ್ತು ರಿಟ್ರಿೀವಲ್ ಅನ್ನು ಕೇವಲ ಮತ್ತೊಂದು ಫಂಕ್ಷನ್ ಆಗಿ ಪರಿಗಣಿಸುವ ಮೂಲಕ, ಡೆವಲಪರ್‌ಗಳು ಸಂಪೂರ್ಣವಾಗಿ ಬ್ರೌಸರ್‌ನಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಉಪಯುಕ್ತ AI ಅಸಿಸ್ಟೆಂಟ್ ಅನ್ನು ನೀಡಬಹುದು—ಇದು ಮೂಲ ಸಂಭಾಷಣಾ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಬಲಿಕೊಡದೆ ಗೌಪ್ಯತೆ, ಆಫ್‌ಲೈನ್ ಬಳಕೆ ಮತ್ತು ಶೂನ್ಯ ಕ್ಲೌಡ್ ವೆಚ್ಚವನ್ನು ನೀಡುತ್ತದೆ.