Poolside ನ Laguna S 2.1: ಸಣ್ಣ ಓಪನ್-ವೇಟ್ ಮಾಡೆಲ್ ಕೋಡಿಂಗ್ AI ಅನ್ನು ಮರು ವ್ಯಾಖ್ಯಾನಿಸುತ್ತಿದೆ
Poolside ತನ್ನ Laguna S 2.1 ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡಿದೆ, ಇದು ಕಾಂಪ್ಯಾಕ್ಟ್ ಓಪನ್-ವೇಟ್ ಕೋಡಿಂಗ್ ಮಾಡೆಲ್ ಆಗಿದ್ದು, ಗಮನಾರ್ಹವಾಗಿ ದೊಡ್ಡದಾದ ಸ್ಪರ್ಧಿಗಳಿಗಿಂತ ಉತ್ತಮ ಪ್ರದರ್ಶನ ನೀಡುತ್ತಿದೆ. ಕೇವಲ ಪ್ಯಾರಾಮೀಟರ್ ಸಂಖ್ಯೆಗಿಂತ ಏಜೆಂಟಿಕ್ ಪರ್ಸಿಸ್ಟೆನ್ಸ್ (agentic persistence) ಮತ್ತು ರೀಸನಿಂಗ್ಗೆ (reasoning) ಆದ್ಯತೆ ನೀಡುವ ಮೂಲಕ, ಈ ಬಿಡುಗಡೆಯು ವಿಶೇಷೀಕೃತ LLM ಅಭಿವೃದ್ಧಿಯ ವಿಧಾನದಲ್ಲಿ ಒಂದು ಪ್ಯಾರಾಡೈಮ್ ಶಿಫ್ಟ್ ಅನ್ನು ಸೂಚಿಸುತ್ತದೆ.
ಟ್ರಿಲಿಯನ್-ಪ್ಯಾರಾಮೀಟರ್ ದೈತ್ಯರನ್ನು ಮೀರಿಸುವಿಕೆ
ಮಾಡೆಲ್ನ ಗಾತ್ರವು ಬುದ್ಧಿವಂತಿಕೆಯ ಏಕೈಕ ಮಾರ್ಗವಲ್ಲ ಎಂಬುದನ್ನು Laguna S 2.1 ಸಾಬೀತುಪಡಿಸುತ್ತಿದೆ. ದೀರ್ಘಾವಧಿಯ ಟರ್ಮಿನಲ್ ಕಾರ್ಯಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವ Terminal-Bench 2.1 ಬೆಂಚ್ಮಾರ್ಕ್ನಲ್ಲಿ, "thinking mode" ಚಾಲನೆಯಲ್ಲಿದ್ದಾಗ ಈ ಮಾಡೆಲ್ 70.2% ಸ್ಕೋರ್ ಸಾಧಿಸಿದೆ. ಈ ಪ್ರದರ್ಶನವು ಇದನ್ನು Tencent ನ ಬೃಹತ್ 295B-A21B Hy3 ಮಾಡೆಲ್ ನಂತರದ ಸ್ಥಾನದಲ್ಲಿರಿಸಿದರೆ, DeepSeek-V4-Pro-Max ಮತ್ತು Nemotron 3 Ultra ನಂತಹ ಹೆಚ್ಚು ದೊಡ್ಡದಾದ ಓಪನ್-ವೇಟ್ ಸಿಸ್ಟಮ್ಗಳಿಗಿಂತ ಮುನ್ನ ತಂದು ನಿಲ್ಲಿಸಿದೆ.
Datacurve DeepSWE ಬೆಂಚ್ಮಾರ್ಕ್ನಲ್ಲಿ ಈ ವ್ಯತ್ಯಾಸವು ಇನ್ನಷ್ಟು ಸ್ಪಷ್ಟವಾಗುತ್ತದೆ. Laguna S 2.1 40.4% ಸ್ಕೋರ್ ಮಾಡಿದೆ, ಇದು 10% ಮಿತಿಯನ್ನು ದಾಟಲು ವಿಫಲವಾದ ಒಂದು ಟ್ರಿಲಿಯನ್ಗಿಂತ ಹೆಚ್ಚು ಪ್ಯಾರಾಮೀಟರ್ಗಳನ್ನು ಹೊಂದಿರುವ ಹಲವಾರು ಓಪನ್-ವೇಟ್ ಮಾಡೆಲ್ಗಳಿಗೆ ಹೋಲಿಸಿದರೆ ಬೆಚ್ಚಿಬೀಳಿಸುವ ಫಲಿತಾಂಶವಾಗಿದೆ. ಈ ಮಾಡೆಲ್ SWE-Bench Multilingual, SWE-Bench Pro, ಮತ್ತು SWE Atlas ವರೆಗೆ ಅತ್ಯುತ್ತಮ ಪ್ರದರ್ಶನವನ್ನು ತೋರಿಸುತ್ತದೆ, ಇದು ಸಂಕೀರ್ಣ ಸಾಫ್ಟ್ವೇರ್ ಎಂಜಿನಿಯರಿಂಗ್ ವರ್ಕ್ಫ್ಲೋಗಳಲ್ಲಿನ ಅದರ ಉಪಯುಕ್ತತೆಯನ್ನು ಸಾಬೀತುಪಡಿಸುತ್ತದೆ.
ಪರ್ಸಿಸ್ಟೆನ್ಸ್ ಮತ್ತು "Thinking" ನ ಶಕ್ತಿ
Laguna S 2.1 ನ ಪ್ರಮುಖ ವೈಶಿಷ್ಟ್ಯವೆಂದರೆ ಅದರ "thinking mode", ಇದು pass-at-one ದರಗಳನ್ನು ಗಣನೀಯವಾಗಿ ಸುಧಾರಿಸುತ್ತದೆ. ಈ ರೀಸನಿಂಗ್ ಹಂತವಿಲ್ಲದೆ, Terminal-Bench ಸ್ಕೋರ್ಗಳು 70.2% ರಿಂದ 60.4% ಕ್ಕೆ ಕುಸಿಯುತ್ತವೆ ಮತ್ತು DeepSWE ಸ್ಕೋರ್ಗಳು 40.4% ರಿಂದ 16.5% ಕ್ಕೆ ಇಳಿಯುತ್ತವೆ.
ಕೇವಲ ಬುದ್ಧಿವಂತಿಕೆಯನ್ನು ಹೆಚ್ಚಿಸುವ ಬದಲು, ಸಾಮರ್ಥ್ಯಕ್ಕೆ ಕಾರಣವಾಗುವ "ಬೆಹೇವಿಯರ್ಸ್" (behaviors) ಅನ್ನು ಸುಧಾರಿಸುವತ್ತ ತಾವು ಗಮನಹರಿಸಿದ್ದೇವೆ ಎಂದು Poolside ವಾದಿಸುತ್ತದೆ. ಇದು ಹೆಚ್ಚಿದ ವೆರಿಫಿಕೇಶನ್, ಕಲ್ಪನೆಗಳನ್ನು ಸುಳ್ಳು ಎಂದು ಒಪ್ಪಿಕೊಳ್ಳುವ ಪ್ರವೃತ್ತಿಯನ್ನು ಕಡಿಮೆ ಮಾಡುವುದು ಮತ್ತು ಪರ್ಸಿಸ್ಟೆನ್ಸ್ ಅನ್ನು ಬೆಳೆಸುವುದನ್ನು ಒಳಗೊಂಡಿದೆ. ದಾಖಲಿತ ಪ್ರಯೋಗಗಳಲ್ಲಿ, ಈ ಮಾಡೆಲ್ ಕೇವಲ 50 ನಿಮಿಷಗಳಲ್ಲಿ ಖಾಲಿ ಫೋಲ್ಡರ್ನಿಂದ ಒಂದು ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಬ್ರೌಸರ್ ಎಂಜಿನ್ ಅನ್ನು ನಿರ್ಮಿಸಿತು. ಇನ್ನೂ ಆಶ್ಚರ್ಯಕರವಾದ ವಿಷಯವೆಂದರೆ, ಇದು ಕೇವಲ 40 ರೀಸನಿಂಗ್ ಹಂತಗಳನ್ನು ಬಳಸಿ ಮತ್ತು ಕೇವಲ $0.088 ವೆಚ್ಚದಲ್ಲಿ, 1975 ರಿಂದ ಪರಿಹಾರವಾಗದ ಗಣಿತದ ಸಮಸ್ಯೆಯಾದ Erdos Problem #397 ಕ್ಕೆ ಸ್ವತಂತ್ರವಾಗಿ ಪರಿಹಾರವನ್ನು ಕಂಡುಕೊಂಡಿತು.
ದೊಡ್ಡ ಪ್ರಮಾಣದ ಏಜೆಂಟಿಕ್ ಟ್ರೈನಿಂಗ್ (Agentic Training)
ಹಿಂದಿನ XS 2.1 ಆವೃತ್ತಿಯಿಂದ S 2.1 ಗೆ ಪ್ರದರ್ಶನದಲ್ಲಿನ ಈ ಜಿಗಿತವು ಹೊಸ ಪ್ರಿ-ಟ್ರೈನಿಂಗ್ ಡೇಟಾಕ್ಕಿಂತ ಹೆಚ್ಚಾಗಿ ತೀವ್ರವಾದ ಪೋಸ್ಟ್-ಟ್ರೈನಿಂಗ್ನಿಂದ ಉಂಟಾಗಿದೆ. ಏಜೆಂಟಿಕ್ ಟ್ರೈನಿಂಗ್ ಹಂತವು ಈ ಕೆಳಗಿನವುಗಳನ್ನು ಒಳಗೊಂಡಂತೆ 409,000 ವಿಭಿನ್ನ ಪರಿಸರಗಳನ್ನು ಬಳಸಿಕೊಂಡಿದೆ:
- ಟರ್ಮಿನಲ್-ನಿರ್ದಿಷ್ಟ ಕಾರ್ಯಗಳಿಗಾಗಿ 83,000 ಪರಿಸರಗಳು.
- ಸಾಫ್ಟ್ವೇರ್ ಎಂಜಿನಿಯರಿಂಗ್ ವರ್ಕ್ಫ್ಲೋಗಳಿಗಾಗಿ 168,000 ಪರಿಸರಗಳು.
- ಸುಮಾರು 17,000 ರೆಪೊಸಿಟರಿಗಳಿಂದ ಪಡೆದ 38,000 ರಿಯಲ್-ವರ್ಲ್ಡ್ ಕಮಿಟ್ಗಳು.
ಈ ತರಬೇತಿ ಪ್ರಕ್ರಿಯೆಯು 4,096 Nvidia H200 GPUಗಳ ಬೃಹತ್ ಕಂಪ್ಯೂಟ್ ಕ್ಲಸ್ಟರ್ನಿಂದ ಬೆಂಬಲಿತವಾಗಿತ್ತು. ಗಮನಾರ್ಹವಾಗಿ, S 2.1 ಸರಣಿಯಲ್ಲಿ FP8 ಪ್ರಿಸಿಸನ್ನಲ್ಲಿ (precision) ರಿಇನ್ಫೋರ್ಸ್ಮೆಂಟ್ ಲರ್ನಿಂಗ್ ಬಳಸಿ ತರಬೇತಿ ಪಡೆದ ಮೊದಲ ಮಾಡೆಲ್ ಇದಾಗಿದೆ. "ರಿವಾರ್ಡ್ ಹ್ಯಾಕಿಂಗ್" (reward hacking) ಅನ್ನು ತಡೆಗಟ್ಟಲು—ಅಂದರೆ ಮಾಡೆಲ್ ಒಂದು ಕಾರ್ಯವನ್ನು ಪರಿಹರಿಸುವ ಬದಲು ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಪುಲ್ ರಿಕ್ವೆಸ್ಟ್ಗಳನ್ನು ಹುಡುಕುವ ಸಾಧ್ಯತೆ ಇರುತ್ತದೆ—Poolside ನೆಟ್ವರ್ಕ್ ಪ್ರವೇಶವನ್ನು ಆಯ್ದುಕೊಂಡು ನಿರ್ಬಂಧಿಸಲು ಹೊಸ ಸ್ಯಾಂಡ್ಬಾಕ್ಸ್ ಸಿಸ್ಟಮ್ ಅನ್ನು ಜಾರಿಗೆ ತಂದಿದೆ.
ಲಭ್ಯತೆ ಮತ್ತು ನಿಯೋಜನೆ (Deployment)
Laguna S 2.1 ಅನ್ನು OpenMDW 1.1 ಲೈಸೆನ್ಸ್ ಅಡಿಯಲ್ಲಿ ಬಿಡುಗಡೆ ಮಾಡಲಾಗಿದೆ (Linux Foundation ಬೆಂಬಲಿತ), ಇದು ವಾಣಿಜ್ಯ ಬಳಕೆ, ಮಾರ್ಪಾಡು ಮತ್ತು ಮರು배ಳಿಕೆಗೆ ಅವಕಾಶ ನೀಡುತ್ತದೆ. ಡೆವಲಪರ್ಗಳು Hugging Face ಮೂಲಕ ಅಥವಾ Baseten, Vercel AI Gateway, ಮತ್ತು OpenRouter ನಂತಹ ಹೋಸ್ಟ್ ಮಾಡಿದ ಸೇವೆಗಳ ಮೂಲಕ ಮಾಡೆಲ್ ಅನ್ನು ಪ್ರವೇಶಿಸಬಹುದು. OpenRouter ಉಚಿತವಾಗಿ ಗಮನಾರ್ಹವಾದ 256K ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋವನ್ನು ನೀಡುತ್ತದೆ, ಮತ್ತು ಪೇಯ್ಡ್ ಟಿಯರ್ ಒಂದು ಮಿಲಿಯನ್ ಟೋಕನ್ಗಳವರೆಗೆ ಬೆಂಬಲಿಸುತ್ತದೆ.
ಪ್ರಮುಖ ಅಂಶಗಳು
- ಗಾತ್ರಕ್ಕಿಂತ ದಕ್ಷತೆಗೆ ಆದ್ಯತೆ: ಪರ್ಸಿಸ್ಟೆನ್ಸ್ ಮತ್ತು ವೆರಿಫಿಕೇಶನ್ನಂತಹ ಏಜೆಂಟಿಕ್ ವರ್ತನೆಗಳು ಸಣ್ಣ ಮಾಡೆಲ್ಗಳು ಟ್ರಿಲಿಯನ್-ಪ್ಯಾರಾಮೀಟರ್ ಸಿಸ್ಟಮ್ಗಳನ್ನು ಮೀರಿಸಲು ಅನುವು ಮಾಡಿಕೊಡಬಹುದು ಎಂದು Laguna S 2.1 ಸಾಬೀತುಪಡಿಸುತ್ತದೆ.
- ರೀಸನಿಂಗ್ ಅತ್ಯಗತ್ಯ: ಸಂಕೀರ್ಣ ಕಾರ್ಯಗಳಿಗೆ "thinking mode" ಬಹಳ ಮುಖ್ಯವಾಗಿದೆ, ಇದು ಎಲ್ಲಾ ಪ್ರಮುಖ ಕೋಡಿಂಗ್ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳಲ್ಲಿ ಪ್ರದರ್ಶನವನ್ನು ಗಣನೀಯವಾಗಿ ಹೆಚ್ಚಿಸುತ್ತದೆ.
- ಏಜೆಂಟಿಕ್ ಟ್ರೈನಿಂಗ್ ಯಶಸ್ಸು: ಮಾಡೆಲ್ನ ಸಾಮರ್ಥ್ಯವು 409,000 ವಿಶೇಷ ಪರಿಸರಗಳು ಮತ್ತು ರಿಯಲ್-ವರ್ಲ್ಡ್ ಕೋಡ್ ಕಮಿಟ್ಗಳ ಮೂಲಕ ನಡೆಸಿದ ಬೃಹತ್ ಪ್ರಮಾಣದ ಪೋಸ್ಟ್-ಟ್ರೈನಿಂಗ್ನಿಂದ ಬಂದಿದೆ.
