Claude ನ ಸ್ವಾಯತ್ತ ಪ್ರೋಟೀನ್-ಬೈಂಡರ್ ಅಭಿಯಾನವು 27% ಹಿಟ್ ರೇಟ್ ಅನ್ನು ದಾಖಲಿಸಿದೆ, ಇದು ಮಾನವ ನಡೆಸುವ ಪ್ರಯೋಗಾಲಯಗಳಲ್ಲಿ ಸಾಮಾನ್ಯವಾಗಿ ಕಂಡುಬರುವ 10-15% ಕ್ಕಿಂತ ಹೆಚ್ಚು ಮತ್ತು ಅದೇ ಟಾರ್ಗೆಟ್ ಮೇಲೆ ನಡೆದ ಸಮಾನಾಂತರ ಮಾನವ ಪ್ರಯತ್ನವನ್ನು ಮೀರಿಸಿದೆ. ಒಂದು ಬೃಹತ್ ಮತ್ತು ಉತ್ತಮವಾಗಿ ರೂಪಿಸಲಾದ ಪ್ರಾಂಪ್ಟ್, ಭಾಷಾ ಮಾದರಿಯನ್ನು (language model) ವರ್ಚುವಲ್ ಬಯೋಟೆಕ್ ವರ್ಕ್‌ಫ್ಲೋ ಆಗಿ ಪರಿವರ್ತಿಸಬಲ್ಲದು ಎಂಬುದನ್ನು ಈ ಫಲಿತಾಂಶ ತೋರಿಸುತ್ತದೆ, ಆದರೆ ಮಾದರಿಯ ಕಾನ್ಫಿಡೆನ್ಸ್ ಮೆಟ್ರಿಕ್ಸ್ ತಪ್ಪಾದಾಗ ಆ ವಿಧಾನವು ಎಷ್ಟು ದುರ್ಬಲವಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ಸಹ ಇದು ಎತ್ತಿ ತೋರಿಸುತ್ತದೆ.

ಅಂಕಿಅಂಶಗಳಲ್ಲಿ ಪ್ರಯೋಗ

Anthropic ತನ್ನ Claude ಮಾದರಿಗೆ ಪೂರ್ಣ ಪ್ರಮಾಣದ ಪ್ರೋಟೀನ್ ವಿನ್ಯಾಸ ಪ್ರೋಟೋಕಾಲ್ ಮತ್ತು ನಿಗದಿತ GPU ಬಜೆಟ್ ಅನ್ನು ನೀಡಿತು, ನಂತರ 16 ಪ್ರೋಟೀನ್ ಟಾರ್ಗೆಟ್‌ಗಳಾದ್ಯಂತ ಎಂಡ್-ಟು-ಎಂಡ್ ಅಭಿಯಾನವನ್ನು ನಡೆಸಲು ಬಿಟ್ಟಿತು. ಪ್ರಯೋಗಾಲಯದ ವೈಫಲ್ಯದ ನಂತರ ಒಂದು ಟಾರ್ಗೆಟ್ ಅನ್ನು ಕೈಬಿಡಲಾಯಿತು, ಇದರಿಂದ 15 ಕಾರ್ಯಸಾಧ್ಯವಾದ ಅಭಿಯಾನಗಳು ಉಳಿದವು. ಅವುಗಳಿಂದ Claude 1,320 ಅಭ್ಯರ್ಥಿ ಸೀಕ್ವೆನ್ಸ್‌ಗಳನ್ನು ಸೃಷ್ಟಿಸಿತು; ಪ್ರಯೋಗಾಲಯದ ಪರೀಕ್ಷೆಯು 354 ಅನ್ನು ನಿಜವಾದ ಬೈಂಡರ್‌ಗಳೆಂದು ಖಚಿತಪಡಿಸಿತು, ಇದು 26.8% ಯಶಸ್ಸಿನ ಪ್ರಮಾಣವನ್ನು ನೀಡಿತು.

ಹೋಲಿಕೆಗಾಗಿ ಹೇಳುವುದಾದರೆ, ಹೆಚ್ಚಿನ ಮಾನವ ನೇತೃತ್ವದ ಬೈಂಡರ್ ಯೋಜನೆಗಳು 10% ಮತ್ತು 15% ನಡುವಿನ ಹಿಟ್ ರೇಟ್ ಅನ್ನು ವರದಿ ಮಾಡುತ್ತವೆ. RBX1 ಟಾರ್ಗೆಟ್‌ನಲ್ಲಿ ನೇರ ಮುಖಾಮುಖಿ ಹೋಲಿಕೆಯಲ್ಲಿ, ಮಾನವ ಪ್ರತಿಸ್ಪರ್ಧಿಗಳು 3.7% ಹಿಟ್ ರೇಟ್ ಸಾಧಿಸಿದರೆ, Claude ವಿನ್ಯಾಸಗಳು 31.1% ಹಿಟ್ ರೇಟ್ ಸಾಧಿಸಿದವು. ಮಾದರಿಯು ಸ್ವಯಂ-ಶ್ರೇಣಿೀಕರಣ ಮಾಡುವ ಸಾಮರ್ಥ್ಯವನ್ನೂ ಪ್ರದರ್ಶಿಸಿತು: Claude ತನ್ನ ಅತ್ಯುತ್ತಮ ವಿನ್ಯಾಸ ಎಂದು ಗುರುತಿಸಿದ ಒಂದೇ ವಿನ್ಯಾಸವು 49% ರಷ್ಟು ಬಾರಿ ಯಶಸ್ವಿಯಾಯಿತು ಮತ್ತು ಮೊದಲ ಹತ್ತು ವಿನ್ಯಾಸಗಳು 39% ರಷ್ಟು ಬಾರಿ ಯಶಸ್ವಿಯಾದವು.

ವ್ಯವಸ್ಥೆಯು ಎಲ್ಲಿ ವಿಫಲವಾಯಿತು

ಈ ಅಂಕಿಅಂಶಗಳು ಎರಡು ಸ್ಪಷ್ಟವಾದ ಅಂಧಬಿಂದುಗಳನ್ನು ಮರೆಮಾಚುತ್ತವೆ. Claude MBP ಟಾರ್ಗೆಟ್‌ನಲ್ಲಿ ಸಂಪೂರ್ಣವಾಗಿ ವಿಫಲವಾಯಿತು ಮತ್ತು TNFα ಟಾರ್ಗೆಟ್‌ನಲ್ಲಿ ಕಳಪೆ ಪ್ರದರ್ಶನ ನೀಡಿತು, ಆದರೂ ಆ ರನ್‌ಗಳಿಗಾಗಿ ಅದರ ಆಂತರಿಕ ಕಾನ್ಫಿಡೆನ್ಸ್ ಸ್ಕೋರ್‌ಗಳು ಹೆಚ್ಚಾಗಿಯೇ ಇದ್ದವು. autrementទៀត, ವೆಟ್-ಲ್ಯಾಬ್ ರೀಡ್‌ಔಟ್‌ಗಳು ವಿಭಿನ್ನ ಕಥೆಯನ್ನು ಹೇಳುತ್ತಿದ್ದರೂ, ಮಾದರಿಯು ತಾನು ಯಶಸ್ವಿಯಾಗುತ್ತಿದ್ದೇನೆ ಎಂದು ನಂಬಿತ್ತು. ಅಸಮರ್ಪಕವಾಗಿ ಮಾಪನಗೊಂಡಿರುವ ಈ ಸಿಗ್ನಲ್‌ಗಳು ಒಂದು ಅಪಾಯವನ್ನು ಎತ್ತಿ ತೋರಿಸುತ್ತವೆ: ತನ್ನದೇ ಆದ ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ನಂಬುವ ಸ್ವಾಯತ್ತ ಪೈಪ್‌ಲೈನ್ವು ನಿಷ್ಫಲ ಪ್ರಯೋಗಗಳ ಮೇಲೆ ಸಂಪನ್ಮೂಲಗಳನ್ನು ವ್ಯರ್ಥ ಮಾಡಬಹುದು.

ಪ್ರಾಂಪ್ಟ್ ಇಂಜಿನಿಯರಿಂಗ್: ಹೊಸ ಪ್ರಯೋಗಾಲಯದ ನೋಟ್‌ಬುಕ್

ಈ ಅಧ್ಯಯನದ ಅತ್ಯಂತ ಗಮನಾರ್ಹ ಅಂಶವು ಜೀವವಿಜ್ಞಾನವಲ್ಲ, ಬದಲಿಗೆ ಅದನ್ನು ನಡೆಸಿದ ಪ್ರಾಂಪ್ಟ್ ಆಗಿದೆ. ಒಬ್ಬ ಹಿರಿಯ ವಿಜ್ಞಾನಿಯು ಸಾಮಾನ್ಯವಾಗಿ ಯಾವ ಪ್ರೋಟೀನ್ ಪ್ರದೇಶಗಳನ್ನು ಅನ್ವೇಷಿಸಬೇಕು, ಯಾವ ಕಂಪ್ಯೂಟೇಶನಲ್ ಟೂಲ್ಸ್‌ಗಳನ್ನು ಬಳಸಬೇಕು ಮತ್ತು ಕಂಪ್ಯೂಟ್ ಸಮಯವನ್ನು ಹೇಗೆ ಹಂಚಿಕೆ ಮಾಡಬೇಕು ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸಲು ವಾರಗಟ್ಟಲೆ ಸಮಯ ತೆಗೆದುಕೊಳ್ಳುತ್ತಾರೆ. Anthropic ಆ ಪರಿಣತಿಯನ್ನು 16,000 ಪದಗಳ ಪ್ರಾಂಪ್ಟ್‌ನಲ್ಲಿ ಸಂಕುಚಿತಗೊಳಿಸಿತು—ಇದು ಸರಿಸುಮಾರು ಒಂದು ಸಣ್ಣ ಕಾದಂಬರಿಯ ಉದ್ದಕ್ಕೆ ಸಮಾನವಾಗಿದೆ. ಪಠ್ಯದ ಸುಮಾರು ಮೂರನೇ ಎರಡರಷ್ಟು ಭಾಗವು ಕಾರ್ಯಾಚರಣೆಯ ಕಾಳಜಿಗಳನ್ನು ನಿರ್ವಹಿಸುತ್ತಿತ್ತು: ಸಮಯ ನಿರ್ವಹಣೆ, ಬಜೆಟ್ ಮೇಲ್ವಿಚಾರಣೆ ಮತ್ತು ಬಾಹ್ಯ ಸಾಫ್ಟ್‌ವೇರ್‌ಗಳನ್ನು ಬಳಸುವ ಸಬ್-ಏಜೆಂಟ್‌ಗಳನ್ನು ಸಂಘಟಿಸುವುದು.

Claude, RFdiffusion (ಡೈಫ್ಯೂಷನ್ ಆಧಾರಿತ ರಚನಾ ಜನರೇಟರ್) ಮತ್ತು ProteinMPNN (ಸೀಕ್ವೆನ್ಸ್ ಡಿಸೈನ್ ನೆಟ್‌ವರ್ಕ್) ನಂತಹ ಓಪನ್-ಸೋರ್ಸ್ ಡಿಸೈನ್ ಇಂಜಿನ್‌ಗಳನ್ನು ಬಳಸಿತು. ಭಾಷಾ ಮಾದರಿಯು ಒಂದು ಶೆಡ್ಯೂಲರ್ ಆಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸಿತು, ಈ ಪರಿಕರಗಳ ನಡುವೆ ಮಧ್ಯಂತರ ಫಲಿತಾಂಶಗಳನ್ನು ಒದಗಿಸಿತು, ಪ್ಯಾರಾಮೀಟರ್‌ಗಳನ್ನು ಹೊಂದಿಸಿತು ಮತ್ತು ವಿನ್ಯಾಸ ಚಕ್ರವನ್ನು ಯಾವಾಗ ನಿಲ್ಲಿಸಬೇಕೆಂದು ನಿರ್ಧರಿಸಿತು. ಪ್ರಾಯೋಗಿಕವಾಗಿ, ಈ ಪ್ರಾಂಪ್ಟ್ ಒಂದು ವರ್ಚುವಲ್ ಪ್ರಯೋಗಾಲಯ ವ್ಯವಸ್ಥಾಪಕವಾಗಿ ಮಾರ್ಪಟ್ಟಿತು, ಇದು ಮಾನವ ವಿಜ್ಞಾನಿಗಳನ್ನು ಕಾರ್ಯದಕ್ಷತೆಯ ಸಮನ್ವಯದ ಸಣ್ಣಪುಟ್ಟ ಕೆಲಸಗಳಿಂದ ಮುಕ್ತಗೊಳಿಸಿತು.

ಬೈಂಡರ್‌ಗಳು ವಾಸ್ತವವಾಗಿ ಏನವು?

ಖಚಿತಪಡಿಸಿದ ಎಲ್ಲಾ 354 ಹಿಟ್‌ಗಳು ತಮ್ಮ ಟಾರ್ಗೆಟ್ ಪ್ರೋಟೀನ್‌ಗಳಿಗೆ ಭೌತಿಕವಾಗಿ ಅಂಟಿಕೊಳ್ಳುವ ಅಣುಗಳಾಗಿವೆ. ಈ ಪತ್ರಿಕೆಯು ಬೈಂಡಿಂಗ್ ಅಸೇಗಳನ್ನು ವರದಿ ಮಾಡುತ್ತದೆ ಆದರೆ ಕಾರ್ಯಚಟುವಟಿಕೆಯ ದತ್ತಾಂಶವನ್ನು (functional data) ಒದಗಿಸುವುದಿಲ್ಲ—ಯಾವುದೇ ಬೈಂಡರ್ ಚಟುವಟಿಕೆಯನ್ನು ನಿಯಂತ್ರಿಸುತ್ತದೆ, ಕನ್ಫರ್ಮೇಷನ್ ಅನ್ನು ಸ್ಥಿರಗೊಳಿಸುತ್ತದೆ ಅಥವಾ ಚಿಕಿತ್ಸಕ ಸಾಮರ್ಥ್ಯವನ್ನು ಪ್ರದರ್ಶಿಸುತ್ತದೆ ಎಂಬುದಕ್ಕೆ ಯಾವುದೇ ಪುರಾವೆ ಇಲ್ಲ. ಅದೇ ರೀತಿ, ರಚನಾತ್ಮಕ ಮೌಲ್ಯೀಕರಣ (ಉದಾಹರಣೆಗೆ, X-ray crystallography ಅಥವಾ cryo-EM) ಇಲ್ಲದಿರುವುದರಿಂದ, ನಿಖರವಾದ ಬೈಂಡಿಂಗ್ ವಿಧಾನವು ಕೇವಲ ಊಹೆಯಾಗಿ ಉಳಿದಿದೆ. ಆದ್ದರಿಂದ, ಈ ಅಭಿಯಾನವು ವೇಗದ ಬೈಂಡರ್ ಸಂಶೋಧನೆಗಾಗಿ ಒಂದು 'ಪ್ರಾೂಫ್-ಆಫ್-ಕನ್ಸೆಪ್ಟ್' ಅನ್ನು ಪ್ರದರ್ಶಿಸುತ್ತದೆಯೇ ಹೊರತು, ಔಷಧದ ಅಭ್ಯರ್ಥಿಗಳನ್ನು ನೀಡುವ ಪೈಪ್‌ಲೈನ್ ಅಲ್ಲ.

ಬಯೋಟೆಕ್ ಮತ್ತು AI ಸಂಶೋಧನೆಗೆ ಇರುವ ಪಣಗಳು

ಪ್ರಾಂಪ್ಟ್-ಚಾಲಿತ ಮಾದರಿಯು ಮಾನವನ ಹಿಟ್ ರೇಟ್‌ಗಳನ್ನು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ಪುನರಾವರ್ತಿಸಬಲ್ಲದು ಅಥವಾ ಮೀರಿಸಬಲ್ಲದು ಎಂದಾದರೆ, ಬಯೋಟೆಕ್ ಸಂಸ್ಥೆಗಳು ಆರಂಭಿಕ ಹಂತದ ಸಂಶೋಧನೆಯ ವೆಚ್ಚ ಮತ್ತು ಸಮಯವನ್ನು ಗಣನೀಯವಾಗಿ ಕಡಿಮೆ ಮಾಡಬಹುದು. ಆದಾಗ್ಯೂ, MBP ಮತ್ತು TNFα ಮೇಲಿನ ಅಸಮರ್ಪಕ ಕಾನ್ಫಿಡೆನ್ಸ್ ಸ್ಕೋರ್‌ಗಳು, ಸಂಪೂರ್ಣವಾಗಿ ಸ್ವತಂತ್ರ ವ್ಯವಸ್ಥೆಯು ಇನ್ನೂ ಉತ್ಪಾದನೆಗೆ ಸಿದ್ಧವಾಗಿಲ್ಲ ಎಂಬುದನ್ನು ವಿವರಿಸುತ್ತವೆ. ಕಾನ್ಫಿಡೆನ್ಸ್ ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ಅರ್ಥೈಸಲು ಮತ್ತು ಕಾರ್ಯಚಟುವಟಿಕೆಯ ಪ್ರಸ್ತುತತೆಯನ್ನು ಮೌಲ್ಯೀಕರಿಸಲು ಕಂಪನಿಗಳಿಗೆ ಇನ್ನೂ ಮಾನವ ಮೇಲ್ವಿಚಾರಣೆಯ ಅಗತ್ಯವಿರುತ್ತದೆ.

AI ದೃಷ್ಟಿಕೋನದಿಂದ, ಈ ಕೆಲಸವು "ಟೂಲ್" ಮತ್ತು "ಏಜೆಂಟ್" ನಡುವಿನ ಗಡಿಗಳನ್ನು ಅಸ್ಪಷ್ಟಗೊಳಿಸುತ್ತದೆ. Claude ಎಂಬುದು ಹೊಸ ಪ್ರೋಟೀನ್-ಡಿಸೈನ್ ಅಲ್ಗಾರಿದಮ್ ಅಲ್ಲ; ಇದು ಸಾಕಷ್ಟು ವಿವರವಾದ ಸೂಚನಾ ಸೆಟ್‌ಗಳನ್ನು ನೀಡಿದಾಗ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ವಿಶೇಷ ಪರಿಕರಗಳನ್ನು ಸಂಘಟಿಸಬೆಲ್ಲ ಸಾಮಾನ್ಯ ಉದ್ದೇಶದ ಭಾಷಾ ಮಾದರಿಯಾಗಿದೆ. ಈ ಪ್ರಯೋಗವು AI ಯಾವುದೇ ಏಕೈಕ ಘಟಕವನ್ನು ಬದಲಿಸುವ ಬದಲು, ಓಪನ್-ಸೋರ್ಸ್ ವೈಜ್ಞಾನಿಕ ಸಾಫ್ಟ್‌ವೇರ್‌ನ ಮಾಡ್ಯುಲರ್ ಪರಿಸರ ವ್ಯವಸ್ಥೆಯನ್ನು ಒಟ್ಟಿಗೆ ಜೋಡಿಸುವ ಕೊಂಡಿಯಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಭವಿಷ್ಯವನ್ನು ಸೂಚಿಸುತ್ತದೆ.

ವಿರೋಧಾತ್ಮಕ ಅಂಶ: ಪ್ರಾಂಪ್ಟ್ ಸಂಕೀರ್ಣತೆಯ ಅಡಗಿರುವ ವೆಚ್ಚ

ಈ ಅಧ್ಯಯನವು 16,000 ಪದಗಳ ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಜ್ಞಾನದ ಸಂಗ್ರಹಣೆಯ ವಿಜಯ ಎಂದು ಬಣ್ಣಿಸುತ್ತದೆಯಾದರೂ, ಆ ಪ್ರಾಂಪ್ಟ್‌ನ ಗಾತ್ರವೇ ಪ್ರಾಯೋಗಿಕ ಕಾಳಜಿಗಳನ್ನು ಎಬ್ಬಿಸುತ್ತದೆ. ಅಂತಹ ದಾಖಲೆಯನ್ನು ಸಿದ್ಧಪಡಿಸಲು ಆಳವಾದ ವಿಷಯ ಪರಿಣತಿ, ಅಡಿಪಾಯದ ಪರಿಕರಗಳ ಪರಿಚಯ ಮತ್ತು ಎಡ್ಜ್ ಕೇಸ್‌ಗಳನ್ನು (edge cases) ಅಂದಾಜಿಸುವ ಸಾಮರ್ಥ್ಯ ಅಗತ್ಯವಿರುತ್ತದೆ. autrement ಹೇಳುವುದಾದರೆ, ಪರಿಣತಿಯು ಮಾಯವಾಗಿಲ್ಲ—ಅದು ಬೆಂಚ್ ಸೈಂಟಿಸ್ಟ್‌ಗಳಿಂದ ಪ್ರಾಂಪ್ಟ್ ಇಂಜಿನಿಯರ್‌ಗಳಿಗೆ ಸ್ಥಳಾಂತರಗೊಂಡಿದೆ.

ಇದಲ್ಲದೆ, ನಿಗದಿತ GPU ಬಜೆಟ್ ಮೇಲಿನ ಅವಲಂಬನೆಯು ಅನ್ವೇಷಣೆಯ ಆಳದ ಮೇಲೆ ಕಠಿಣ ನಿರ್ಬಂಧವನ್ನು ಹೇರುತ್ತದೆ. ಮಾನವ ತಂಡಗಳು ಮಧ್ಯಂತರ ಫಲಿತಾಂಶಗಳ ಆಧಾರದ ಮೇಲೆ ಸಂಪನ್ಮೂಲಗಳನ್ನು ಕ್ರಿಯಾತ್ಮಕವಾಗಿ ಮರುಹಂಚಿಕೆ ಮಾಡಬಲ್ಲವು, ಆದರೆ Claude ನ ಅಭಿಯಾನವು ಮೊದಲೇ ನಿಗದಿಪಡಿಸಿದ ಬಜೆಟ್‌ಗೆ ಬದ್ಧವಾಗಿತ್ತು, ಇದು ಅನ್ವೇಷಣೆಯಾದ ಸೀಕ್ವೆನ್ಸ್ ಸ್ಪೇಸ್‌ನ ವ್ಯಾಪ್ತಿಯನ್ನು ಸೀಮಿತಗೊಳಿಸಿರಬಹುದು.

ಮುಂದೆ ಗಮನಿಸಬೇಕಾದವುಗಳು

Anthropic ನ ಪ್ರಬಂಧವು ಹಲವಾರು ಮುಕ್ತ ಪ್ರಶ್ನೆಗಳನ್ನು ಬಿಟ್ಟುಹೋಗಿದೆ. ಭವಿಷ್ಯದ ಕೆಲಸವು ವಿಶ್ವಾಸಾರ್ಹತೆಯ ಕ್ಯಾಲಿಬ್ರೇಶನ್ (confidence calibration) ಅನ್ನು ಪರಿಹರಿಸಬೇಕಾಗುತ್ತದೆ, ಇದರಿಂದ ಮಾಡೆಲ್‌ನ ಸ್ವಯಂ-ಮೌಲ್ಯಮಾಪನವು ಪ್ರಾಯೋಗಿಕ ಫಲಿತಾಂಶಗಳೊಂದಿಗೆ ಹೊಂದಿಕೆಯಾಗುತ್ತದೆ. ಕಾರ್ಯತ್ಮಕ ಪರೀಕ್ಷೆಗಳನ್ನು (functional assays)—ಉದಾಹರಣೆಗೆ ಎನ್ಜೈಮ್ಯಾಟಿಕ್ ಇನ್ಹಿಬಿಷನ್ ಅಥವಾ ಕೋಶೀಯ ಚಟುವಟಿಕೆ—ಸ್ವಾಯತ್ತ ಲೂಪ್‌ಗೆ ಸಂಯೋಜಿಸುವುದು ತಂತ್ರಜ್ಞಾನವನ್ನು ಕೇವಲ ಬೈಂಡರ್ ಗುರುತಿಸುವಿಕೆಯನ್ನು ಮೀರಿ ಔಷಧ ಸಂಶೋಧನೆಯತ್ತ ಕೊಂಡೊಯ್ಯುತ್ತದೆ. ಅಂತಿಮವಾಗಿ, ವಿವಿಧ ಬಜೆಟ್ ಪರಿಸ್ಥಿತಿಗಳಲ್ಲಿ ಮತ್ತು ವ್ಯಾಪಕವಾದ ಗುರಿಗಳ ಮೇಲೆ ಈ ವಿಧಾನವನ್ನು ಬೆಂಚ್‌ಮಾರ್ಕಿಂಗ್ ಮಾಡುವುದರಿಂದ, ಕಂಡುಬಂದ ಹಿಟ್ ರೇಟ್ ಪುನರಾವರ್ತಿಸಬಹುದಾದವೇ ಅಥವಾ ಇದು ಕೇವಲ ಒಂದು ಅನಿರೀಕ್ಷಿತ ಫಲಿತಾಂಶವೇ (outlier) ಎಂಬುದು ತಿಳಿಯುತ್ತದೆ.

ಇದರ ಸಾರಾಂಶ ಸ್ಪಷ್ಟವಾಗಿದೆ: ವಿವರವಾದ ಪ್ರಾಮ್ಟ್ ಆರ್ಕೆಸ್ಟ್ರೇಶನ್ ಒಂದು ಭಾಷಾ ಮಾಡೆಲ್ ಅನ್ನು ವರ್ಚುವಲ್ ಬಯೋಟೆಕ್ ಲ್ಯಾಬ್ ಆಗಿ ಪರಿವರ್ತಿಸಬಹುದು ಮತ್ತು ಮಾನವ ಸರಾಸರಿಗಿಂತ ಹೆಚ್ಚಿನ ಬೈಂಡರ್ ಹಿಟ್ ರೇಟ್‌ಗಳನ್ನು ನೀಡಬಹುದು. ಆದಾಗ್ಯೂ, ಈ ವಿಧಾನವು ಇನ್ನೂ ತಜ್ಞರ ಪ್ರಾಮ್ಟ್ ರಚನೆಯ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿದೆ ಮತ್ತು ವಿಶ್ವಾಸಾರ್ಹತೆಯ ತಪ್ಪುಗಳಿಂದಾಗಿ ದುಬಾರಿ ಪ್ರಯೋಗಗಳು ವಿಫಲವಾಗುವ ಸಾಧ್ಯತೆಯೂ ಇದೆ. ಸಮುದಾಯವು ಈ ಪೈಪ್‌ಲೈನ್‌ಗಳನ್ನು ಸುಧಾರಿಸುತ್ತಿದ್ದಂತೆ, AI ಸ್ವಾಯತ್ತತೆ ಮತ್ತು ಮಾನವ ಮೇಲ್ವಿಚಾರಣೆಯ ನಡುವಿನ ಸಮತೋಲನವು ಇಂತಹ ವ್ಯವಸ್ಥೆಗಳು ದೈನಂದಿನ ಪರಿಕರಗಳಾಗುತ್ತವೆಯೇ ಅಥವಾ ಕೇವಲ ಪ್ರಾಯೋಗಿಕ ಕುತೂಹಲಗಳಾಗಿ ಉಳಿಯುತ್ತವೆಯೇ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ.