GSK ಬ್ರಿಟಿಷ್ ಬಯೋಟೆಕ್ ಸಂಸ್ಥೆಯಾದ Relation Therapeutics ಜೊತೆಗೆ $110 ಮಿಲಿಯನ್ ವರೆಗಿನ ಸಂಶೋಧನಾ ಸಹಯೋಗಕ್ಕೆ ಸಹಿ ಹಾಕಿದೆ. ಈ ಪಾಲುದಾರಿಕೆಯು ಮಾನವ ಜೀವಕೋಶಗಳು ತಳಿ ಬದಲಾವಣೆಗಳು ಮತ್ತು ಔಷಧ ಚಿಕಿತ್ಸೆಗಳಿಗೆ ಹೇಗೆ ಪ್ರತಿಕ್ರಿಯಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ಪತ್ತೆಹಚ್ಚುವ ಬೃಹತ್, ಹೆಚ್ಚಿನ ರೆಸಲ್ಯೂಶನ್ (high-resolution) ಡೇಟಾ ಸೆಟ್ಗಳನ್ನು ರಚಿಸುತ್ತದೆ. ಇದು AI ಚಾಲಿತ ಔಷಧ ಸಂಶೋಧನೆಯನ್ನು ನಿಧಾನಗೊಳಿಸುತ್ತಿರುವ ಡೇಟಾ ಅಡಚಣೆಯನ್ನು (bottleneck) ಹೋಗಲಾಡಿಸುತ್ತದೆ ಮತ್ತು ಅಣುಗಳಿಂದ (molecule) ಔಷಧದವರೆಗೆ ಇರುವ ಹಾದಿಯಲ್ಲಿ ವರ್ಷಗಟ್ಟಲೆ ಸಮಯವನ್ನು ಉಳಿಸಬಹುದು.
AI ಅನ್ನು ಹಿನ್ನಡೆಸುತ್ತಿರುವ ಡೇಟಾ ಸಮಸ್ಯೆ
ಕಳೆದ ದಶಕದ ಬಹುಪಾಲು ಸಮಯದವರೆಗೆ, ಫಾರ್ಮಾ (pharma) ಕ್ಷೇತ್ರದಲ್ಲಿ AI ಅನ್ನು ಅದರ ಇನ್ಪುಟ್ ಪ್ರಸ್ತುತತೆಯ ಮೂಲಕವಲ್ಲದೆ, ಮಾಡೆಲ್ ಗಾತ್ರದ ಮೂಲಕ ಅಳೆಯಲಾಗುತ್ತಿತ್ತು. ಇಂಟರ್ನೆಟ್ ಪಠ್ಯದ ಮೇಲೆ ತರಬೇತಿ ಪಡೆದ ಲಾರ್ಜ್ ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲ್ಗಳು (Large language models) ಪ್ಯಾಟರ್ನ್ ಮ್ಯಾಚಿಂಗ್ನಲ್ಲಿ ಅತ್ಯುತ್ತಮವಾಗಿವೆ, ಆದರೆ ಒಂದು ಸಂಯುಕ್ತವು (compound) ಜೀವಂತ ಜೀವಕೋಶದ ಮೂಲಕ ಹೇಗೆ ಹರಡುತ್ತದೆ ಎಂದು ಊಹಿಸಲು ಕೇಳಿದಾಗ ಅವು ವಿಫಲವಾಗುತ್ತವೆ. ಇಲ್ಲಿ ಕೊರತೆಯಿರುವ ಅಂಶವೆಂದರೆ "ವೆಟ್ ಲ್ಯಾಬ್" (wet lab) ಡೇಟಾ—ಅಂದರೆ ಒಂದು ಜೀನ್ ಆನ್ ಅಥವಾ ಆಫ್ ಆದ ನಂತರ ಅಥವಾ ಔಷಧವನ್ನು ಬಳಸಿದ ನಂತರ ಉಂಟಾಗುವ ಜೈವಿಕ ಪರಿಣಾಮಗಳ ಸರಣಿಯನ್ನು ಸೆರೆಹಿಡಿಯುವ ನೈಜ ಪ್ರಯೋಗಗಳ ಅಳತೆಗಳು.
Relation Therapeutics ಆ ಕೊರತೆಯನ್ನು ತುಂಬಲಿದೆ. ಒಪ್ಪಂದದ ಅಡಿಯಲ್ಲಿ, ಮಾನವ ಜೀವಕೋಶಗಳು ಎರಡು ಚರಾಂಶಗಳಿಗೆ (variables) ಹೇಗೆ ಪ್ರತಿಕ್ರಿಯಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ಅತ್ಯಂತ ನಿಖರವಾಗಿ ಅಳೆಯುವ ಬೃಹತ್ ಪ್ರಮಾಣದ ಡೇಟಾವನ್ನು ಇದು ಸೃಷ್ಟಿಸುತ್ತದೆ: ತಳಿ ಬದಲಾವಣೆಗಳು ಮತ್ತು ಔಷಧದ ಮಧ್ಯಪ್ರವೇಶಗಳು (drug interventions). ಜೀವಕೋಶದ ನಡವಳಿಕೆಯ ಈ ಸೂಕ್ಷ್ಮ ನೋಟವನ್ನು AI ವ್ಯವಸ್ಥೆಗಳಿಗೆ ಒದಗಿಸುವ ಮೂಲಕ, ಈ ಪಾಲುದಾರಿಕೆಯು ಮಾಡೆಲ್ಗಳನ್ನು ಕೇವಲ ಕಚ್ಚಾ ಬೈಂಡಿಂಗ್ ಮುನ್ಸೂಚನೆಗಳಿಂದ (binding predictions) ಪೂರ್ಣ ಪ್ರಮಾಣದ ಪಾತ್ವೇಗಳ ಸಿಮ್ಯುಲೇಶನ್ಗಳತ್ತ (simulations) ಕೊಂಡೊಯ್ಯುವ ಗುರಿಯನ್ನು ಹೊಂದಿದೆ.
ಬ್ಲಾಕ್-ಬಾಕ್ಸ್ ಮುನ್ಸೂಚನೆಗಳಿಂದ ಜೀವಕೋಶದ ನಿಖರತೆಯವರೆಗೆ
ಸಾಂಪ್ರದಾಯಿಕ AI ಪೈಪ್ಲೈನ್ಗಳು ಹೆಚ್ಚಾಗಿ ಒಂದು ಸಂಖ್ಯೆಯನ್ನು ಮಾತ್ರ ನೀಡುತ್ತವೆ: ಅಣುವು ಒಂದು ಗುರಿ ಪ್ರೋಟೀನ್ ಅನ್ನು ಬೈಂಡ್ (bind) ಮಾಡಿಕೊಳ್ಳುವ ಸಾಧ್ಯತೆ ಎಷ್ಟು ಎಂಬುದು. ನಂತರ ಸಂಶೋಧಕರು ಆ ಬೈಂಡಿಂಗ್ ಒಂದು ಚಿಕಿತ್ಸಕ ಪರಿಣಾಮಕ್ಕೆ (therapeutic effect) ಕಾರಣವಾಗುತ್ತದೆಯೇ ಎಂದು ಪರೀಕ್ಷಿಸಲು ತಿಂಗಳುಗಳು ಅಥವಾ ವರ್ಷಗಳನ್ನು ಕಳೆಯುತ್ತಾರೆ. ಹೊಸ ವಿಧಾನವು ಈ ಏಕ-ಬಿಂದು ಅಂದಾಜನ್ನು (single-point estimate) ನಂತರದ ಫಲಿತಾಂಶಗಳ ಬಹು-ಆಯಾಮದ ನಕ್ಷೆಯೊಂದಿಗೆ (multi-dimensional map) ಬದಲಾಯಿಸುತ್ತದೆ. ಒಂದು AI ಮಾಡೆಲ್ಗೆ 'X' ಎಂಬ ಜೀನ್ ಅನ್ನು ತೆಗೆದುಹಾಕುವುದರಿಂದ 'Y' ಎಂಬ ಪಾತ್ವೇ (pathway) ಸಕ್ರಿಯವಾಗುತ್ತದೆ ಮತ್ತು ಒಂದು ಅಭ್ಯರ್ಥಿ ಔಷಧವು ಅದೇ ಪಾತ್ವೇ ಅನ್ನು ಕುಗ್ಗಿಸುತ್ತದೆ ಎಂಬುದು ತಿಳಿದಾಗ, ಅದು ಬಹಳ ಮೊದಲೇ ಅದರ ಪರಿಣಾಮಕಾರಿತ್ವವನ್ನು (efficacy) ಅಂದಾಜಿಸಬಲ್ಲದು.
ಇದರ ಪ್ರಯೋಜನವೆಂದರೆ ದುಬಾರಿವಾದ 'ಟ್ರಯಲ್-ಅಂಡ್-ಎರರ್' (trial-and-error) ಪ್ರಯೋಗಗಳ ಕಡಿತ. ಒಂದು ಸಂಯುಕ್ತವು ಅಪೇಕ್ಷಣೀಯ ಜೀವಕೋಶದ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಪ್ರಚೋದಿಸುತ್ತದೆ ಎಂದು ಮಾಡೆಲ್ ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ಮುನ್ಸೂಚಿಸಿದರೆ, ಕಡಿಮೆ ಸಂಯುಕ್ತಗಳನ್ನು ಸಂಶ್ಲೇಷಿಸಬೇಕಾಗುತ್ತದೆ (synthesized), ಸ್ಕ್ರೀನ್ ಮಾಡಬೇಕಾಗುತ್ತದೆ ಮತ್ತು ವಿಲೇವಾರಿ ಮಾಡಬೇಕಾಗುತ್ತದೆ. ಇದು ಸಂಶೋಧನೆ ಮತ್ತು ಅಭಿವೃದ್ಧಿ (R&D) ವೆಚ್ಚವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ಸಮಯವನ್ನು ಉಳಿಸುತ್ತದೆ—ಇವು ಔಷಧದ ಮಾರುಕಟ್ಟೆ ಏಕಸ್ವಾಮ್ಯದ ಅವಧಿ (market exclusivity window) ಮತ್ತು ಫಾರ್ಮಾ ಕಂಪನಿಗಳ ಲಾಭದ ಮೇಲೆ ನೇರ ಪರಿಣಾಮ ಬೀರುವ ಪ್ರಯೋಜನಗಳಾಗಿವೆ.
"ಸರಿಯಾದ ಡೇಟಾ" ಒಂದು ರಕ್ಷಣಾ ಕವಚವಾಗುತ್ತದೆ
ಈ ಪಾಲುದಾರಿಕೆಯು "ಬಿಗ್ ಡೇಟಾ" (big data) ಇಂದ "ಸರಿಯಾದ ಡೇಟಾ" (right data) ಕಡೆಗಿನ ಬದಲಾವಣೆಯನ್ನು ಎತ್ತಿ ತೋರಿಸುತ್ತದೆ. ಸಾಮಾನ್ಯ ಉದ್ದೇಶದ ಮಾಡೆಲ್ಗಳು ಹೆಚ್ಚಿನ ಪ್ರಮಾಣದ ಡೇಟಾದ ಮೇಲೆ ಅಭಿವೃದ್ಧಿ ಹೊಂದುತ್ತವೆ, ಆದರೆ ಔಷಧ ಸಂಶೋಧನೆಯು ಅತ್ಯಂತ ನಿರ್ದಿಷ್ಟವಾದ ಮತ್ತು ಪಡೆಯಲು ಕಷ್ಟಕರವಾದ ಡೇಟಾವನ್ನು ಬಯಸುತ್ತದೆ. ವಿಶ್ವಾಸಾರ್ಹ ಜೀವಕೋಶದ ಪ್ರತಿಕ್ರಿಯೆ ಪ್ರೊಫೈಲ್ಗಳನ್ನು (cellular response profiles) ಸೃಷ್ಟಿಸಲು ಅತ್ಯಾಧುನಿಕ ಉಪಕರಣಗಳು, ನುರಿತ ಸಿಬ್ಬಂದಿ ಮತ್ತು ಕಟ್ಟುನಿಟ್ಟಾದ ಗುಣಮಟ್ಟದ ನಿಯಂತ್ರಣಗಳು ಬೇಕಾಗುತ್ತವೆ—ಇವುಗಳನ್ನು ಕೇವಲ ಬಲಿಷ್ಠ ಹಣಕಾಸಿನ ಶಕ್ತಿಯಿರುವ ಕಂಪನಿಗಳು ಮಾತ್ರ ಕೈಲಾದಗೊಳಿಸಬಲ್ಲವು.
ತಳಿ ಸಂಕೇತವನ್ನು (genetic code) ಅಳೆಯಬಹುದಾದ ಜೀವಕೋಶದ ಫಲಿತಾಂಶಗಳೊಂದಿಗೆ ಜೋಡಿಸುವ ಪೈಪ್ಲೈನ್ ಹೊಂದಿರುವ ಕಂಪನಿಗಳು ಅತ್ಯಂತ ಮೌಲ್ಯಯುತವಾದ ಬೌದ್ಧಿಕ ಆಸ್ತಿಯನ್ನು (intellectual property) ಹೊಂದಿರುತ್ತವೆ. ಅಂತಹ ಡೇಟಾ ಸೆಟ್ಗಳ ಏಕಸ್ವಾಮ್ಯವು ಹೊಸ ನ್ಯೂರಲ್ ನೆಟ್ವರ್ಕ್ ಆರ್ಕಿಟೆಕ್ಚರ್ (neural network architecture) ಅನ್ನು ಅನುಕರಿಸುವುದಕ್ಕಿಂತ ಕಷ್ಟಕರವಾದ ರಕ್ಷಣಾತ್ಮಕ ಅಡೆತಡೆಯನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ. ಬಯೋಟೆಕ್ ಸಂಸ್ಥಾಪಕರಿಗೆ ಸಂದೇಶ ಸ್ಪಷ್ಟವಾಗಿದೆ: ಮುಂದಿನ ಅಲ್ಗಾರಿದಮಿಕ್ ಕ್ರಾಂತಿಯ (algorithmic breakthrough) ಬೆನ್ನಟ್ಟುವ ಬದಲು, ಒಂದು ಡೇಟಾ ಇಂಜಿನ್ ಅನ್ನು ನಿರ್ಮಿಸುವುದು ಹೆಚ್ಚು ಕಾರ್ಯತಂತ್ರದ ಕ್ರಮವಾಗಬಹುದು.
ವಿರೋಧಾತ್ಮಕ ಅಂಶ: ಡೇಟಾ ಮಾತ್ರ ಎಲ್ಲವನ್ನೂ ಪರಿಹರಿಸಲಾರದು
ಪರಿಪೂರ್ಣ ಡೇಟಾ ಕೂಡ AI ಮಾಡೆಲ್ಗಳನ್ನು ತಪ್ಪುದಾರಿಗೆಳೆಯಬಹುದು ಎಂದು ವಿಮರ್ಶಕರು ಗಮನಿಸುತ್ತಾರೆ. ಅಂಗಾಂಶದ ವಿಧಗಳು (tissue types), ಕಾಯಿಲೆಯ ಸ್ಥಿತಿಗಳು ಮತ್ತು ರೋಗಿಗಳ ಜನಸಂಖ್ಯಾ ವಿವರಗಳ (demographics) ಆಧಾರದ ಮೇಲೆ ಜೀವಕೋಶಗಳು ಭಿನ್ನವಾಗಿರುತ್ತವೆ; ಒಂದು ಸಂದರ್ಭದಲ್ಲಿ ಸಂಗ್ರಹಿಸಿದ ಡೇಟಾ ಸೆಟ್ ಎಲ್ಲರಿಗೂ ಅನ್ವಯಿಸದಿರಬಹುದು (generalize). ಬೃಹತ್, ಉನ್ನತ ಗುಣಮಟ್ಟದ ಡೇಟಾ ಸೆಟ್ಗಳನ್ನು ಸೃಷ್ಟಿಸುವ ಮತ್ತು ಸಂಘಟಿಸುವ ವೆಚ್ಚವು ಮಾಡೆಲ್ಗಳನ್ನು ತರಬೇತಿಗೊಳಿಸುವ ವೆಚ್ಚಕ್ಕಿಂತಲೂ ಹೆಚ್ಚಾಗಬಹುದು, ಇದು ಸಣ್ಣ ಕಂಪನಿಗಳಿಗೆ ಸ್ಕೇಲೆಬಿಲಿಟಿ (scalability) ಬಗ್ಗೆ ಪ್ರಶ್ನೆಗಳನ್ನು ಎತ್ತುತ್ತದೆ.
ನಿಯಂತ್ರಕರು (Regulators) ಕೂಡ ಮುಖ್ಯವಾಗಿದ್ದಾರೆ. ಮಾನವ ಜೀವಶಾಸ್ತ್ರವನ್ನು ಸಿಮ್ಯುಲೇಟ್ ಮಾಡುತ್ತದೆ ಎಂದು ಹೇಳುವ ಪ್ರೆಡಿಕ್ಟಿವ್ AI ಅನ್ನು ಅಂತಿಮವಾಗಿ ಕ್ಲಿನಿಕಲ್ ಫಲಿತಾಂಶಗಳ (clinical outcomes) ಮೂಲಕ ದೃಢೀಕರಿಸಬೇಕಾಗುತ್ತದೆ, ಇದು ಹೆಚ್ಚಿನ ಪರಿಶೀಲನೆಯನ್ನು ಬಯಸುತ್ತದೆ. ನೈಜ ಪ್ರಪಂಚದ ಪರೀಕ್ಷೆಗಳಿಲ್ಲದೆ ಉದ್ಯಮವು 'ಇನ್-ಸಿಲಿಕೋ' (in-silico) ಮುನ್ಸೂಚನೆಗಳ ಮೇಲೆ ಅತಿಯಾಗಿ ಅವಲಂಬಿತವಾದರೆ, ಭರವಸೆಯ ಅಭ್ಯರ್ಥಿಗಳು ಪ್ರಯೋಗಗಳಲ್ಲಿ ವಿಫಲವಾದಾಗ ಹಿನ್ನಡೆ ಎದುರಿಸಬೇಕಾಗಬಹುದು.
ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು
GSK-Relation ಪ್ರಯತ್ನವು ಭರವಸೆ ನೀಡಿದ ಪ್ರಮಾಣದಲ್ಲಿ ಬಳಕೆಗೆ ಯೋಗ್ಯವಾದ ಡೇಟಾವನ್ನು ನೀಡಬಲ್ಲದೇ ಎಂಬುದನ್ನು ಮುಂದಿನ ಕೆಲವು ತಿಂಗಳುಗಳು ತಿಳಿಸಲಿವೆ. ಪ್ರಮುಖ ಸೂಚಕಗಳು ಇಲ್ಲಿವೆ:
- ಇತರ ಸಂಶೋಧಕರು ಪ್ರವೇಶಿಸಬಹುದಾದ (ನಿರ್ಬಂಧಿತ ನಿಯಮಗಳ ಅಡಿಯಲ್ಲಿಯೂ ಸಹ) ಬೆಂಚ್ಮಾರ್ಕ್ ಡೇಟಾ ಸೆಟ್ಗಳ ಪ್ರಕಟಣೆ
- ಪರೀಕ್ಷಾ ಸೆಟ್ಗಳಲ್ಲಿ (test set) ಸಾಂಪ್ರದಾಯಿಕ ಸ್ಕ್ರೀನಿಂಗ್ ವಿಧಾನಗಳಿಗಿಂತ ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಆರಂಭಿಕ ಹಂತದ AI ಮಾಡೆಲ್ಗಳು
- ಡೇಟಾ ವಿಧಾನವು ಮರುಸೃಷ್ಟಿಸಬಹುದಾದದ್ದು ಎಂಬ ವಿಶ್ವಾಸವನ್ನು ಸೂಚಿಸುವ ಇತರ ದೊಡ್ಡ ಫಾರ್ಮಾ ಕಂಪನಿಗಳಿಂದ ಬರುವ ಮುಂದಿನ ಹಂತದ ಹೂಡಿಕೆಗಳು
ಈ ಸಹಯೋಗವು ಹಿಟ್-ರೇಟ್ (hit-rate) ಅಥವಾ ಸೈಕಲ್ ಸಮಯದಲ್ಲಿ (cycle time) ಗಮನಾರ್ಹ ಸುಧಾರಣೆಗಳನ್ನು ತಂದರೆ, ಇದು ಇಡೀ ಉದ್ಯಮವು ತನ್ನ R&D ಹಣವನ್ನು ಹೇಗೆ ಹಂಚಿಕೆ ಮಾಡುತ್ತದೆ ಎಂಬುದನ್ನು ಮರುರೂಪಿಸುವಂತಹ ಸಮಾಂತರ ಒಪ್ಪಂದಗಳ ಅಲೆಗೆ ಕಾರಣವಾಗಬಹುದು. ಇದಕ್ಕೆ ವಿರುದ್ಧವಾಗಿ, ಡೇಟಾ ಅತಿಯಾದ ಗೊಂದಲಮಯವಾಗಿದ್ದರೆ (noisy) ಅಥವಾ ಸಂಯೋಜಿಸಲು ದುಬಾರಿಯಾಗಿದ್ದರೆ, ಕಂಪನಿಗಳು AI ಅನ್ನು ಸಾಂಪ್ರದಾಯಿಕ ಹೈ-ಥ್ರೂಪುಟ್ ಸ್ಕ್ರೀನಿಂಗ್ನೊಂದಿಗೆ (high-throughput screening) ಬೆರೆಸುವ ಹೈಬ್ರಿಡ್
ಸಾರಾಂಶ
ಉತ್ತಮ ಗುಣಮಟ್ಟದ ಕೋಶೀಯ ದತ್ತಾಂಶದ ಮೇಲೆ GSK ಮಾಡಿರುವ $110 ಮಿಲಿಯನ್ ಡಾಲರ್ ಪಣವು ಒಂದು ನಿರ್ಣಾಯಕ ತಿರುವನ್ನು ಸೂಚಿಸುತ್ತದೆ: AI ಔಷಧ ಸಂಶೋಧನೆಯಲ್ಲಿ, ಅಲ್ಗಾರಿದಮ್ಗಳ ಗಾತ್ರಕ್ಕಿಂತ ಹೆಚ್ಚಾಗಿ, ಮಾದರಿಗಳನ್ನು ತರಬೇತಿಗೊಳಿಸುವ ಜೈವಿಕ ಸಂಕೇತಗಳ ಗುಣಮಟ್ಟ ಮತ್ತು ವಿಶಿಷ್ಟತೆಯೇ ಅತ್ಯಂತ ನಿರ್ಣಾಯಕ ಅನುಕೂಲವಾಗಲಿದೆ.
