Claude ਦੀ ਸਵੈ-ਚਾਲਿਤ ਪ੍ਰੋਟੀਨ-ਬਾਈਂਡਰ ਮੁਹਿੰਮ ਨੇ 27% ਹਿੱਟ ਰੇਟ ਦਰਜ ਕੀਤਾ, ਜੋ ਕਿ ਮਨੁੱਖਾਂ ਦੁਆਰਾ ਚਲਾਏ ਜਾਣ ਵਾਲੇ ਲੈਬਾਂ ਦੇ ਆਮ 10-15% ਦੇ ਮੁਕਾਬਲੇ ਬਿਹਤਰ ਸੀ ਅਤੇ ਉਸੇ ਟੀਚੇ 'ਤੇ ਮਨੁੱਖੀ ਕੋਸ਼ਿਸ਼ਾਂ ਤੋਂ ਵੀ ਤੇਜ਼ ਸੀ। ਇਹ ਨਤੀਜਾ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਇੱਕ ਵਿਸ਼ਾਲ ਅਤੇ ਚੰਗੀ ਤਰ੍ਹਾਂ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਪ੍ਰੋਂਪਟ ਇੱਕ ਲੈਂਗੂਏਜ ਮਾਡਲ ਨੂੰ ਇੱਕ ਵਰਚੁਅਲ ਬਾਇਓਟੈਕ ਵਰਕਫਲੋ ਵਿੱਚ ਬਦਲ ਸਕਦਾ ਹੈ, ਪਰ ਇਹ ਇਹ ਵੀ ਉਜਾਗਰ ਕਰਦਾ ਹੈ ਕਿ ਜਦੋਂ ਮਾਡਲ ਦੇ ਕਾਨਫੀਡੈਂਸ ਮੈਟ੍ਰਿਕਸ ਗਲਤ ਹੋ ਜਾਂਦੇ ਹਨ ਤਾਂ ਉਹ ਪਹੁੰਚ ਕਿੰਨੀ ਕਮਜ਼ੋਰ ਰਹਿੰਦੀ ਹੈ।
ਅੰਕੜਿਆਂ ਵਿੱਚ ਪ੍ਰਯੋਗ
Anthropic ਨੇ ਆਪਣੇ Claude ਮਾਡਲ ਨੂੰ ਪੂਰੇ ਪੱਧਰ ਦਾ ਪ੍ਰੋਟੀਨ ਡਿਜ਼ਾਈਨ ਪ੍ਰੋਟੋਕੋਲ ਅਤੇ ਇੱਕ ਨਿਸ਼ਚਿਤ GPU ਬਜਟ ਦਿੱਤਾ, ਫਿਰ ਇਸਨੂੰ 16 ਪ੍ਰੋਟੀਨ ਟਾਰਗੇਟਸ 'ਤੇ ਅੰਤ-ਤੱਕ (end-to-end) ਮੁਹਿੰਮ ਚਲਾਉਣ ਦਿੱਤੀ। ਲੈਬ-ਸਾਈਡ ਦੀ ਅਸਫਲਤਾ ਤੋਂ ਬਾਅਦ ਇੱਕ ਟਾਰਗੇਟ ਨੂੰ ਹਟਾ ਦਿੱਤਾ ਗਿਆ, ਜਿਸ ਨਾਲ 15 ਵਿਵਹਾਰਕ ਮੁਹਿੰਮਾਂ ਬਾਕੀ ਰਹਿ ਗਈਆਂ। ਉਹਨਾਂ ਵਿੱਚੋਂ Claude ਨੇ 1,320 ਉਮੀਦਵਾਰ ਸੀਕੁਐਂਸਾਂ ਤਿਆਰ ਕੀਤੀਆਂ; ਲੈਬਾਰਟਰੀ ਟੈਸਟਿੰਗ ਨੇ 354 ਨੂੰ ਅਸਲੀ ਬਾਈਂਡਰਸ ਵਜੋਂ ਪੁਸ਼ਟੀ ਕੀਤੀ, ਜਿਸ ਨਾਲ 26.8% ਦੀ ਸਫਲਤਾ ਦਰ ਪ੍ਰਾਪਤ ਹੋਈ।
ਤੁਲਨਾ ਲਈ, ਜ਼ਿਆਦਾਤਰ ਮਨੁੱਖੀ-ਪ੍ਰਧਾਨ ਬਾਈਂਡਰ ਪ੍ਰੋਜੈਕਟ 10% ਤੋਂ 15% ਦੇ ਵਿਚਕਾਰ ਹਿੱਟ ਰੇਟ ਦਰਜ ਕਰਦੇ ਹਨ। RBX1 ਟਾਰਗੇਟ 'ਤੇ ਸਿੱਧੇ ਮੁਕਾਬਲੇ ਵਿੱਚ, ਮਨੁੱਖੀ ਭਾਗੀਦਾਰਾਂ ਨੇ 3.7% ਹਿੱਟ ਰੇਟ ਪ੍ਰਾਪਤ ਕੀਤਾ ਜਦੋਂ ਕਿ Claude ਦੇ ਡਿਜ਼ਾਈਨਾਂ ਨੇ 31.1% ਹਿੱਟ ਰੇਟ ਦਰਜ ਕੀਤਾ। ਮਾਡਲ ਸਵੈ-ਰੈਂਕਿੰਗ ਕਰਨ ਦੇ ਯੋਗ ਵੀ ਸਾਬਤ ਹੋਇਆ: Claude ਦੁਆਰਾ ਆਪਣੇ ਸਭ ਤੋਂ ਵਧੀਆ ਵਜੋਂ ਦੱਸੇ ਗਏ ਇੱਕਲੌਤੇ ਡਿਜ਼ਾਈਨ ਨੇ 49% ਵਾਰ ਸਫਲਤਾ ਹਾਸਲ ਕੀਤੀ, ਅਤੇ ਚੋਟੀ ਦੇ ਦਸ ਡਿਜ਼ਾਈਨਾਂ ਨੇ 39% ਵਾਰ ਸਫਲਤਾ ਹਾਸਲ ਕੀਤੀ।
ਜਿੱਥੇ ਸਿਸਟਮ ਅਸਫਲ ਰਿਹਾ
ਇਹ ਅੰਕੜੇ ਦੋ ਵੱਡੀਆਂ ਕਮੀਆਂ ਨੂੰ ਛੁਪਾਉਂਦੇ ਹਨ। Claude MBP ਟਾਰਗੇਟ 'ਤੇ ਪੂਰੀ ਤਰ੍ਹਾਂ ਅਸਫਲ ਰਿਹਾ ਅਤੇ TNFα ਟਾਰਗੇਟ 'ਤੇ ਮਾੜਾ ਪ੍ਰਦਰਸ਼ਨ ਕੀਤਾ, ਫਿਰ ਵੀ ਉਹਨਾਂ ਰਨਾਂ ਲਈ ਇਸਦੇ ਅੰਦਰੂਨੀ ਕਾਨਫੀਡੈਂਸ ਸਕੋਰ ਉੱਚੇ ਰਹੇ। ਦੂਜੇ ਸ਼ਬਦਾਂ ਵਿੱਚ, ਮਾਡਲ ਨੂੰ ਭਰੋਸਾ ਸੀ ਕਿ ਉਹ ਸਫਲ ਹੋ ਰਿਹਾ ਹੈ ਜਦੋਂ ਕਿ ਵੈੱਟ-ਲੈਬ ਰੀਡਆਊਟਸ ਕੁਝ ਹੋਰ ਹੀ ਕਹਾਣੀ ਦੱਸ ਰਹੇ ਸਨ। ਉਹ ਗਲਤ ਤਾਲਮੇਲ ਵਾਲੇ ਸਿਗਨਲ ਇੱਕ ਜੋਖਮ ਨੂੰ ਉਜਾਗਰ ਕਰਦੇ ਹਨ: ਇੱਕ ਸਵੈ-ਚਾਲਿਤ ਪਾਈਪਲਾਈਨ ਜੋ ਆਪਣੇ ਮੈਟ੍ਰਿਕਸ 'ਤੇ ਭਰੋਸਾ ਕਰਦੀ ਹੈ, ਉਹ ਨਾਕਾਮ ਪ੍ਰਯੋਗਾਂ 'ਤੇ ਸਰੋਤ ਬਰਬਾਦ ਕਰ ਸਕਦੀ ਹੈ।
ਪ੍ਰੋਂਪਟ ਇੰਜੀਨੀਅਰਿੰਗ ਇੱਕ ਨਵੀਂ ਲੈਬ ਨੋਟਬੁੱਕ ਵਜੋਂ
ਅਧਿਐਨ ਦਾ ਸਭ ਤੋਂ ਹੈਰਾਨੀਜਨਕ ਪਹਿਲੂ ਬਾਇਓਲੋਜੀ ਨਹੀਂ ਬਲਕਿ ਉਹ ਪ੍ਰੋਂਪਟ ਹੈ ਜਿਸ ਨੇ ਇਸਨੂੰ ਚਲਾਇਆ। ਇੱਕ ਸੀਨੀਅਰ ਵਿਗਿਆਨੀ ਆਮ ਤੌਰ 'ਤੇ ਇਹ ਫੈਸਲਾ ਕਰਨ ਵਿੱਚ ਹਫ਼ਤਿਆਂ ਬਿਤਾਉਂਦਾ ਹੈ ਕਿ ਕਿਹੜੇ ਪ੍ਰੋਟੀਨ ਖੇਤਰਾਂ ਦੀ ਖੋਜ ਕਰਨੀ ਹੈ, ਕਿਹੜੇ ਕੰਪਿਊਟੇਸ਼ਨਲ ਟੂਲਸ ਦੀ ਵਰਤੋਂ ਕਰਨੀ ਹੈ, ਅਤੇ ਕੰਪਿਊਟ ਟਾਈਮ ਨੂੰ ਕਿਵੇਂ ਵੰਡਣਾ ਹੈ। Anthropic ਨੇ ਉਸ ਮਾਹਰਤਾ ਨੂੰ 16,000 ਸ਼ਬਦਾਂ ਦੇ ਪ੍ਰੋਂਪਟ ਵਿੱਚ ਸੰਕੁਚਿਤ ਕਰ ਦਿੱਤਾ—ਜੋ ਲਗਭਗ ਇੱਕ ਛੋਟੇ ਨਾਵਲ ਦੇ ਬਰਾਬਰ ਹੈ। ਲਗਭਗ ਦੋ-ਤਿਹਾਈ ਟੈਕਸਟ ਕਾਰਜਸ਼ੀਲ ਚਿੰਤਾਵਾਂ ਨਾਲ ਸਬੰਧਤ ਸੀ: ਸਮਾਂ, ਬਜਟ ਦੀ ਨਿਗਰਾਨੀ, ਅਤੇ ਉਹ ਸਬ-ਏਜੰਟਸ ਜੋ ਬਾਹਰੀ ਸਾਫਟਵੇਅਰ ਨੂੰ ਕਾਲ ਕਰਦੇ ਹਨ, ਉਹਨਾਂ ਦਾ ਪ੍ਰਬੰਧ ਕਰਨਾ।
Claude ਨੇ RFdiffusion (ਇੱਕ ਡਿਫਿਊਜ਼ਨ-ਅਧਾਰਤ ਸਟ੍ਰਕਚਰ ਜਨਰੇਟਰ) ਅਤੇ ProteinMPNN (ਇੱਕ ਸੀਕੁਐਂਸ ਡਿਜ਼ਾਈਨ ਨੈੱਟਵਰਕ) ਵਰਗੇ ਓਪਨ-ਸੋਰਸ ਡਿਜ਼ਾਈਨ ਇੰਜਣਾਂ ਦੀ ਵਰਤੋਂ ਕੀਤੀ। ਲੈਂਗੂਏਜ ਮਾਡਲ ਇੱਕ ਸ਼ੈਡਿਊਲਰ ਵਜੋਂ ਕੰਮ ਕਰਦਾ ਸੀ, ਜੋ ਇਹਨਾਂ ਟੂਲਸ ਦੇ ਵਿਚਕਾਰ ਵਿਚਕਾਰਲੇ ਨਤੀਜੇ ਭੇਜਦਾ ਸੀ, ਪੈਰਾਮੀਟਰਾਂ ਨੂੰ ਐਡਜਸਟ ਕਰਦਾ ਸੀ, ਅਤੇ ਫੈਸਲਾ ਕਰਦਾ ਸੀ ਕਿ ਡਿਜ਼ਾਈਨ ਚੱਕਰ ਨੂੰ ਕਦੋਂ ਰੋਕਣਾ ਹੈ। ਅਸਲ ਵਿੱਚ, ਪ੍ਰੋਂਪਟ ਇੱਕ ਵਰਚੁਅਲ ਲੈਬਾਰਟਰੀ ਮੈਨੇਜਰ ਬਣ ਗਿਆ, ਜਿਸ ਨੇ ਮਨੁੱਖੀ ਵਿਗਿਆਨੀਆਂ ਨੂੰ ਵਰਕਫਲੋ ਤਾਲਮੇਲ ਦੀਆਂ ਬਾਰੀਕੀਆਂ ਤੋਂ ਮੁਕਤ ਕਰ ਦਿੱਤਾ।
ਬਾਈਂਡਰ ਅਸਲ ਵਿੱਚ ਕੀ ਹਨ
ਸਾਰੇ 354 ਪੁਸ਼ਟੀਸ਼ੁਦਾ ਹਿੱਟ ਅਜਿਹੇ ਅਣੂ (molecules) ਹਨ ਜੋ ਸਰੀਰਕ ਤੌਰ 'ਤੇ ਆਪਣੇ ਟਾਰਗੇਟ ਪ੍ਰੋਟੀਨ ਨਾਲ ਜੁੜਦੇ ਹਨ। ਪੇਪਰ ਬਾਈਂਡਿੰਗ ਅਸੇਅਜ਼ ਦੀ ਰਿਪੋਰਟ ਕਰਦਾ ਹੈ ਪਰ ਕਾਰਜਸ਼ੀਲ ਡੇਟਾ ਪ੍ਰਦਾਨ ਨਹੀਂ ਕਰਦਾ—ਕੋਈ ਸਬੂਤ ਨਹੀਂ ਹੈ ਕਿ ਕੋਈ ਵੀ ਬਾਈਂਡਰ ਗਤੀਵਿਧੀ ਨੂੰ ਮੋਡਿਊਲੇਟ ਕਰਦਾ ਹੈ, ਕਿਸੇ ਰੂਪ (conformation) ਨੂੰ ਸਥਿਰ ਕਰਦਾ ਹੈ, ਜਾਂ ਥੈਰੇਪਿਊਟਿਕ ਸੰਭਾਵਨਾ ਦਿਖਾਉਂਦਾ ਹੈ। ਇਸੇ ਤਰ੍ਹਾਂ, ਸਟ੍ਰਕਚਰਲ ਵੈ
ਇਸ ਤੋਂ ਇਲਾਵਾ, ਇੱਕ ਨਿਸ਼ਚਿਤ GPU ਬਜਟ 'ਤੇ ਨਿਰਭਰਤਾ ਖੋਜ ਦੀ ਡੂੰਘਾਈ 'ਤੇ ਇੱਕ ਸਖ਼ਤ ਸੀਮਾ ਲਗਾਉਂਦੀ ਹੈ। ਮਨੁੱਖੀ ਟੀਮਾਂ ਅੰਤਰਿਮ ਨਤੀਜਿਆਂ ਦੇ ਅਧਾਰ 'ਤੇ ਸਰੋਤਾਂ ਨੂੰ ਗਤੀਸ਼ੀਲ ਰੂਪ ਵਿੱਚ ਮੁੜ ਵੰਡ ਸਕਦੀਆਂ ਹਨ, ਜਦੋਂ ਕਿ Claude ਦੀ ਮੁਹਿੰਮ ਇੱਕ ਪਹਿਲਾਂ ਤੋਂ ਨਿਰਧਾਰਤ ਬਜਟ ਦੀ ਪਾਲਣਾ ਕਰਦੀ ਰਹੀ, ਜਿਸ ਨਾਲ ਸੰਭਾਵੀ ਤੌਰ 'ਤੇ ਨਮੂਨੇ ਵਜੋਂ ਲਏ ਗਏ ਸੀਕੁਐਂਸ ਸਪੇਸ ਦੀ ਵਿਸ਼ਾਲਤਾ ਸੀਮਤ ਹੋ ਸਕਦੀ ਹੈ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
Anthropic ਦਾ ਪੇਪਰ ਕਈ ਖੁੱਲ੍ਹੇ ਸਵਾਲ ਛੱਡ ਜਾਂਦਾ ਹੈ। ਭਵਿੱਖ ਦੇ ਕੰਮ ਵਿੱਚ ਕੌਨਫੀਡੈਂਸ ਕੈਲੀਬ੍ਰੇਸ਼ਨ (confidence calibration) ਨੂੰ ਹੱਲ ਕਰਨ ਦੀ ਲੋੜ ਹੋਵੇਗੀ ਤਾਂ ਜੋ ਮਾਡਲ ਦਾ ਸਵੈ-ਮੁਲਾਂਕਣ ਪ੍ਰਯੋਗਿਕ ਨਤੀਜਿਆਂ ਦੇ ਅਨੁਕੂਲ ਹੋ ਸਕੇ। ਫੰਕਸ਼ਨਲ ਅਸੇਅਜ਼ (functional assays)—ਜਿਵੇਂ ਕਿ ਐਨਜ਼ਾਈਮੈਟਿਕ ਇਨਿਬੀਸ਼ਨ ਜਾਂ ਸੈਲੂਲਰ ਗਤੀਵਿਧੀ—ਨੂੰ ਸਵੈ-ਸ਼ਾਸਿਤ ਲੂਪ ਵਿੱਚ ਸ਼ਾਮਲ ਕਰਨ ਨਾਲ ਇਹ ਤਕਨਾਲੋਜੀ ਸਿਰਫ਼ ਬਾਈਂਡਰ ਦੀ ਪਛਾਣ ਕਰਨ ਦੀ ਬਜਾਏ ਦਵਾਈ ਦੀ ਖੋਜ ਦੇ ਹੋਰ ਨੇੜੇ ਲੈ ਜਾਵੇਗੀ। ਅੰਤ ਵਿੱਚ, ਟਾਰਗੇਟਾਂ ਦੇ ਇੱਕ ਵਿਸ਼ਾਲ ਸਮੂਹ ਅਤੇ ਵੱਖ-ਵੱਖ ਬਜਟ ਸਥਿਤੀਆਂ ਦੇ ਅਧੀਨ ਇਸ ਪਹੁੰਚ ਦੀ ਬੈਂਚਮਾਰਕਿੰਗ ਇਹ ਦੱਸੇਗੀ ਕਿ ਦੇਖਿਆ ਗਿਆ ਹਿੱਟ ਰੇਟ ਦੁਹਰਾਉਣਯੋਗ ਹੈ ਜਾਂ ਇੱਕ ਆਊਟਲਾਈਰ ਹੈ।
ਮੁੱਖ ਨੁਕਤਾ ਸਪੱਸ਼ਟ ਹੈ: ਵਿਸਤ੍ਰਿਤ ਪ੍ਰੋਂਪਟ ਆਰਕੈਸਟ੍ਰੇਸ਼ਨ ਇੱਕ ਲੈਂਗੂਏਜ ਮਾਡਲ ਨੂੰ ਇੱਕ ਵਰਚੁਅਲ ਬਾਇਓਟੈਕ ਲੈਬ ਵਿੱਚ ਬਦਲ ਸਕਦੀ ਹੈ, ਜੋ ਅਜਿਹੇ ਬਾਈਂਡਰ ਹਿੱਟ ਰੇਟ ਪ੍ਰਦਾਨ ਕਰਦੀ ਹੈ ਜੋ ਮਨੁੱਖੀ ਔਸਤਾਂ ਤੋਂ ਕਿਤੇ ਵੱਧ ਹਨ। ਫਿਰ ਵੀ, ਇਹ ਪਹੁੰਚ ਅਜੇ ਵੀ ਮਾਹਰ ਪ੍ਰੋਂਪਟ ਲੇਖਕਤਾ 'ਤੇ ਨਿਰਭਰ ਕਰਦੀ ਹੈ ਅਤੇ ਵਿਸ਼ਵਾਸ ਦੀਆਂ ਗਲਤੀਆਂ (confidence misfires) ਤੋਂ ਪ੍ਰਭਾਵਿਤ ਹੁੰਦੀ ਹੈ ਜੋ ਮਹਿੰਗੇ ਪ੍ਰਯੋਗਾਂ ਨੂੰ ਵਿਗੜਾ ਸਕਦੀਆਂ ਹਨ। ਜਿਵੇਂ-ਜਿਵੇਂ ਭਾਈਚਾਰਾ ਇਹਨਾਂ ਪਾਈਪਲਾਈਨਾਂ ਨੂੰ ਸੁਧਾਰ ਰਿਹਾ ਹੈ, AI ਦੀ ਖੁਦਮੁਖਤਿਆਰੀ ਅਤੇ ਮਨੁੱਖੀ ਨਿਗਰਾਨੀ ਵਿਚਕਾਰ ਸੰਤੁਲਨ ਇਹ ਨਿਰਧਾਰਤ ਕਰੇਗਾ ਕਿ ਕੀ ਅਜਿਹੇ ਸਿਸਟਮ ਰੋਜ਼ਾਨਾ ਦੇ ਸਾਧਨ ਬਣ ਜਾਣਗੇ ਜਾਂ ਪ੍ਰਯੋਗਿਕ ਉਤਸੁਕਤਾਵਾਂ ਬਣੇ ਰਹਿਣਗੇ।
