சிவப்புக்கோடு கொள்கை
இந்த வாரம் வெளியிடப்பட்ட சோதனை, எந்தவொரு சரிபார்க்கக்கூடிய பணியிலும் (verifiable task), தன்னாட்சி முகவர் சுழற்சிகளை (autonomous agent loops) முடிவுக்குக் கொண்டுவருவதற்கு, ஒரு LLM-ன் சொந்தத் தீர்ப்பை விட ஒரு புறநிலை "சிவப்புக்கோடு" (objective red line) நிறுத்தச் சிக்னல் சிறப்பாகச் செயல்படுகிறது என்பதைக் காட்டுகிறது. நடுத்தரக் கடினத்தன்மை கொண்ட கோடிங் பெஞ்ச்மார்க்கில் (coding benchmark), சிவப்புக்கோட்டைப் பயன்படுத்திய முகவர்கள் சராசரியாக 3.3 சுழற்சிகளுக்குப் பிறகு முடிவுக்கு வந்தன; சுயத் தீர்ப்பைச் சார்ந்திருந்த முகவர்கள், பணியை முடிக்காமலேயே எட்டு-படி கடின வரம்பை (eight-step hard limit) எட்டின.
இந்த ஒப்பீடு ஏன் முக்கியமானது
தன்னாட்சி AI முகவர்கள் இப்போது மனிதக் கண்காணிப்பு இன்றி குறியீடுகளை (code) உருவாக்குகின்றன, அறிக்கைகளை எழுதுகின்றன மற்றும் கட்டமைக்கப்பட்ட தரவுகளை (structured data) உற்பத்தி செய்கின்றன. ஒவ்வொரு சுழற்சியும் கணினித் திறன் (compute) மற்றும் சேமிப்பகத்தை (storage) பயன்படுத்துகிறது; மேலும், சுழற்சி தவறாகச் செயல்படும்போது, முந்தைய முடிவுகளைச் சிதைக்கக்கூடும். முகவர் எப்போது நிறுத்தப்பட வேண்டும் என்பதைத் தீர்மானிப்பது ஒரு முக்கிய நம்பகத்தன்மைப் பிரச்சனையாகும் (reliability problem). ஒரு எளிய, புறநிலைச் சோதனை—அதாவது வெளியீடு முன்கூட்டியே வரையறுக்கப்பட்ட நிபந்தனையைப் பூர்த்தி செய்கிறதா என்று சரிபார்ப்பது—மாதிரியிடம் "நான் முடித்துவிட்டேன்" என்று கூறக் கேட்பதை விடச் சிறப்பாகச் செயல்படுகிறது என்று புதிய தரவுகள் காட்டுகின்றன.
தற்காலிக நிறுத்தத்திலிருந்து புறநிலை சிவப்புக்கோடுகள் வரை
இந்த ஆய்வு இரண்டு உத்திகளை ஒப்பிட்டது:
- நிபந்தனை A – புறநிலை சிவப்புக்கோடு: ஒரு உறுதியான சோதனை வெற்றி பெற்றவுடன் சுழற்சி நிறுத்தப்படும் (எ.கா., குறியீடு தொகுக்கப்படுகிறது (code compiles), JSON ஸ்கீமாவிற்கு இணங்குகிறது, அல்லது ஒரு கோப்பு உருவாகிறது).
- நிபந்தனை B – LLM சுயத் தீர்ப்பு: பணி முடிந்துவிட்டதாக மாதிரி கருதும் போது, அது "ஆம்" அல்லது "இல்லை" என்று பதிலளிக்கும்.
இவை இரண்டும் செயல்பாட்டு குறியீட்டை (functional code) எழுதுவது போன்ற சரிபார்க்கக்கூடிய பணிகளில் இயக்கப்பட்டன. சிவப்புக்கோடு அணுகுமுறை ஒவ்வொரு முறையும் வெற்றி பெற்றது; சுயத் தீர்ப்பு அணுகுமுறை தொடர்ந்து தோல்வியடைந்தது; இது முன்கூட்டியே நிர்ணயிக்கப்பட்ட சுழற்சி வரம்பை (iteration budget) தீர்த்துவிட்டாலோ அல்லது சிறந்த பதிலைத் தேடும் போது சரியான வெளியீட்டை அழித்துவிட்டாலோ நிகழ்கிறது. தோல்வி முறை ஒரே மாதிரியாக உள்ளது: மாதிரி சரியான குறியீட்டை உருவாக்குகிறது, ஆனால் அதன் நம்பிக்கை (confidence) சுயத் தீர்ப்பு வரம்பைத் தாண்டவில்லை, எனவே அமைப்பு கட்டாயமாக நிறுத்தும் வரை அது சுழற்சியைத் தொடர்கிறது. இதன் விளைவாக: வீணான சுழற்சிகள் மற்றும் சில நேரங்களில் சிதைந்த கோப்புகள் உருவாகின்றன.
சிவப்புக்கோடு சிக்னல்களின் மூன்று நிலைகள்
நிறுத்த சிக்னல்களுக்கான வகைப்பாட்டை (taxonomy) ஆசிரியர் முன்மொழிகிறார்:
- Format Red Line (வடிவமைப்பு சிவப்புக்கோடு) – தொடரியல் பண்புகளைச் (syntactic properties) சரிபார்க்கிறது (சரியான JSON, செல்லுபடியாகும் கோப்பு, முறையான மார்க்கப் பயன்பாடு). இது நன்கு வடிவமைக்கப்பட்ட வெளியீட்டை உறுதி செய்கிறது, ஆனால் செயல்பாட்டுத் துல்லியத்தை (functional correctness) உறுதிப்படுத்த முடியாது.
- Demand Red Line (தேவை சிவப்புக்கோடு) – வணிகத் தர்க்கம் (business logic) அல்லது சோதனை முடிவுகளைச் சரிபார்க்கிறது (எ.கா., யூனிட் டெஸ்ட்கள் வெற்றி பெறுகின்றன). இது உற்பத்தி குறியீட்டிற்கான (production code) நம்பகமான சிக்னலாகும்.
- Semantic Red Line (பொருள்சார் சிவப்புக்கோடு) – தர்க்கரீதியான ஒருமைப்பாடு அல்லது தரத்தை மதிப்பிட முயல்கிறது (எ.கா., ஒரு வாதாடும் அறிக்கை). முழுமையாகத் தானியங்கி மற்றும் நம்பகமான அளவீடு இன்னும் இல்லை, எனவே இந்த நிலை ஒரு ஆராய்ச்சித் துறையாகவே உள்ளது.
சிவப்புக்கோடுகளைச் சுற்றி ஒரு உற்பத்திப் பாதையை (production pipeline) உருவாக்குதல்
- புறநிலை சிக்னல் இருக்கும்போது: சிவப்புக்கோட்டை நேரடியாகச் சுழற்சியுடன் இணைக்கவும். சோதனை வெற்றி பெறும்போது முகவர் தானாகவே நின்றுவிடும், இதனால் மனித மதிப்பாய்வுத் தேவை இருக்காது.
- பகுதிச் சிக்னல் இருக்கும்போது: சிவப்புக்கோட்டில் சுழற்சியை நிறுத்த அனுமதிக்கவும், ஆனால் ஒரு மனிதர் வெளியீடுகளின் ஒரு பகுதியைச் சரிபார்க்கும் மாதிரிப் படிநிலையைச் (sampling step) சேர்க்கவும். இது தானியங்கி முறைக்கும் பாதுகாப்புக்கும் இடையே சமநிலையை ஏற்படுத்துகிறது.
- சிக்னல் இல்லாதபோது: ஒரு கடினமான சுழற்சி வரம்பை (hard iteration cap) அமல்படுத்தவும், முடிவை "சரிபார்க்கப்படாதது" (unverified) என்று குறியிடவும், மேலும் மதிப்பீட்டிற்காக அதை ஒரு மனிதரிடம் ஒப்படைக்கவும்.
கொள்கை தெளிவானது: ஒரு தன்னாட்சி முகவரின் இலக்கு "அதிகம் செய்வது" அல்ல, மாறாக எப்போது நிறுத்த வேண்டும் என்பதைத் துல்லியமாகத் தெரிந்து கொள்வதாகும்.
மென்பொருள் உருவாக்குநர்களுக்கான முக்கியக் குறிப்பு
உங்களால் ஒரு புறநிலைச் சோதனையை எழுத முடிந்தால், அந்தச் சோதனை சுழற்சி எப்போது முடிவடைகிறது என்பதைத் தீர்மானிக்கட்டும். உங்களால் முடியாவிட்டால், சுழற்சியை ஒரு வரையறுக்கப்பட்ட சோதனையாகக் கருதி, அதன் முடிவை ஒரு மனிதரிடம் ஒப்படைக்கவும். உற்பத்திச் சூழலில் (production), ஒரு பணி முடிந்துவிட்டதாகத் தாமாகவே அறிவிக்க LLM-ஐச் சார்ந்திருப்பது ஒரு ஆபத்தான சூட்டாகும்.
