నియామక అల్గారిథమ్‌లు (Hiring algorithms) మానవ అసమానతలను తొలగించాలని భావించారు. ఒక మోడల్‌కు తగినన్ని రెజ్యూమ్‌లను అందిస్తే, అది కేవలం అర్హతలను బట్టి మాత్రమే నిర్ణయాలు తీసుకుంటుంది. కానీ వాస్తవ పరిస్థితి మరింత క్లిష్టంగా మారుతోంది. ప్రిన్స్‌టన్ యూనివర్శిటీ మరియు చికాగో యూనివర్శిటీ చేసిన ఒక కొత్త అధ్యయనం ప్రకారం, లార్జ్ లాంగ్వేజ్ మోడల్స్ పాత పక్షపాతాలను తిరిగి ఉపయోగించడమే కాకుండా, కొత్త రకమైన మూస పద్ధతులను (stereotypes) సృష్టిస్తున్నాయి. మోడల్ ఎంత తెలివైనదైతే, ఈ ప్రక్రియ అంత వేగంగా జరుగుతుంది.

ప్రయోగం ఎలా జరిగింది

పక్షపాతం (bias) ఎలా ఏర్పడుతుందో ప్రత్యక్షంగా గమనించడానికి పరిశోధకులు ఒక కృత్రిమ శ్రమ మార్కెట్‌ను (simulated labor market) రూపొందించారు. వారు Tufa, Aima, Reku, మరియు Weki అనే నాలుగు కల్పిత జాతి సమూహాలను సృష్టించి, ChatGPT, Claude, మరియు Gemini యొక్క వివిధ వెర్షన్లకు ఇరవై రకాల ఉద్యోగాలను భర్తీ చేసే బాధ్యతను అప్పగించారు. ఈ జాబితాలో వైద్యులు మరియు ఇంజనీర్ల నుండి పారిశుధ్య కార్మికులు మరియు క్లీనర్ల వరకు అందరూ ఉన్నారు. ఇక్కడ ఒక ముఖ్యమైన విషయం ఏమిటంటే: తెర వెనుక, ప్రతి అభ్యర్థికి విజయం సాధించే గణాంక అవకాశాలు సమానంగా ఉన్నాయి. ఒక Tufa వ్యక్తికి డాక్టర్‌గా రాణించే అవకాశం ఎంత ఉంటుందో, ఒక Weki వ్యక్తికి కూడా అంతే ఉంటుంది. గణితపరంగా ఇది పూర్తిగా నిష్పక్షపాతంగా ఉంది.

కానీ ఫలితం నిష్పక్షపాతంగా లేదు. ప్రతి నియామక ప్రక్రియ తర్వాత, ఎంపిక చేసిన అభ్యర్థి విజయం సాధించారా లేదా విఫలమయ్యారా అనే దానిపై మోడల్‌లకు సాధారణ ఫీడ్‌బ్యాక్ లభించింది. ఒక ఉన్నత హోదా కలిగిన ఉద్యోగంలో Aima అభ్యర్థి ఒక్కసారి సరిగ్గా పనిచేయలేకపోతే, మోడల్ దానిని ఒక యాదృచ్ఛిక సంఘటనగా చూడలేదు. దాన్ని ఒక నియమంగా పరిగణించింది. ఆ వ్యవస్థ వెంటనే Aima అభ్యర్థులను పారిశుధ్య పనుల వంటి తక్కువ హోదా కలిగిన ఉద్యోగాలకు పరిమితం చేయడం ప్రారంభించింది. ఒకే ఒక్క డేటా పాయింట్ వారి భవిష్యత్తును నిర్ణయించింది. ఏ మానవ ప్రోగ్రామర్ రాయని, ఏ చారిత్రక డేటాసెట్‌లో లేని ఒక క్రమానుగత శ్రేణిని (hierarchy) AI సృష్టించింది.

తెలివైన మోడల్స్ తప్పుడు సాధారణీకరణలు చేసినప్పుడు

పరిశోధకులు ఫలితాలను ఒక విభజన కొలమానం (segregation scale) ఆధారంగా కొలవగా, అందులో 2.0 అంటే ఒక సమూహాన్ని ఒకే రకమైన రంగంలోకి పూర్తిగా పరిమితం చేయడం అని అర్థం. గతంలోని మానసిక అధ్యయనాలలో పాల్గొన్న వ్యక్తులు 0.84 స్కోరు చేశారు. కానీ లాంగ్వేజ్ మోడల్స్ ఆ ప్రమాణాన్ని దాటి వెళ్ళాయి. OpenAI యొక్క రీజనింగ్ మోడల్, o3, 1.83 స్కోరు సాధించింది—ఇది దాదాపు సంపూర్ణ విభజన (perfect segregation) కి సమానం.

ఇది 'ఎక్స్‌ప్లోరేషన్-ఎక్స్‌ప్లాయిటేషన్' (exploration-exploitation) సందిగ్ధత యొక్క దుష్ప్రభావం. ఈ వ్యవస్థలు గణిత సమస్యలు, కోడింగ్ సవాళ్లు మరియు లాజిక్ పజిల్స్‌లో విజయం సాధించడానికి రూపొందించబడ్డాయి. అటువంటి రంగాలలో తక్కువ ఆధారాలతోనే సరైన ముగింపుకు వేగంగా చేరుకోవడం వల్ల మంచి ఫలితాలు వస్తాయి. ఒక నమూనాను (pattern) గుర్తించడం, దానిని ఖరారు చేయడం మరియు వేగంగా ముందుకు వెళ్లడం. అదే ప్రతిచర్యను మనుషుల విషయంలో ప్రయోగించినప్పుడు, ఒక్క అభ్యర్థి విఫలమైనా వారి జాతి ఆధారంగా వర్గీకరణ జరుగుతుంది.

ఇంకా దారుణమైన విషయం ఏమిటంటే, మోడల్స్ మరింత అధునాతనంగా మారే కొద్దీ ఈ పక్షపాతం మరింత తీవ్రమవుతుంది. OpenAI యొక్క o3 మరియు DeepSeek యొక్క R1 వంటి కొత్త హై-రీజనింగ్ వ్యవస్థలు మరింత బలమైన పక్షపాతాన్ని చూపించాయి, ఎందుకంటే అవి చాలా వేగంగా సాధారణీకరించడానికి (generalize) ప్రయత్నిస్తాయి. ఇవి త్వరగా నియమాలను రూపొందించి, వాటిని మరింత కఠినంగా మెరుగుపరచడం ద్వారా ఆప్టిమైజ్ అవుతాయి. విషయం మనుషుల గురించి అయినప్పుడు, ఆ నమ్మకం ఒక లోపంగా మారుతుంది. Aima సమూహం గురించి ఏదో ఒక సత్యాన్ని తాను కనుగొన్నానని మోడల్ అనుకుంటుంది. కానీ వాస్తవానికి, అది కేవలం ఒక అసాధారణ సంఘటన (outlier) ఆధారంగా ఒక సంకెళ్లను సృష్టించింది.

మెమరీ ట్రాప్

ఈ అధ్యయనం ఒక క్లిష్టమైన సమయంలో వెలువడింది. పరిశ్రమ ప్రస్తుతం "ఏజెంటిక్" (agentic) AI వైపు వేగంగా మళ్లుతోంది—అంటే దీర్ఘకాలిక జ్ఞాపకశక్తిని కలిగి ఉండి, వివరణాత్మక యూజర్ ప్రొఫైల్‌లను రూపొందించి, నెలలు లేదా సంవత్సరాల పాటు వ్యక్తిగతీకరించిన నిర్ణయాలు తీసుకునే వ్యవస్థలు. కార్నెల్ యూనివర్శిటీకి చెందిన కంప్యూటర్ సైంటిస్ట్ ఏంజెలీనా వాంగ్ హెచ్చరిస్తూ, మెరుగుపరచబడిన జ్ఞాపకశక్తి వల్ల మోడల్స్ గత ఇంటరాక్షన్లపై అతిగా ఆధారపడే ప్రమాదం ఉందని (over-index) చెప్పారు. ఒకే ఒక్క ప్రతికూల సంఘటన—ఒక తిరస్కరించబడిన లోన్, ఒక తొలగించబడిన ఉద్యోగి లేదా ఒక ఫ్లాగ్ చేయబడిన దరఖాస్తు—శాశ్వతమైన ఊహగా మారిపోతుంది. పక్షపాతం కాలక్రమేణా తగ్గుముఖం పట్టదు; అది మరింత గట్టిపడుతుంది. AIని మరింత సహాయకారిగా మరియు సందర్భోచితంగా మార్చడానికి ఉద్దేశించిన ఫీచర్, దానిని మొండిగా పక్షపాతంతో కూడినదిగా కూడా మార్చవచ్చు.

సమస్యను నిజంగా పరిష్కరించే మార్గం ఏమిటి?

పరిశోధకులు పలు రకాల గార్డ్‌రైల్స్‌ను (guardrails) పరీక్షించారు, ఫలితాలు ఆశ్చర్యకరంగా ఉన్నాయి.

మోడల్‌కు కేవలం "నిష్పక్షపాతంగా ఉండమని" చెప్పడం వల్ల ఏమీ సాధించలేదు. ఆ ఆదేశం కేవలం అలంకారంలా మిగిలిపోయింది, కానీ దాని వెనుక ఉన్న ఆప్టిమైజేషన్ ఇంజిన్ మాత్రం తన అసలు లక్ష్యం వైపు—అంటే విజయవంతమైన నియామకాలను గరిష్టీకరించడం (maximizing successful hires) వైపు—పయనిస్తూనే ఉంది. అడిగినప్పుడు పాటించే నైతికత అనేది విస్మరించబడిన నైతికత వంటిది.

పని చేసిన పరిష్కారం మాత్రం నిర్మాణాత్మకమైనది (structural). పరిశోధకులు వైవిధ్యభరితమైన నియామక ఫలితాలను కొనసాగించినందుకు మోడల్‌లకు అదనపు గణిత బోనస్‌ను అందించినప్పుడు, విభజన గణనీయంగా తగ్గింది. సామాజిక విలువను నేరుగా రివార్డ్ ఫంక్షన్‌లో (reward function) చేర్చాల్సి ఉంటుంది, దానిని కేవలం అదనపు అంశంగా చేర్చడం సరిపోదు. మరో మాటలో చెప్పాలంటే, మోడల్ తన సూచనలను చదవడం మాత్రమే కాకుండా, తన గణనలలో (calculations) ఆ నిష్పక్షపాత ప్రోత్సాహకాన్ని అనుభూతి చెందాలి.

డేటా పరిశుభ్రత (Data hygiene) కూడా ముఖ్యం. వయస్సు, విద్య, అనుభవం వంటి సంబంధిత వ్యక్తిగత సమాచారాన్ని అందించడం వల్ల మోడల్స్‌కు సరైన సంకేతాలు లభించాయి, దీనివల్ల అవి జాతిపరమైన మూస పద్ధతులపై (ethnic stereotyping) ఆధారపడటం తగ్గింది. కానీ జుట్టు రంగు వంటి సంబంధం లేని వివరాలను జోడిస్తే, ఆ వ్యవస్థలు వాటిని సమూహాల ఆధారంగా వర్గీకరించడానికి సాకుగా వాడుకుంటాయి. ఎక్కువ సమాచారం ఉన్నంత మాత్రాన అది ఎప్పుడూ మంచిది కాదు. ఆ సమాచారం ఏమిటి మరియు అది మోడల్ యొక్క ఆప్టిమైజేషన్ లక్ష్యానికి (optimization target) ప్రత్యామ్నాయ మార్గాన్ని చూపుతుందా లేదా అనే దానిపైనే అది పూర్తిగా ఆధారపడి ఉంటుంది.

ముందడుగు

ఇవన్నీ చాలా ముఖ్యమైనవి, ఎందుకంటే ఈ వ్యవస్థలు కేవలం చాట్ విండోలకే పరిమితం కావడం లేదు. ఇదే ఆర్కిటెక్చర్‌లను లోన్ ఆమోదాలు, పరోల్ సిఫార్సులు మరియు భారీ స్థాయిలో వర్క్‌ఫోర్స్ మేనేజ్‌మెంట్ నిర్ణయాల కోసం ఉపయోగిస్తున్నారు లేదా సిద్ధం చేస్తున్నారు. పరిశోధకులు "నవతరం పక్షపాతాల" (novel biases) గురించి హెచ్చరిస్తున్నారు—అవి ఏ మనిషికి లేని, ఏ చారిత్రక డేటాసెట్‌లో లేని పక్షపాతాలు, కానీ AI సామర్థ్యాన్ని (efficiency) పెంచుకునే క్రమంలో తనంతట తానుగా సృష్టించుకున్నవి.

అసహజమైన నిజం ఏమిటంటే, ప్రాథమిక తార్కిక సామర్థ్యం (raw reasoning ability) మరియు సామాజిక న్యాయం (social fairness) పరస్పర విరుద్ధ దిశల్లో నడుస్తాయి. సరైన సమాధానానికి అతి తక్కువ సమయంలో చేరుకోవాలని ఆప్టిమైజ్ చేయబడిన మోడల్, మనుషుల గురించి తప్పుడు అంచనాలకు వేగంగా చేరుకోవడానికి కూడా సిద్ధంగా ఉంటుంది. నిష్పక్షపాత వ్యవస్థలను నిర్మించడం అంటే కేవలం మర్యాదగా అడగడం మాత్రమే కాదు. దీని అర్థం లక్ష్యాలను (objectives) పునర్నిర్మించడం, ఫీడ్‌బ్యాక్ లూప్‌లను ఆడిట్ చేయడం మరియు ఒకే ఒక్క తప్పుతో మనుషులను ఒక వర్గంగా పరిగణించే సాధారణీకరణలను (generalizations) అస్సలు అనుమతించకూడదని అంగీకరించడం. AI అభ్యర్థులను నిష్పక్షపాతంగా అంచనా వేయాలని మనం కోరుకుంటే, న్యాయాన్ని (fairness) కేవలం ఒక సూచనగా కాకుండా, ఒక కఠినమైన నిబంధనగా (hard constraint) మార్చాలి. లేకపోతే, యంత్రాలు తమ ఆప్టిమైజేషన్ ప్రక్రియ ద్వారా నేరుగా పక్షపాతాల వైపుకే వెళ్తాయి.