ਮਹਾਰਾਸ਼ਟਰ ਵਿੱਚ ਠੱਗਾਂ ਨੇ AI-ਨਿਰਮਿਤ (AI-generated) ਆਵਾਜ਼ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਇੱਕ ਪੀੜਤ ਤੋਂ ₹11.8 ਲੱਖ ਚੋਰੀ ਕਰ ਲਏ, ਜਿਸ ਨੂੰ ਲੱਗਿਆ ਕਿ ਉਹ ਇੱਕ ਸੰਭਾਵਿਤ ਲੜਕੀ ਦੇ ਪਰਿਵਾਰ ਨਾਲ ਗੱਲ ਕਰ ਰਿਹਾ ਹੈ। ਇਹ ਧੋਖਾਧੜੀ ਇੱਕ 'ਜ਼ੀਰੋ-ਸ਼ੌਟ ਵੌਇਸ-ਕਲੋਨਿੰਗ ਮਾਡਲ' (zero-shot voice-cloning model) 'ਤੇ ਅਧਾਰਤ ਸੀ ਜਿਸ ਨੇ ਸਿਰਫ਼ ਕੁਝ ਸਕਿੰਟਾਂ ਦੀ ਆਡੀਓ ਤੋਂ ਪੀੜਤ ਦੇ ਲਹਿਜੇ ਦੀ ਨਕਲ ਕਰ ਲਈ, ਅਤੇ ਇੱਕ ਨਿੱਜੀ ਗੱਲਬਾਤ ਨੂੰ ਹਥਿਆਰ ਵਿੱਚ ਬਦਲ ਦਿੱਤਾ।

ਧੋਖਾਧੜੀ ਕਿਵੇਂ ਹੋਈ

ਅਪਰਾਧੀਆਂ ਨੇ ਪਹਿਲਾਂ ਜਨਤਕ ਸਰੋਤਾਂ—ਜਿਵੇਂ ਕਿ ਸੋਸ਼ਲ ਮੀਡੀਆ ਪੋਸਟਾਂ, ਵੌਇਸਮੇਲ ਦੇ ਟੁਕੜੇ, ਜਾਂ ਮੈਸੇਜਿੰਗ ਐਪਸ—ਤੋਂ ਨਿਸ਼ਾਨੇ 'ਤੇ ਰੱਖੇ ਗਏ ਵਿਅਕਤੀ ਦੀ 3-30 ਸਕਿੰਟ ਦੀ ਆਵਾਜ਼ ਇਕੱਠੀ ਕੀਤੀ। ਆਧੁਨਿਕ ਸਪੀਚ-ਸਿੰਥੇਸਿਸ (speech-synthesis) ਟੂਲ ਬਿਨਾਂ ਕਿਸੇ ਵਾਧੂ ਟ੍ਰੇਨਿੰਗ ਡੇਟਾ ਦੇ ਉਸ ਛੋਟੇ ਜਿਹੇ ਨਮੂਨੇ ਨੂੰ ਇੱਕ ਭਰੋਸੇਯੋਗ ਨਕਲ ਵਿੱਚ ਬਦਲ ਦਿੰਦੇ ਹਨ, ਜਿਸ ਨੂੰ 'ਜ਼ੀਰੋ-ਸ਼ੌਟ ਸਿੰਥੇਸਿਸ' (zero-shot synthesis) ਕਿਹਾ ਜਾਂਦਾ ਹੈ। ਇਸ ਬਣਾਵਟੀ ਆਵਾਜ਼ ਨਾਲ, ਠੱਗਾਂ ਨੇ ਵਿਆਹ ਦੀ ਗੱਲਬਾਤ ਵਿੱਚ ਸ਼ਾਮਲ ਹੋ ਕੇ ਪਰਿਵਾਰ ਦੇ ਮੈਂਬਰ ਦਾ ਰੂਪ ਧਾਰਿਆ ਅਤੇ "ਵਿਆਹ" ਨੂੰ ਪੱਕਾ ਕਰਨ ਲਈ ਪੈਸੇ ਟ੍ਰਾਂਸਫਰ ਕਰਨ ਲਈ ਕਿਹਾ। ਇਸ ਬੇਨਤੀ ਨੂੰ ਇੱਕ ਭਰੋਸੇਯੋਗ ਆਵਾਜ਼ ਸਮਝ ਕੇ, ਪੀੜਤ ਨੇ ਪੈਸੇ ਭੇਜ ਦਿੱਤੇ ਅਤੇ ਬਾਅਦ ਵਿੱਚ ਧੋਖੇ ਦਾ ਪਤਾ ਲੱਗਾ।

ਇਹ ਸੁਰੱਖਿਆ ਟੀਮਾਂ ਲਈ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

ਆਡੀਓ ਡੀਪਫੇਕਸ (Audio deepfakes) ਵੀਡੀਓ ਜਾਲਸਾਜ਼ੀ ਦੇ ਪਿੱਛੇ ਰਹੇ ਹਨ, ਪਰ ਹੁਣ ਇੱਕ ਭਰੋਸੇਯੋਗ ਵੌਇਸ ਕਲੋਨ ਬਣਾਉਣਾ ਸਸਤਾ ਅਤੇ ਤੇਜ਼ ਹੋ ਗਿਆ ਹੈ। ਤਿੰਨ ਤਕਨੀਕੀ ਕਾਰਕ ਇਸਦੀ ਪਛਾਣ ਕਰਨਾ ਮੁਸ਼ਕਲ ਬਣਾਉਂਦੇ ਹਨ:

  • ਫੋਨ-ਲਾਈਨ ਕੰਪਰੈਸ਼ਨ (Phone-line compression) ਉਨ੍ਹਾਂ ਬਾਰੀਕ ਆਵਾਜ਼ ਦੇ ਸੰਕੇਤਾਂ ਨੂੰ ਖਤਮ ਕਰ ਦਿੰਦਾ ਹੈ ਜਿਨ੍ਹਾਂ 'ਤੇ ਫੋਰੈਂਸਿਕ ਟੂਲ ਨਿਰਭਰ ਕਰਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਅਸਲੀ ਅਤੇ ਬਣਾਵਟੀ ਬੋਲਣ ਦੇ ਵਿਚਕਾਰ ਦਾ ਫਰਕ ਮਿਟ ਜਾਂਦਾ ਹੈ।
  • ਆਲੇ-ਦੁਆਲੇ ਦਾ ਸ਼ੋਰ (Ambient noise) ਅਸਲੀ ਦੁਨੀਆ ਦੀਆਂ ਕਾਲਾਂ ਵਿੱਚ ਉਨ੍ਹਾਂ ਨਿਸ਼ਾਨਾਂ ਨੂੰ ਛੁਪਾ ਦਿੰਦਾ ਹੈ ਜੋ ਕਿਸੇ ਵਿਸ਼ਲੇਸ਼ਕ ਨੂੰ ਸੱਚਾਈ ਦਾ ਅਹਿਸਾਸ ਕਰਵਾ ਸਕਦੇ ਸਨ।
  • ਰੀਅਲ-ਟਾਈਮ ਸਿੰਥੇਸਿਸ (Real-time synthesis) ਠੱਗਾਂ ਨੂੰ ਤੁਰੰਤ ਜਵਾਬ ਦੇਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਪੁਰਾਣੇ ਟੈਕਸਟ-ਟੂ-ਸਪੀਚ ਸਿਸਟਮਾਂ ਵਰਗੀ ਦੇਰੀ ਖਤਮ ਹੋ ਜਾਂਦੀ ਹੈ ਅਤੇ ਗੱਲਬਾਤ ਕੁਦਰਤੀ ਲੱਗਦੀ ਹੈ।

ਜੇਕਰ ਕੋਈ ਸੰਸਥਾ ਅਜੇ ਵੀ ਇਸ ਆਧਾਰ 'ਤੇ ਉਪਭੋਗਤਾਵਾਂ ਦੀ ਪਛਾਣ ਕਰਦੀ ਹੈ ਕਿ "ਤੁਹਾਡੀ ਆਵਾਜ਼ ਕਿਸ ਵਰਗੀ ਲੱਗਦੀ ਹੈ," ਤਾਂ ਉਹ ਬਿਲਕੁਲ ਇਸੇ ਤਰ੍ਹਾਂ ਦੇ ਹਮਲੇ ਦੇ ਖਤਰੇ ਵਿੱਚ ਹੈ।

ਕੀ ਖਤਰੇ ਵਿੱਚ ਹੈ

ਵਿਅਕਤੀਆਂ ਲਈ, ਨੁਕਸਾਨ ਤੁਰੰਤ ਅਤੇ ਨਿੱਜੀ ਹੈ—₹11.8 ਲੱਖ।

ਰੋਕਥਾਮ ਦੀ ਰਣਨੀਤੀ (Counter-measure playbook)

ਸੁਰੱਖਿਆ ਇੰਜੀਨੀਅਰ ਹਰ ਆਉਣ ਵਾਲੀ ਵੌਇਸ ਸਟ੍ਰੀਮ ਨੂੰ ਅਭਰੋਸੇਯੋਗ ਮੰਨ ਕੇ ਅਤੇ ਵੈਰੀਫਿਕੇਸ਼ਨ (ਪੁਸ਼ਟੀਕਰਨ) ਦੀਆਂ ਕਈ ਪਰਤਾਂ ਜੋੜ ਕੇ ਰੱਖਿਆ ਨੂੰ ਮਜ਼ਬੂਤ ਕਰ ਸਕਦੇ ਹਨ:

  • ਮਲਟੀਮੋਡਲ ਅਥੈਂਟੀਕੇਸ਼ਨ (Multimodal authentication) – ਆਵਾਜ਼ ਨੂੰ ਵਿਜ਼ੂਅਲ ਸੰਕੇਤਾਂ (ਚਿਹਰੇ ਦੀ ਪਛਾਣ) ਅਤੇ ਮੈਟਾਡਾਟਾ ਜਿਵੇਂ ਕਿ ਡਿਵਾਈਸ ਫਿੰਗਰਪ੍ਰਿੰਟਸ ਨਾਲ ਜੋੜੋ। ਸਿਰਫ਼ ਇੱਕ ਬਣਾਵਟੀ ਆਵਾਜ਼ ਪਛਾਣ ਦੀ ਜਾਂਚ ਲਈ ਕਾਫ਼ੀ ਨਹੀਂ ਹੋਣੀ ਚਾਹੀਦੀ।
  • ਸੈਕੰਡਰੀ-ਚੈਨਲ ਕਨਫਰਮੇਸ਼ਨ (Secondary-channel confirmation) – ਉੱਚ-ਮੁੱਲ ਵਾਲੇ ਕੰਮਾਂ ਨੂੰ ਮਨਜ਼ੂਰੀ ਦੇਣ ਤੋਂ ਪਹਿਲਾਂ ਪਹਿਲਾਂ ਤੋਂ ਪ੍ਰਵਾਨਿਤ ਐਪ, ਈਮੇਲ, ਜਾਂ ਸੁਰੱਖਿਅਤ ਮੈਸੇਜਿੰਗ ਪਲੇਟਫਾਰਮ ਰਾਹੀਂ ਦੁਬਾਰਾ ਪੁਸ਼ਟੀ ਦੀ ਮੰਗ ਕਰੋ।
  • ਐਲਗੋਰਿਦਮਿਕ ਪਛਾਣ ਸਬੂਤ (Algorithmic identity proof) – ਮਨੁੱਖੀ ਫੈਸਲੇ 'ਤੇ ਨਿਰਭਰ ਰਹਿਣ ਦੀ ਬਜਾਏ ਵੈਕਟਰ-ਅਧਾਰਤ ਫੇਸ਼ੀਅਲ ਐਮਬੈਡਿੰਗਜ਼ (vector-based facial embeddings) ਜਾਂ ਹੋਰ ਗਣਿਤਕ ਤੌਰ 'ਤੇ ਅਧਾਰਤ ਸਮਾਨਤਾ ਸਕੋਰ ਦੀ ਵਰਤੋਂ ਕਰੋ। ਆਟੋਮੇਟਿਡ ਡਿਸਟੈਂਸ ਮੈਟ੍ਰਿਕਸ ਅਜਿਹੇ ਮੇਲ-ਖਾਣ ਦੀ ਕਮੀ ਨੂੰ ਫੜ ਸਕਦੇ ਹਨ ਜੋ ਸ਼ਾਇਦ ਇੱਕ ਸੁਣਨ ਵਾਲਾ ਮਿਸ ਕਰ ਦੇਵੇ।

ਇਹ ਕਦਮ ਵੈਰੀਫਿਕੇਸ਼ਨ ਨੂੰ "ਆਵਾਜ਼ ਸਹੀ ਲੱਗਦੀ ਹੈ" ਤੋਂ ਹਟਾ ਕੇ ਵਸਤੂਨਿਸ਼ਠ, ਕ੍ਰਾਸ-ਚੈੱਕ ਕੀਤੇ ਸਬੂਤਾਂ ਵੱਲ ਲੈ ਜਾਂਦੇ ਹਨ।

ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ

ਸੰਸਥਾਵਾਂ ਨੂੰ ਕਿਸੇ ਵੀ ਅਜਿਹੇ ਵਰਕਫਲੋ ਦੀ ਜਾਂਚ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ ਜੋ ਆਵਾਜ਼ ਨੂੰ ਪਛਾਣ ਦੇ ਇਕਲੌਤੇ ਸਬੂਤ ਵਜੋਂ ਸਵੀਕਾਰ ਕਰਦਾ ਹੈ। ਅਜਿਹੇ ਟੇਬਲਟਾਪ ਅਭਿਆਸ (tabletop exercises) ਕਰੋ ਜੋ ਵੌਇਸ-ਕਲੋਨਿੰਗ ਹਮਲਿਆਂ ਦੀ ਨਕਲ ਕਰਦੇ ਹਨ, ਇਨਸੀਡੈਂਟ-ਰਿਸਪਾਂਸ ਪਲੇਅਬੁੱਕਾਂ ਨੂੰ ਅੱਪਡੇਟ ਕਰੋ, ਅਤੇ ਅਜਿਹੇ ਡਿਟੈਕਸ਼ਨ ਟੂਲਸ ਵਿੱਚ ਨਿਵੇਸ਼ ਕਰੋ ਜੋ ਕੰਪਰੈਸ਼ਨ ਆਰਟੀਫੈਕਟਸ ਜਾਂ ਅਕੂਸਟਿਕ ਸਿਗਨੇਚਰਾਂ ਵਿੱਚ ਅਸਧਾਰਨਤਾਵਾਂ ਨੂੰ ਫੜ ਸਕਦੇ ਹਨ—ਇਹ ਜਾਣਦੇ ਹੋਏ ਕਿ ਅਜਿਹੇ ਟੂਲ ਸਿਰਫ਼ ਇੱਕ ਅੰਸ਼ਕ ਢਾਲ ਪ੍ਰਦਾਨ ਕਰਦੇ ਹਨ।

ਨਿਚੋੜ

ਮਹਾਰਾਸ਼ਟਰ ਦਾ ਮਾਮਲਾ ਸਾਬਤ ਕਰਦਾ ਹੈ ਕਿ AI-ਡਰਾਈਵਨ ਵੌਇਸ ਕਲੋਨਿੰਗ ਹੁਣ ਸਿਰਫ਼ ਇੱਕ ਸਿਧਾਂਤ ਨਹੀਂ ਰਹੀ; ਇਹ ਮਿੰਟਾਂ ਵਿੱਚ ਬੇਖਬਰ ਲੋਕਾਂ ਤੋਂ ਅਸਲੀ ਪੈਸੇ ਖੋਹ ਸਕਦੀ ਹੈ। ਸੁਰੱਖਿਆ ਟੀਮਾਂ ਜੋ ਬਿਨਾਂ ਕਿਸੇ ਸਬੂਤ ਦੇ ਸਿਰਫ਼ ਆਵਾਜ਼ 'ਤੇ ਭਰੋਸਾ ਕਰਦੀਆਂ ਰਹਿੰਦੀਆਂ ਹਨ, ਉਹ ਵੱਡੇ ਪੱਧਰ 'ਤੇ ਇਸੇ ਤਰ੍ਹਾਂ ਦੇ ਨੁਕਸਾਨ ਦਾ ਖ਼ਤਰਾ ਮੁੱਲਦੀਆਂ ਹਨ। ਅੱਗੇ ਵਧਣ ਦਾ ਰਸਤਾ ਸਪੱਸ਼ਟ ਹੈ: ਕਈ ਸੁਤੰਤਰ ਵੈਰੀਫਿਕੇਸ਼ਨ ਕਾਰਕਾਂ ਨੂੰ ਸ਼ਾਮਲ ਕਰੋ ਅਤੇ ਜਦੋਂ ਤੱਕ ਸਾਬਤ ਨਾ ਹੋ ਜਾਵੇ, ਹਰ ਕਾਲ ਨੂੰ ਸੰਭਾਵਿਤ ਤੌਰ 'ਤੇ ਬਣਾਵਟੀ ਮੰਨੋ।