एक डेवलपर ने एक मुफ्त, खोजने योग्य (searchable) इंडेक्स जारी किया है जो दुनिया के हर समुद्री बंदरगाह (seaport) और हवाई अड्डे (airport) की सूची देता है—3,804 बंदरगाह और 9,640 हवाई अड्डे—जिसके लिए किसी साइन-अप या भुगतान की आवश्यकता नहीं है। यह साइट, theportindex.online, उपयोगकर्ताओं को डेटा ब्राउज़ करने या पूरे डेटासेट को CSV या JSON फॉर्मेट में डाउनलोड करने की सुविधा देती है।
इस इंडेक्स की आवश्यकता क्यों थी
निर्माता दुनिया के समुद्री बंदरगाहों की एक साफ और अपडेटेड सूची खोजने के लिए निकले थे, लेकिन उन्हें एक बड़ी समस्या का सामना करना पड़ा: अधिकांश व्यावसायिक विकल्प पेवॉल (paywalls) के पीछे होते हैं, और सार्वजनिक रूप से उपलब्ध सूचियाँ अक्सर वर्षों पुरानी होती हैं। अधूरे या पुराने डेटा पर निर्भर रहने के कारण विश्लेषकों को स्प्रेडशीट को साफ करने में घंटों बर्बाद करने पड़ते हैं, जो पूरे उद्योग में एक बड़ा खर्च बन जाता है। तीन सार्वजनिक स्रोतों—एक अमेरिकी सरकारी पोर्ट इंडेक्स, एक अंतरराष्ट्रीय लोकेशन कोड डायरेक्टरी, और एक क्राउडसोर्स्ड एयरपोर्ट डेटाबेस—को एक साथ लाकर, डेवलपर ने एक एकल, एकीकृत संदर्भ (unified reference) तैयार किया है जिसका उपयोग कोई भी तुरंत कर सकता है।
पर्दे के पीछे के डेटा स्रोत
- NGA World Port Index – एक अमेरिकी सरकारी संकलन जो प्रत्येक मान्यता प्राप्त समुद्री बंदरगाह के लिए बुनियादी विवरण प्रदान करता है।
- UN/LOCODE – संयुक्त राष्ट्र की लोकेशन कोड प्रणाली, जो बंदरगाहों और हवाई अड्डों के लिए मानकीकृत पहचानकर्ता (standardized identifiers) जोड़ती है।
- OurAirports – हवाई अड्डे की जानकारी का एक समुदाय-आधारित संग्रह, जिसमें रनवे की लंबाई और निर्देशांक (coordinates) शामिल हैं।
प्रत्येक स्रोत तस्वीर का एक अलग हिस्सा पेश करता है, लेकिन इनमें से कोई भी अकेले उपयोग के लिए तैयार, खोजने योग्य कैटलॉग प्रदान नहीं करता है। उन्हें मर्ज करने के लिए केवल कॉपी-पेस्ट से कहीं अधिक काम करना पड़ा; डेवलपर को विसंगतियों (inconsistencies), डुप्लिकेट प्रविष्टियों और गायब फ़ील्ड्स को हल करना पड़ा।
डेटा की सफाई: तीन कठिन सबक
- एम्बेडेड न्यूलाइन्स (Embedded newlines) साधारण पार्सर्स को तोड़ देते हैं – जिन CSV फ़ाइलों में कोटेड फ़ील्ड्स के अंदर लाइन ब्रेक होते हैं, उन्हें बुनियादी “split on newline” कमांड के साथ अलग नहीं किया जा सकता है। पंक्तियों (rows) को सुरक्षित रखने के लिए एक उचित CSV पार्सर आवश्यक है।
- आउटलायर वैल्यूज़ (Outlier values) गलतियों को छिपा देती हैं – कुछ तेल टर्मिनलों ने 900 मीटर की गहराई सूचीबद्ध की थी, जो कि बंदरगाहों के बजाय मूरिंग बॉयज़ (mooring buoys) के लिए उपयुक्त आंकड़ा है। गहराई-आधारित रैंकिंग को विश्वसनीय बनाए रखने के लिए अवास्तविक नंबरों को फ़िल्टर करना आवश्यक था।
- शून्य (Zeros) अक्सर प्लेसहोल्डर होते हैं – शून्य के रूप में दर्ज की गई गहराई का आमतौर पर मतलब यह होता है कि माप अज्ञात है, न कि पानी समतल है। शून्य को 'मिसिंग डेटा' के रूप में मानने से गहराई पर निर्भर किसी भी विश्लेषण की अखंडता बनी रहती है।
कच्चे आंकड़ों से परे मूल्य जोड़ना
यह इंडेक्स केवल निर्देशांकों (coordinates) को सूचीबद्ध करने से कहीं अधिक काम करता है। बंदरगाहों के लिए, यह गहराई को उन जहाजों की श्रेणियों में बदल देता है जो सुरक्षित रूप से डॉक कर सकते हैं, जिससे एक एकल मीट्रिक एक व्यावहारिक निर्णय सहायता में बदल जाता है। हवाई अड्डों के लिए, रनवे की लंबाई को उन विमानों के प्रकारों के साथ मैप किया गया है जो वहां संचालित हो सकते हैं, जिससे पायलटों और योजनाकारों को क्षमता का तुरंत आकलन करने में मदद मिलती है।
एक स्थानिक ग्रिड (spatial grid) प्रत्येक बंदरगाह को उसके निकटतम हवाई अड्डों से जोड़ता है और इसके विपरीत भी, जिससे यह साइट एक अन्वेषण उपकरण (exploration tool) बन जाती है। उपयोगकर्ता, उदाहरण के लिए, यह पता लगा सकते हैं कि कौन से हवाई अड्डे किसी दिए गए बंदरगाह के पास कम दूरी की ड्राइव के भीतर स्थित हैं—यह विशेषता मल्टीमॉडल फ्रेट प्लानिंग के लिए उपयोगी है।
बड़े पैमाने पर एक स्टैटिक-साइट इंजन बनाना
पूरा फ्रंट एंड स्टैटिक जनरेशन के साथ Next.js पर चलता है। बिल्ड प्रक्रिया के दौरान, लगभग 14,000 पेज—प्रत्येक बंदरगाह और हवाई अड्डे के लिए एक—प्री-रेंडर किए जाते हैं। चूंकि इसमें कोई डेटाबेस या सर्वर-साइड लॉजिक नहीं है, इसलिए साइट पर कोई निरंतर कंप्यूट लागत नहीं आती है; यह एक कंटेंट-डिलीवरी नेटवर्क (CDN) पर रहती है जो दुनिया भर में तुरंत पेज सर्व करता है।
SEO की कमियां और 'थिन-कंटेंट' का समाधान
हजारों टेम्पलेटेड पेज अपलोड करने से सर्च इंजन में समस्याएँ आ सकती हैं, जो साइट को "थिन कंटेंट" (thin content) मान सकते हैं और रैंकिंग में दंडित कर सकते हैं। डेवलपर को इस समस्या का सामना तब करना पड़ा जब एक AdSense आवेदन खारिज कर दिया गया। इसका समाधान यह था कि आगंतुकों के लिए पेजों का पूरा सेट लाइव रखा जाए, लेकिन प्रत्येक श्रेणी के शीर्ष 400 उच्च-गुणवत्ता वाले पेजों को छोड़कर बाकी सभी में noindex निर्देश जोड़ दिया जाए। यह क्रॉलर्स को बताता है कि केवल सबसे मूल्यवान पेज ही सर्च परिणामों में दिखने चाहिए, जिससे पूरा डेटासेट उपलब्ध कराते हुए विश्वसनीयता बनी रहती है।
किसे लाभ होता है, और इसकी सीमाएं क्या हैं
- लॉजिस्टिक्स कंपनियां कई PDF को खोजने के बजाय जल्दी से सत्यापित कर सकती हैं कि क्या कोई कार्गो जहाज बंदरगाह की गहराई की सीमाओं के अनुकूल है।
- एयरलाइन योजनाकार रनवे-टू-एयरक्राफ्ट मैपिंग तक त्वरित पहुंच प्राप्त करते हैं, जो रूट व्यवहार्यता अध्ययन (route feasibility studies) के लिए उपयोगी है।
- डेवलपर्स और शोधकर्ता को एक साफ, मशीन-पठनीय डेटा मिलता है जिसे कस्टम टूल्स में इम्पोर्ट किया जा सकता है।
प्रोजेक्ट के लिए आगे क्या है
निर्माता अतिरिक्त सुविधाओं पर फीडबैक के लिए समुदाय से अनुरोध कर रहा है।
निष्कर्ष
डेटा-क्लीनिंग की समस्याओं को सुलझाकर, इन्फरेंस लेयर्स जोड़कर और स्टैटिक जनरेशन के माध्यम से सर्वर लागत से बचकर, डेवलपर यह दर्शाता है कि एक लीन आर्किटेक्चर भी वैश्विक स्तर पर उपयोगी टूल प्रदान कर सकता है—बशर्ते आप समय-समय पर होने वाले अपडेट्स को स्वीकार करने और सर्च-इंजन गाइडलाइन्स पर नज़र रखने के लिए तैयार हों।
