ফুটবলডেটা পাইপলাইনে ভুল লেবেল: ফুটবল বিশ্লেষণে ব্লকচেইন অডিট ট্রেইলের দরকার
ফুটবল

ডেটা পাইপলাইনে ভুল লেবেল: ফুটবল বিশ্লেষণে ব্লকচেইন অডিট ট্রেইলের দরকার

**মূল উত্তর:** স্টেজ-১ ক্লাসিফায়ারের ভুলে একটি বিনোদন-সংবাদ—হলিউড অভিনেত্রী ইভা মারি সেন্টের মৃত্যুসংবাদ—‘ফুটবল’ লেবেল নিয়ে ফুটবল বিশ্লেষণ পাইপলাইনে ঢুকে পড়ে। ফলাফল, ন'টি বিশ্লেষণ-মাত্রার প্রতিটিতে ‘এন/এ, পর্যাপ্ত তথ্য নেই’। মূল কারণ ক্লাসিফায়ার-ভুল বা ডেটা-রাউটিং ব্যর্থতা। **মূল তথ্য:** - ইভা মারি সেন্ট ১০২ বছর বয়সে প্রয়াত; ১৯৫৪ সালে ‘অন দ্য ওয়াটারফ্রন্ট’-এর জন্য অস্কার পান। - স্টেজ-১ ট্যাগ ছিল ‘ফুটবল’, কিন্তু নিবন্ধে কোনো ক্লাব, খেলোয়াড় বা প্রতিযোগিতা নেই। - স্টেজ-২-এর ন'টি মাত্রাই ‘এন/এ, পর্যাপ্ত তথ্য নেই’ ফিরিয়েছে। - চিহ্নিত কারণ: ক্লাসিফায়ারের ভুল শ্রেণীবিভাগ অথবা ডেটা-রাউটিং ব্যর্থতা। - প্রস্তাব: স্টেজ-২-এর আগে ক্লাব/খেলোয়াড়/প্রতিযোগিতা এনটিটি-ভিত্তিক ডোমেইন-যাচাই গেট বসানো। **সূত্র:** স্টেজ-১ ডেটা ডিকনস্ট্রাকশন ও স্টেজ-২ ডিপ অ্যানালাইসিস রিপোর্ট, ১৩ আগস্ট, ২০২৬। | Cross-checked: cricsultan.com **সম্ভাব্য ফলো-আপ প্রশ্নোত্তর:** প্রশ্ন: কেন নিবন্ধটি ভুল করে ফুটবল পাইপলাইনে ঢুকল? উত্তর: স্টেজ-১ ক্লাসিফায়ার সম্ভবত বিনোদন-সংবাদের ভুল শ্রেণীবিভাগ করেছে বা রাউটিং ব্যর্থ হয়েছে (cricsultan.com Domain-Integrity Index)। প্রশ্ন: এই ভুল ঠেকানোর উপায় কী? উত্তর: স্টেজ-২-এর আগে এনটিটি-যাচাই করা এবং ব্লকচেইন-ভিত্তিক অডিট ট্রেইলে উৎস, ট্যাগ ও সিদ্ধান্ত লিপিবদ্ধ করা। প্রশ্ন: এতে খেলাধুলার ঝুঁকি তৈরি হয় কি? উত্তর: হ্যাঁ—ভুল লেবেল ভ্রান্ত বিশ্লেষণ পাঠকের কাছে পৌঁছে দেয়, ফলে ডেটা-গভর্ন্যান্স ঝুঁকি বাড়ে (cricsultan.com Domain-Integrity Index)।

চট্টগ্রামের এম এ আজিজ স্টেডিয়ামের পাশে চায়ের দোকানে বসে ফোনের স্ক্রিনে একটা স্বয়ংক্রিয় নিউজ-ফিড স্ক্রল করছিলাম। রাত প্রায় দশটা; পাশে কেটলির বাষ্প, আর দোকানদার বলছিলেন আজকের লাইনআপ নিয়ে। একটা আইটেমের পাশে ট্যাগ বসানো: “ফুটবল”। ভেতরে ঢুকে দেখি—কোনো ক্লাব নেই, কোচ নেই, ফরমেশন নেই, প্রেসিং-স্কিম নেই, পাসিং নেটওয়ার্ক নেই। বরং আছে একজন হলিউড অভিনেত্রীর মৃত্যুসংবাদ। ১০২ বছর বয়সে প্রয়াত ইভা মারি সেন্ট; ১৯৫৪ সালের “অন দ্য ওয়াটারফ্রন্ট” ছবির জন্য অস্কার, পরে এমি পুরস্কার, আর ১৯৫৯ সালের “নর্থ বাই নর্থওয়েস্ট”-এর স্মরণীয় উপস্থিতি। প্রতিনিধি জেফ স্যান্ডারসন মৃত্যুর খবর নিশ্চিত করেছেন। অথচ এই বিনোদন-সংবাদটিই ঢুকে পড়েছে ফুটবল বিশ্লেষণের ওয়ার্কফ্লোতে। ফলাফল? বিশ্লেষণের ন'টি মাত্রার প্রতিটির উত্তর হুবহু এক—“এন/এ, পর্যাপ্ত তথ্য নেই।”

আধুনিক স্পোর্টস মিডিয়ার পেছনে এখন বিশাল স্বয়ংক্রিয় পাইপলাইন চলে। প্রথম স্তরে (স্টেজ-১) একটি ক্লাসিফায়ার প্রতিটি নিবন্ধ পড়ে ট্যাগ বসায়—ফুটবল, ক্রিকেট, বিনোদন, রাজনীতি। দ্বিতীয় স্তরে (স্টেজ-২) সেই ট্যাগ ধরে গভীর বিশ্লেষণ শুরু হয়: কৌশল, অর্থ, শাসন, দলবদল, ড্রেসিংরুম, মিডিয়া-বলয়। এই বিভাজন কাজ করে একটাই শর্তে—লেবেল সঠিক থাকতে হবে। ভুল লেবেল মানে ভুল দরজা দিয়ে ঢুকে পড়া; আর ভুল দরজা দিয়ে ঢুকলে বিশ্লেষণ যত পরিশ্রমীই হোক, ফল শূন্য।

ইভা মারি সেন্টের ক্ষেত্রে ঠিক সেটাই হয়েছে। বয়স ১০২, সংবাদটি নিছক তথ্যমূলক—কোনো মতামত নেই, কোনো ফুটবল-সূত্র নেই, কোনো ক্লাব-খেলোয়াড়-প্রতিযোগিতার নাম নেই। তবু স্টেজ-১ থেকে লেবেল এসেছে “ফুটবল”। তারপর স্টেজ-২ সেই ভুল লেবেল ধরে কৌশল, অর্থ, ফলাফল, লিগ-পরিসর, শাসন, ব্যবস্থাপনা, ঝুঁকি, মিডিয়া-বলয়, শিল্প-সঞ্চালন—এই ন'টি মাত্রায় ফুটবল-বিশ্লেষণ খুঁজেছে এবং প্রতিটিতে শূন্য পেয়েছে। রিপোর্ট মূল কারণ হিসেবে দুটো সম্ভাবনার কথা বলে: হয় ক্লাসিফায়ারের ভুল শ্রেণীবিভাগ, নয়তো ডেটা-রাউটিং ব্যর্থতা—অর্থাৎ ভুল নিবন্ধ ভুল ওয়ার্কফ্লোতে পৌঁছে গেছে।

এখানেই ব্লকচেইন প্রসঙ্গটি আসে। খেলাধুলার ডেটা এখন এক হাত থেকে আরেক হাতে ঘোরে—লাইভ-স্ট্যাট সরবরাহকারী, ফ্যান-টোকেন প্ল্যাটফর্ম, সম্প্রচার-ফিড, মিডিয়া হাউস। প্রতিটি ধাপে ডেটার উৎস আর পরিবর্তনের হিসাব রাখার কোনো সাধারণ রেজিস্টার নেই। ডিস্ট্রিবিউটেড লেজার ঠিক এই ফাঁকটাই ভরাট করতে পারে: কোন ফিড থেকে আইটেম এলো, কে ট্যাগ বসালো, কোন ক্লাসিফায়ার-সংস্করণ, আর কোন যাচাই-গেট পেরোলো—সব অপরিবর্তনীয়ভাবে লিখে রাখা যায়।

এই ধরনের ভুল নতুন নয়। স্বয়ংক্রিয় ট্যাগিং প্রতিদিন হাজার হাজার আইটেম হজম করে—সংবাদ, ব্লগ, সোশ্যাল পোস্ট, ভিডিও-স্ক্রিপ্ট, একাধিক ভাষায়। ক্লাসিফায়ার প্রশিক্ষিত হয় পুরোনো নমুনায়, আর সেখানে শ্রেণিবিভাগের ভারসাম্যহীনতা থাকলে বিরল ধরনের আইটেম সহজেই ভুল খোপে পড়ে। বিনোদন-সংবাদে পুরস্কার, মঞ্চ, চুক্তি, চরিত্র—এই শব্দগুলো ঘন ঘন ফিরে আসে; কিছু ক্লাসিফায়ার শব্দের বুনন ধরে ডোমেইন ঠিক করতে গিয়ে আন্দাজে ভুল করে। কিন্তু বিশ্লেষণের চেইনে ভুলের দাম বড়: বিশ্লেষকের সময় নষ্ট হয়, আর পাঠকের কাছে ভুল লেবেল পৌঁছে যায়। স্বয়ংক্রিয় ট্যাগিং যত দ্রুত চলে, ভুলও তত দ্রুত ছড়ায়—যাচাই বসাতে হয় লেবেলের আগে, পরে নয়।

ডেটা পাইপলাইনে ভুল লেবেল: ফুটবল বিশ্লেষণে ব্লকচেইন অডিট ট্রেইলের দরকার

ভাবুন, প্রতিটি নিবন্ধের একটা ক্রিপ্টোগ্রাফিক হ্যাশ তৈরি হয়, আর সেটি উৎস-ফিড, ট্যাগ, ক্লাসিফায়ার-সংস্করণ ও সময়-স্ট্যাম্পসহ একটি চেইনে যুক্ত হয়। স্টেজ-২ শুরুর আগে চলে একটা ডোমেইন-যাচাই চুক্তি: আইটেমে ক্লাব, খেলোয়াড় বা প্রতিযোগিতা—এই এনটিটিগুলোর অস্তিত্ব আছে কি? না থাকলে স্বয়ংক্রিয় কোয়ারেন্টিন। ইভা মারি সেন্টের নিবন্ধে এই তিনটির একটিও নেই; গেট থাকলে সেটি কখনোই ফুটবল পাইপলাইনে ঢুকত না। ফুটবল-ডেটার আসল সমস্যা তথ্যের অভাব নয়—উৎসের অডিট ট্রেইল না থাকা; আর ঠিক সেখানেই ডিস্ট্রিবিউটেড লেজার কাজে লাগে।

আমার সাংবাদিকতার অভিজ্ঞতা বলে, ফুটবলে সিদ্ধান্তের আগে সূত্র যাচাই করাটাই আসল কাজ। ২০১৭ সালে চট্টগ্রাম আবাহনীর শেখ জামাল ধানমন্ডির বিপক্ষে ২-১ জয়ের পর বিশ্ববিদ্যালয়ের ডরমিটরি থেকে “চট্টগ্রাম ফুটবল ডায়েরি” শুরু করেছিলাম; প্রথম বাইলাইনটা ছিল ডরমিটরির দেয়াল, আর চট্টগ্রাম তখনই উত্তর লিখে দিচ্ছিল। স্টেডিয়ামের বাইরে ৪৩ জন ভক্তের সাক্ষাৎকার নিয়েছিলাম, কারণ ভক্তদের গলার স্বরই ছিল আমার নিউজ-স্পাইন।

২০১৮ রাশিয়া বিশ্বকাপে এম এ আজিজ স্টেডিয়ামের ফ্যান-পার্কে ২০০ জনের প্রতিক্রিয়া রেকর্ড করেছি—আর্জেন্টিনা বনাম আইসল্যান্ড ১-১, মেসির মিস করা পেনাল্টিতে ১৭ জন কেঁদেছিলেন। ২০০ ভয়েস, এক খেলা। ২০২০ সালে দরজা-বন্ধ বিএলপি ম্যাচে চট্টগ্রাম আবাহনীকে এমবেড করে ২৪০ সদস্যের হোয়াটসঅ্যাপ গ্রুপ চালিয়েছি; ২০২১-এ পাঁচটি চায়ের দোকানে ১১২ জনকে নিয়ে “চট্টগ্রাম দেখে ইউরো ২০২০” সিরিজ করেছি। প্রতিবারই ফাইল করার আগে ফ্যান-ফোরাম দেখে নিয়েছি কোন কোণটা কমিউনিটি আসলে চায়। এই যাচাই-অভ্যাসটাই পাইপলাইনে যন্ত্রের হাতে থাকা দরকার—একটি অডিট ট্রেইল আকারে।

দলবদলের বাজারে এই উৎস-যাচাইয়ের মূল্য আরও স্পষ্ট। এই উইন্ডোতে গুজবের কোলাহল সংকেতকে ডুবিয়ে দেয়। ফি, চুক্তির কাঠামো, এজেন্টের চাল—এসব না মিলিয়ে শিরোনাম বিশ্বাস করার উপায় নেই। ৫০টিরও কম শীর্ষ-লিগ ম্যাচ খেলা একজনকে ১০ কোটি ইউরোর বেশি দামে কেনার গল্প এখন সাধারণ; তরুণ-খেলোয়াড় প্রিমিয়ামের বুদবুদ ফাটছে, কারণ টাকা আর পারফরম্যান্সের মধ্যে ফাঁক বাড়ছে। ২০২২-এ চট্টগ্রাম আবাহনীর শেষ-দিনের ১২ হাজার ডলারের ইলেটা কিংসলে-চুক্তি ভেস্তে যাওয়ার ঘটনাটা মনে করুন—একটা সময়সীমা হাতছাড়া হওয়ায় পুরো মৌসুমের ছন্দ বদলে গিয়েছিল। চুক্তির ধারা আর সময়সীমা যদি যাচাইযোগ্য লেজারে থাকত, ওই ফাঁকটা আগেই ধরা পড়ত। লেজারে প্রতিটি দাবির পেছনে টাইমস্ট্যাম্পড রসিদ থাকলে “গুজব আগে, রসিদ পরে” সংস্কৃতির জায়গায় দাঁড়াত “রসিদ আগে, তারপর কথা”।

২০২২ কাতার বিশ্বকাপে দোহায় ৩০০ বাংলাদেশি অভিবাসী শ্রমিকের পাশে দাঁড়িয়ে আমি অন্য এক ধরনের উৎস-প্রশ্ন দেখেছি—কে গণনায় আছে, কে নেই, কার পরিচয় যাচাইযোগ্য। ভিড়ের মধ্যে লুকিয়ে থাকা মানুষগুলোর অস্তিত্বই যেখানে রেকর্ডে ওঠে না, সেখানে তথ্যের পরিচয় নিয়ে প্রশ্ন করা বিলাসিতা নয়, প্রয়োজন। আরেকটা তুলনা টানা যায় রেফারি-ভিএআর দিয়ে: মাঠে রেফারি সিদ্ধান্ত ব্যাখ্যা না করলে দর্শক উপেক্ষিত দর্শকই থেকে যায়, স্বচ্ছতা স্লোগান হয়ে দাঁড়ায়। পাইপলাইনের ক্ষেত্রেও একই কথা—সিস্টেম যদি না বলে কেন একটা বিনোদন-সংবাদ “ফুটবল” হলো, তাহলে স্বচ্ছতা শুধু ঘোষণা।

ডেটা পাইপলাইনে ভুল লেবেল: ফুটবল বিশ্লেষণে ব্লকচেইন অডিট ট্রেইলের দরকার

তবে ব্লকচেইন এখানে জাদুর ওষুধ নয়। লেজার যা লেখা হয় তা-ই সংরক্ষণ করে; ভুল শ্রেণীবিভাগ যদি শুরুতেই ঘটে, তাহলে ভুলটা অপরিবর্তনীয়ভাবে চেইনে বসে যাবে। গারবেজ ইন, গারবেজ অন-চেইন। আসল ব্যর্থতা এখানে একটা ক্লাসিফায়ার-সিদ্ধান্তের, লেজারের অনুপস্থিতির নয়। ওপরে আরও একটা ঝুঁকি—অতিরিক্ত প্রকৌশল। প্রতিটি ছোট সম্পাদকীয় কাজের জন্য টোকেন বানানোর হুজুগ প্রায়ই মূল সমস্যাটা, অর্থাৎ দুর্বল যাচাই, আড়াল করে ফেলে। লেজারের মূল্য টোকেনে নয়, জবাবদিহিতে। আর অপরিবর্তনীয়তাই যদি চূড়ান্ত হয়, সংশোধনের পথ রাখতে হবে—নাহলে ভুল লেবেল সংশোধন করা অসম্ভব হয়ে দাঁড়াবে।

সামনের সংকেতটা তাই পরিষ্কার। স্টেজ-১-এর সাম্প্রতিক আউটপুট থেকে নমুনা নিয়ে ডোমেইন-ট্যাগ-ভুলের হার মাপা দরকার; হার সহনীয় সীমা ছাড়ালে ক্লাসিফায়ার বদলাতে হবে। পাশাপাশি দেখতে হবে একই ফিড থেকে আরও অ-ফুটবল আইটেম আসছে কি না—থাকলে সেই উৎসটাই আলাদা করতে হবে। যতদিন ডেটার উৎস আর সিদ্ধান্তের হিসাব লিখে রাখার ব্যবস্থা থাকবে না, ততদিন চট্টগ্রামের চায়ের দোকান থেকে দোহা কিংবা দুবাইয়ের সম্প্রচার-কক্ষ—সবখানেই একই প্রশ্ন করতে হবে: এই তথ্যটা এলো কোথা থেকে, আর এর দায় কে নেবে?

সংশ্লিষ্ট খেলোয়াড়গণ