12 सवाल · सैंपल जवाब के साथ

डेटा साइंटिस्ट इंटरव्यू के सवाल और जवाब (हिंदी में)

डेटा साइंटिस्ट के इंटरव्यू में सिर्फ़ algorithms के नाम नहीं पूछे जाते, यह देखा जाता है कि आप बिज़नेस की समस्या को सही model और सही metric में कैसे बदलते हैं, और model के नतीजों को बिना बढ़ा-चढ़ाकर कैसे समझाते हैं। Statistics, machine learning, experiment design और production के सवालों के साथ गलत analysis या नाकाम model जैसे अनुभव भी पूछे जाते हैं। यहां 12 आम सवाल हैं, इंटरव्यूअर क्या परखता है और हिंदी में सैंपल जवाब। Technical शब्द अंग्रेज़ी में ही रखे गए हैं।

काम और तकनीकी जानकारी से जुड़े सवाल

Bias-variance trade-off को अपने बनाए किसी model के उदाहरण से समझाइए।

काम से जुड़ा

इंटरव्यूअर क्या परखता है: क्या आप underfitting और overfitting को training और validation के नतीजों से पहचानते हैं और उसके हिसाब से कदम उठाते हैं।

सैंपल जवाब

Bias वह गलती है जो model के बहुत सरल होने से आती है, यानी वह असली pattern पकड़ ही नहीं पाता और training व test दोनों पर ख़राब करता है। Variance वह गलती है जो model के training data पर बहुत ज़्यादा निर्भर होने से आती है, यानी training पर बहुत अच्छा और नए data पर ख़राब। एक demand forecasting model में मेरा deep decision tree training पर लगभग perfect था, पर validation पर काफ़ी पीछे। मैंने tree की depth सीमित की और ज़्यादा data जोड़ा, जिससे दोनों के बीच का फ़ासला कम हुआ।

Fraud detection model में सिर्फ़ आधा प्रतिशत transactions fraud हैं। इस imbalance को आप कैसे संभालेंगे?

काम से जुड़ा

इंटरव्यूअर क्या परखता है: क्या आप जानते हैं कि accuracy यहां बेकार है, सही metric चुनते हैं और resampling या class weights का इस्तेमाल सोच-समझकर करते हैं।

सैंपल जवाब

सबसे पहले मैं accuracy का इस्तेमाल नहीं करूंगा, क्योंकि हर transaction को सही बता देने से भी लगभग पूरी accuracy मिल जाएगी। मैं precision, recall और precision-recall curve के नीचे का क्षेत्र देखूंगा। Train और test split में class का अनुपात वही रखूंगा। Model में class weights दूंगा या सिर्फ़ training data में undersampling या oversampling करूंगा, test data को नहीं छेड़ूंगा। आख़िर में threshold बिज़नेस के साथ तय करूंगा, यह देखकर कि एक fraud छूटने की कीमत क्या है और एक सही ग्राहक को रोकने की क्या।

Loan default model के लिए आप precision पर ध्यान देंगे या recall पर?

काम से जुड़ा

इंटरव्यूअर क्या परखता है: क्या आप दोनों metrics का मतलब साफ़ जानते हैं और फ़ैसला हर गलती की बिज़नेस कीमत से जोड़ते हैं।

सैंपल जवाब

Precision बताता है कि जिन्हें model ने defaulter कहा, उनमें से कितने सच में default करते हैं। Recall बताता है कि असली defaulters में से कितनों को model पकड़ पाया। Loan में यह हर गलती की कीमत पर निर्भर है। एक defaulter को loan दे देना आम तौर पर बड़ा नुक़सान है, इसलिए recall अहम है। लेकिन बहुत सारे अच्छे ग्राहकों को मना करने से भी कारोबार घटता है। इसलिए मैं risk टीम के साथ दोनों गलतियों की लागत तय करके वह threshold चुनूंगा जिसमें कुल नुक़सान सबसे कम हो।

Data leakage क्या होता है? एक उदाहरण देकर बताइए कि आप इसे कैसे रोकते हैं।

काम से जुड़ा

इंटरव्यूअर क्या परखता है: क्या आप पहचानते हैं कि भविष्य की जानकारी training में घुसकर नतीजे झूठे अच्छे बना देती है, और pipeline में इसे रोकने के तरीके जानते हैं।

सैंपल जवाब

Leakage तब होता है जब model training में ऐसी जानकारी इस्तेमाल करता है जो prediction के समय मौजूद ही नहीं होगी, इसलिए validation score असलियत से बहुत बेहतर दिखता है। एक churn प्रोजेक्ट में एक feature था जो बताता था कि ग्राहक ने retention टीम से बात की या नहीं, और यह बातचीत अक्सर ग्राहक के जाने का फ़ैसला करने के बाद होती थी। रोकने के लिए मैं हर feature की तारीख़ prediction की तारीख़ से पहले रखता हूं, scaling जैसे कदम सिर्फ़ training data पर fit करता हूं और समय के हिसाब से split करता हूं।

Launch के समय आपका model अच्छा चल रहा था, पर छह महीनों में उसकी accuracy गिर गई। आप क्या करेंगे?

काम से जुड़ा

इंटरव्यूअर क्या परखता है: क्या आप पहले pipeline की गड़बड़ी और फिर data या concept drift को व्यवस्थित तरीके से जांचते हैं, और आगे के लिए monitoring रखते हैं।

सैंपल जवाब

पहले मैं pipeline की समस्याएं देखूंगा: कहीं upstream column तो नहीं बदला, कोई source टूटने से missing values तो नहीं आ रहीं, या किसी feature की गणना का तरीका तो नहीं बदला। फिर training के समय और अभी के input features और predictions के distribution की तुलना करूंगा, ताकि data drift पता चले। अगर inputs वही हैं पर रिश्ता बदल गया, जैसे नई policy से ग्राहकों का व्यवहार बदला, तो यह concept drift है। तब नए data पर retrain करूंगा और drift के लिए नियमित monitoring और alerts लगाऊंगा।

Time series data पर सामान्य k-fold cross-validation क्यों नहीं चलता, और उसकी जगह आप क्या इस्तेमाल करते हैं?

काम से जुड़ा

इंटरव्यूअर क्या परखता है: क्या आप समझते हैं कि random shuffle से भविष्य की जानकारी training में चली जाती है, और walk-forward validation सही तरीके से लगा सकते हैं।

सैंपल जवाब

सामान्य k-fold data को random तरीके से बांटता है, इसलिए model भविष्य के data पर train होकर अतीत पर test हो सकता है। Time series में trend और seasonality होती है, तो इससे जानकारी लीक होती है और score झूठा अच्छा आता है। मैं walk-forward या expanding window validation करता हूं: शुरुआती महीनों पर train करके अगले महीने पर test, फिर window आगे बढ़ाकर दोहराता हूं। Lag features बनाते समय भी ध्यान रखता हूं कि सिर्फ़ उस समय तक मौजूद data ही इस्तेमाल हो।

अनुभव और व्यवहार से जुड़े सवाल

आपका बनाया कोई model जिससे उम्मीद के मुताबिक बिज़नेस फ़ायदा नहीं हुआ, उसके बारे में बताइए।

Behavioural

इंटरव्यूअर क्या परखता है: क्या आप model के score और बिज़नेस नतीजे का फ़र्क समझते हैं और अपनी गलती से सीखकर अगला काम बदलते हैं।

सैंपल जवाब

एक e-commerce कंपनी में मैंने ऐसा model बनाया जो बताता था कि कौन से ग्राहक तीस दिन में दोबारा ख़रीदेंगे, और validation पर उसका AUC अच्छा था। Marketing ने इससे उन्हीं ग्राहकों को discount coupon भेजे जिनकी ख़रीदने की संभावना सबसे ज़्यादा थी। बाद में control group से तुलना की तो पता चला कि ये ग्राहक coupon के बिना भी ख़रीद रहे थे, यानी हम पैसा गंवा रहे थे। तब समझ आया कि सवाल गलत था। हमने uplift modelling पर काम किया, ताकि उन ग्राहकों को चुनें जिन पर coupon से फ़र्क पड़े।

ऐसा मौका बताइए जब किसी स्टेकहोल्डर ने data से कहीं ज़्यादा accuracy की उम्मीद रखी।

Behavioural

इंटरव्यूअर क्या परखता है: क्या आप उम्मीदों को ईमानदारी से और data के साथ संभालते हैं, बिना वादा किए जो पूरा न हो सके।

सैंपल जवाब

एक regional sales director चाहते थे कि हर store की weekly sales का forecast दो प्रतिशत के अंदर सही हो, ताकि वे targets तय कर सकें। कई stores का इतिहास बहुत छोटा था और sales पर स्थानीय त्योहारों और promotions का बड़ा असर था। मैंने उन्हें पिछले data पर अलग-अलग तरीकों की असली गलती दिखाई और बताया कि store स्तर पर इतना सटीक होना संभव नहीं। साथ में विकल्प दिया: region स्तर पर ज़्यादा सटीक forecast और store स्तर पर एक range। उन्होंने targets के लिए यही तरीका अपनाया।

Presentation देने के बाद आपको अपने analysis में कोई गंभीर गलती मिली हो, ऐसा मौका बताइए।

Behavioural

इंटरव्यूअर क्या परखता है: क्या आप गलती मिलने पर तुरंत और ख़ुद बताते हैं, उसका असर सुधारते हैं और आगे के लिए जांच का तरीका बदलते हैं।

सैंपल जवाब

Internship में मैंने app users को पांच segments में बांटकर presentation दी। दो दिन बाद काम आगे बढ़ाते हुए देखा कि मैंने QA टीम के test accounts नहीं हटाए थे, और उन्होंने मिलकर एक पूरा segment बना दिया था। मैंने उसी दिन अपने manager को बताया, test accounts हटाकर analysis दोबारा चलाया और सुधरे हुए नतीजे सबको भेजे, साथ में साफ़ लिखा कि क्या बदला। तब से मैं हर analysis से पहले data cleaning की एक checklist चलाता हूं, जिसमें test और internal accounts हटाना पहला कदम है।

HR round के सवाल

आप data analytics से डेटा साइंटिस्ट की भूमिका में क्यों जाना चाहते हैं?

HR round

इंटरव्यूअर क्या परखता है: क्या आपके पास इस बदलाव का ठोस कारण है और क्या आपने modelling की ज़रूरी skills पर पहले से काम किया है।

सैंपल जवाब

Analyst के तौर पर मैं dashboards और SQL से यह बताता था कि क्या हुआ। धीरे-धीरे मुझसे पूछा जाने लगा कि आगे क्या होगा और हमें क्या करना चाहिए, और ये सवाल मुझे ज़्यादा दिलचस्प लगे। मैंने Python और machine learning सीखी, और अपनी टीम के लिए एक छोटा churn model बनाया जिसे retention टीम ने इस्तेमाल किया। मेरी ताक़त यह है कि मैं बिज़नेस का data और उसकी कमियां अच्छी तरह जानता हूं। अब मैं ऐसी भूमिका चाहता हूं जहां modelling मेरा मुख्य काम हो।

हमारी data science टीम मुंबई में बिज़नेस टीमों के साथ काम करती है। क्या आप relocate करेंगे?

HR round

इंटरव्यूअर क्या परखता है: क्या आप relocation के लिए सच में तैयार हैं, और क्या आप समझते हैं कि बिज़नेस टीमों के पास रहना काम के लिए क्यों मायने रखता है।

सैंपल जवाब

जी हां, मैं मुंबई relocate करने के लिए तैयार हूं। मैं समझता हूं कि बिज़नेस टीमों के पास बैठने का क्या फ़ायदा है। मेरे सबसे अच्छे प्रोजेक्ट के विचार औपचारिक requirement documents से नहीं, बल्कि operations के लोगों से अनौपचारिक बातचीत में आए थे। परिवार से भी बात हो चुकी है। मेरा बस इतना अनुरोध है कि joining के शुरुआती हफ़्तों में रहने की व्यवस्था के लिए थोड़ा समय या मदद मिल जाए, ताकि मैं जल्दी काम पर ध्यान दे सकूं।

डेटा साइंटिस्ट के तौर पर आपकी सैलरी की उम्मीद क्या है, और notice period कितना है?

HR round

इंटरव्यूअर क्या परखता है: क्या आप अपनी उम्मीद को production में चल रहे काम और भूमिका की ज़िम्मेदारी से जोड़ते हैं और join करने की असली तारीख़ बताते हैं।

सैंपल जवाब

मेरे पास डेटा साइंटिस्ट के तौर पर कुछ साल का अनुभव है, जिसमें दो models production में चल रहे हैं। इस भूमिका में pricing models की पूरी ज़िम्मेदारी है, इसलिए मैं अपनी current CTC से उचित बढ़ोतरी की उम्मीद रखता हूं, जो इस शहर में ऐसी भूमिकाओं के आम दायरे में हो। Current CTC का ब्यौरा मैं salary slip के साथ दे सकता हूं। मेरा notice period दो महीने का है, और अगर मेरा handover जल्दी पूरा हो तो कंपनी से कुछ जल्दी छोड़ने का अनुरोध करूंगा।

पूरे सवाल अंग्रेज़ी में
अंग्रेज़ी पेज पर 20 सवाल, follow-up सवाल और fresher/experienced फ़िल्टर हैं।

Data Scientist interview questions (English) →

इंटरव्यू की तैयारी के लिए टिप्स

  • Precision, recall, ROC और precision-recall curve, regularisation और cross-validation को अपने बनाए किसी model के उदाहरण से समझाने का अभ्यास करें।
  • हर प्रोजेक्ट के लिए तैयार रहें: बिज़नेस समस्या क्या थी, metric क्यों चुना, baseline क्या था और model से असल में क्या बदला।
  • SQL और Python में data साफ़ करने और joins का live अभ्यास करें, कई कंपनियां take-home या live coding round रखती हैं।
  • जहां model असफल रहा या analysis में गलती मिली, ऐसे उदाहरण ईमानदारी से बताएं, इंटरव्यूअर देखना चाहते हैं कि आप सीखते कैसे हैं।

जवाब बोलकर, घड़ी देखकर अभ्यास करें; हर जवाब एक-डेढ़ मिनट में पूरा हो। इसके लिए हमारा Interview Practice टूल (अंग्रेज़ी में) टाइमर के साथ इस्तेमाल कर सकते हैं।

FAQ

अक्सर पूछे जाने वाले सवाल

आम तौर पर statistics और machine learning concepts, SQL या Python coding, एक case या take-home assignment और behavioural round होते हैं। Senior भूमिकाओं में model को production में ले जाने, monitoring और बिज़नेस टीमों के साथ काम करने पर भी सवाल होते हैं।

दो-तीन ऐसे प्रोजेक्ट रखें जिनमें असली या सार्वजनिक data हो, साफ़ समस्या हो और आपने data cleaning से लेकर evaluation तक सब ख़ुद किया हो। Code GitHub पर रखें और हर प्रोजेक्ट के साथ एक छोटा नोट लिखें कि आपने क्या सीखा और model कहां कमज़ोर है। सिर्फ़ tutorial दोहराने वाले प्रोजेक्ट कम असर डालते हैं।

यह भूमिका पर निर्भर करता है। ज़्यादातर बिज़नेस analytics और forecasting वाली भूमिकाओं में statistics, regression, tree-based models और experiment design ज़्यादा पूछे जाते हैं। Computer vision या NLP वाली भूमिकाओं में deep learning की समझ ज़रूरी होती है, इसलिए job description ध्यान से पढ़ें।

इंटरव्यूअर को अपने काम का लिंक दें

Resume, प्रोजेक्ट और सर्टिफ़िकेट एक पर्सनल वेबसाइट पर — करीब पाँच मिनट में लाइव, शुरुआत मुफ़्त।

● Live in 5 minutes · free to start · no auto-renew

Chat on WhatsApp