AI तस्वीरें गिनती में गलती क्यों करती हैं, और काम करने वाली भीड़ कैसे माँगें
आपने ठीक तीन माँगे और पाँच मिले। इमेज मॉडल गिनती में कमज़ोर क्यों हैं, और मनचाही भीड़, कतार या सेट पाने के पाँच तरीके।

आपने लिखा «खिड़की की चौखट पर तीन मोमबत्तियाँ» और चार मिलीं। «ठीक तीन» आज़माया तो दो मिलीं, फिर पाँच। कुछ टूटा नहीं है। गिनना ऐसी चीज़ है जिसमें इमेज मॉडल बनावट से ही कमज़ोर होते हैं, और कारण समझ आ जाए तो आप उससे लड़ना छोड़कर उसके इर्द-गिर्द रास्ता निकाल सकते हैं।
गिनती भटकती क्यों है
इमेज मॉडल तस्वीर को चीज़ दर चीज़ नहीं बनाता और फिर कुल जोड़ नहीं जाँचता। वह पूरे कैनवास को एक साथ निखारता है और हर हिस्से को «इन शब्दों से मेल खाती तस्वीर आम तौर पर कैसी दिखती है» की ओर खींचता है। «तीन» शब्द दर्जनों दूसरे शब्दों के बीच एक कमज़ोर धक्का भर है, और प्रशिक्षण की तस्वीरों में «मोमबत्ती» शब्द के पास मोमबत्तियों की संख्या शायद ही कभी लिखी होती थी।
एक और दो जैसी छोटी गिनतियाँ सबसे आसान हैं क्योंकि वे आम पैटर्न हैं: एक विषय, एक जोड़ी। इससे आगे मॉडल गणित की जगह बनावट और लय पर टिकता है। खिड़कियों की कतार तब सही दिखती है जब दूरी सही दिखे, इसलिए नहीं कि वे सात हैं। इसीलिए «कुछ» उस संख्या से बेहतर चलता है जिसे वह निभा नहीं सकता।
कहाँ मायने रखता है और कहाँ नहीं
अपने दृश्य को दो तरह में बाँटिए। भीड़, जंगल या फलों की टोकरी में कोई गिनता नहीं, और दो का फ़र्क दिखता नहीं। प्रोडक्ट फ़ोटो, डायग्राम, आइकन सेट या बोर्ड गेम में देखने वाला तुरंत गिनता है और गलत संख्या भूल जैसी लगती है। मेहनत केवल दूसरी तरह पर लगाइए।
मनचाही गिनती पाने के पाँच तरीके
1. कम माँगिए, और समूह को नाम दीजिए
मॉडल अकेले अंक की तुलना में «एक जोड़ी» और «तिकड़ी» बेहतर सँभालते हैं, क्योंकि ये अकेली अवधारणाएँ हैं, गणित नहीं। «मोमबत्तियों की तिकड़ी: ऊँची, मझोली और छोटी» हर एक को अपनी पहचान देती है, और पहचान कुल संख्या से ज़्यादा आसानी से टिकती है।
2. हर चीज़ को उसकी जगह से बताइए
संख्या की जगह हर चीज़ को एक स्थान दीजिए। मॉडल बाएँ और दाएँ, आगे और पीछे में अच्छा है, और जब वाक्य चौखट का बायाँ, बीच और दायाँ हिस्सा भर चुका हो तो चौथी मोमबत्ती जोड़ना उसके लिए कठिन होता है।
शाम के धुँधलके में खिड़की की चौखट, सबसे बाएँ एक ऊँची सफ़ेद मोमबत्ती, बीच में एक छोटी एम्बर मोमबत्ती, दाईं ओर धुएँदार काँच में एक मझोली मोमबत्ती, पीछे की खिड़की नरम और धुँधली, गर्म रोशनी, 4:5 पोर्ट्रेट फ़्रेम3. छोटे टुकड़े बनाइए, फिर जोड़िए
जिस सेट का सटीक होना ज़रूरी है, जैसे पाँच आइकन या छह कार्ड, उसके हर हिस्से को अलग तस्वीर के रूप में बनाइए और अपने एडिटर में सजा लीजिए। इसमें कुछ रेंडर ज़्यादा लगते हैं, पर हर रेंडर एक विषय का काम है, जिसे सही कराना सबसे सस्ता है। ड्राफ़्ट Still Lite पर बनाइए, प्रति रेंडर €0.30 से, और केवल चुने हुए को Still पर पूरा कीजिए।
4. भीड़ को जानबूझकर धुँधला रखिए
पृष्ठभूमि के लोगों या चीज़ों के लिए संख्या नहीं, घनत्व बताइए: «बिखरी हुई भीड़», «यहाँ-वहाँ फैले», «कंधे से कंधा सटाए»। मॉडल घनत्व में अच्छे हैं क्योंकि वह एक बनावट है। संख्या जोड़ने से उन्हें बस साफ़ दिखने वाली गलती का मौका मिलता है।
5. दोबारा पासा फेंकने की जगह बाद में सुधारिए
अगर तस्वीर एक फ़ालतू चीज़ को छोड़कर सही है, तो फिर से पासा मत फेंकिए। उस रेंडर को रेफ़रेंस के रूप में जोड़िए और वही दृश्य «चौथी मोमबत्ती के बिना» माँगिए। मॉडल रंग-योजना और बनावट रखता है और उसे सिर्फ़ एक चीज़ बदलनी होती है, जो नए सिरे से बनवाने से कहीं बेहतर दाँव है।
स्टूडियो क्या नहीं कर सकता
स्टूडियो का कोई भी टूल सटीक गिनती का वादा नहीं कर सकता, और आज कोई दूसरा इमेज जनरेटर भी नहीं कर सकता। ऊँची क्वालिटी ब्योरे को तीखा करती है, गणित नहीं सिखाती। अगर पन्ने की कोई संख्या कड़ी शर्त है, तो सेट को अलग-अलग तस्वीरों से बनाइए, या अंतिम लेआउट खुद बनाइए और रेंडर को सिर्फ़ रूप-रंग के लिए इस्तेमाल कीजिए। यही बात पढ़ने लायक टेक्स्ट पर लागू होती है, जो मिलते-जुलते कारणों से बिगड़ता है; हाथ और टेक्स्ट गाइड इसे समझाती है।
एक झटपट दिनचर्या
- तय कीजिए कि कोई गिनेगा या नहीं। नहीं, तो चिंता छोड़िए।
- अगर गिनेगा, तो चीज़ों को जगह से बताइए और हर एक को अपना विशेषण दीजिए।
- सस्ते ड्राफ़्ट का एक छोटा बैच बनाइए और गलत गिनती वाले को एक नज़र में खारिज कीजिए।
- लगभग सही गलती को फिर से शुरू करने की जगह रेफ़रेंस से सुधारिए।
- सटीक सेट के लिए हिस्सों को अलग बनाइए और खुद जोड़िए।
इसे दोबारा रेंडर के टैक्स वाले लेख की आदतों के साथ जोड़िए तो ज़्यादातर बेकार रेंडर गायब हो जाते हैं, क्योंकि गिनती की गलतियाँ सबसे महँगे दोबारा रेंडरों में गिनी जाती हैं। Generate दबाने से पहले हर मॉडल की मौजूदा कीमत आप मॉडल पेज पर देख सकते हैं।
अक्सर पूछे जाने वाले प्रश्न
AI फ़ालतू उँगलियाँ या चीज़ें क्यों जोड़ देता है?
मॉडल पूरी तस्वीर को एक साथ निखारता है और स्थानीय पैटर्न मिलाता है, कुल योग नहीं। उँगलियाँ, खिड़कियाँ और मोमबत्तियाँ दोहराई जाती हैं, इसलिए वह तब तक दोहराता रहता है जब तक हिस्सा भरा न दिखे, और सटीक संख्या का हिसाब वह नहीं रखता।
क्या बेहतर मॉडल गिनती ठीक कर देता है?
यह एक से तीन तक की छोटी गिनती और नतीजे की सफ़ाई में मदद करता है। आज कोई मॉडल इससे आगे भरोसे से नहीं गिनता, इसलिए जगह बताने और खुद जोड़ने के तरीके अब भी लागू हैं।
दोबारा बनवाना सस्ता है या रेफ़रेंस से बदलना?
जब तस्वीर एक चीज़ को छोड़कर सही हो, तो रेफ़रेंस से बदलना आम तौर पर सस्ता पड़ता है, क्योंकि आप सारा अच्छा हिस्सा रखकर सिर्फ़ एक चीज़ बदलते हैं। दोबारा बनवाने में अच्छे हिस्से बुरे के साथ फेंक दिए जाते हैं।


