Grok Imagine Image 2.0: संपादन पर दांव, निर्माण पर नहीं
xAI
OpenAI
ByteDance
xAI ने Imagine Image 2.0 जारी किया है, जो एक-बार की पीढ़ी के बजाय पुनरावृत्त संपादन पर केंद्रित एक इमेज जनरेटर है। इसमें क्षेत्र संपादन, पृष्ठभूमि हटाना, बहु-संदर्भ समर्थन, और स्मार्ट रीसाइज़ जैसी सुविधाएं शामिल हैं, जिसके बेंचमार्क इसे इमेज संपादन और टेक्स्ट-टू-इमेज दोनों क्षेत्रों में दूसरे स्थान पर रखते हैं। यह मॉडल वर्तमान में Vercel AI Gateway API के माध्यम से प्रतिस्पर्धियों की तुलना में कम लागत पर उपलब्ध है।
xAI ने Imagine Image 2.0 का अनावरण किया है, इसे सिर्फ एक और सुंदर जनरेशन के बजाय वास्तविक पुनरावृत्तीय छवि कार्य के लिए एक उपकरण के रूप में स्थापित किया है। नया मॉडल सटीक संपादन पर जोर देता है, जिसमें स्थानीय संपादन के लिए मैजिक वैंड, ज़ोन चयन के लिए सेगमेंटेशन, पीएनजी निर्यात के साथ पृष्ठभूमि हटाना, और पांच छवियों तक का समर्थन करने वाले मल्टी-रेफरेंस संपादन जैसी सुविधाएं शामिल हैं। स्मार्ट रीसाइज नौ पहलू अनुपातों का समर्थन करता है, और फोटो संपादन, मार्केटिंग एसेट्स और गेम एसेट्स जैसे विशिष्ट कार्यों के लिए 15 वर्कफ़्लो टेम्पलेट हैं। मॉडल का उद्देश्य पात्रों और दृश्यों में स्थिरता बनाए रखना है, जो वीडियो उत्पादन वर्कफ़्लो को लक्षित करता है। बेंचमार्क में, यह इमेज एडिट एरेना में 1439 के एलो के साथ दूसरे स्थान पर है और टेक्स्ट-टू-इमेज एरेना में 1320 के साथ, जो जीपीटी-इमेज-2 से पीछे है। एक्सेस वर्तमान में वेरसेल एआई गेटवे एपीआई के माध्यम से $0.05 प्रति जनरेशन पर उपलब्ध है, जो सीड्रीम 5 प्रो, नैनो बनानो 2 और जीपीटी इमेज 2 से सस्ता है, हालांकि नैनो बनानो 2 से धीमा है लेकिन जीपीटी इमेज 2 से तेज़ है। लेखक ने नोट किया है कि जबकि चीनी मॉडल नैनो बनानो 2 से पीछे हैं, यह किफायती और उच्च गुणवत्ता वाला मॉडल कई लोगों के लिए एक आधार रेखा बनने की संभावना है, भले ही सभी एपीआई सुविधाएं वर्तमान में काम न करें। रूस में, मॉडल अभी उपलब्ध नहीं है, सिवाय वेरसेल एआई गेटवे पर पूर्वावलोकन के अनौपचारिक एक्सेस के, लेकिन रिलीज़ आसन्न है, इस सप्ताह वेगा सहित विभिन्न सेवाओं पर उपलब्धता के साथ।
स्रोत: Habr — хаб ИИ —
मूल
