अब 27 अरब पैरामीटर का एक मॉडल एक iPhone पर चल रहा है
27 अरब पैरामीटर का एक मॉडल, इसके पूर्ण संस्करण में, लगभग 54 जीबी का है। इसे एक फोन पर लोड करना असंभव है, यहां तक कि एक सही मैक पर भी मुश्किल है। PrismML ने Bonsai 27B जारी किया है, जो उसी मॉडल का एक संकुचित संस्करण है जो 3.9 जीबी में समाहित है और सीधे एक iPhone पर चलता है। यह कोई प्रयोगशाला में तैयार की गई डेमो नहीं है: यह एक मॉडल है जिसे आज ही मुफ्त में डाउनलोड किया जा सकता है, एक लाइसेंस के तहत जो व्यावसायिक उपयोग की भी अनुमति देता है (Apache 2.0)।
PrismML Qwen3.6 27B से शुरू होता है, जो चीनी Alibaba का एक मॉडल है, और इसे दो हल्के संस्करणों में संकुचित करता है। तृतीयक संस्करण (मॉडल का प्रत्येक वजन, जो यह "जानता है" उसे परिभाषित करने वाले संख्याओं में से एक, अब केवल -1, 0 या +1 के बजाय एक संख्या है) का वजन 5.9 जीबी है और यह लैपटॉप के लिए लक्षित है। 1-बिट संस्करण, जो और भी अधिक कट्टर है (वजन अब केवल -1 या +1 होते हैं), का वजन 3.9 जीबी है और यह फोन के लिए लक्षित है। यह कागज पर ऐसा दिखता है।
तकनीक: फिर से प्रशिक्षण की आवश्यकता नहीं
इस प्रकार की घोषणा को दिलचस्प बनाने वाली बात यह है कि यह शायद ही कभी संकुचन का आंकड़ा होता है, बल्कि यह वह विधि होती है जिसका उपयोग इसे प्राप्त करने के लिए किया जाता है। BitNet, माइक्रोसॉफ्ट की सबसे प्रसिद्ध परियोजना तृतीयक वजन पर, एक मॉडल को शून्य से फिर से प्रशिक्षित करती है इस बाधा के साथ जो शुरुआत से ही रखी गई है। यह गणना में बहुत महंगा है, और इसका मतलब है कि हर नए मॉडल बेस से शून्य से शुरू करना।
Bonsai अलग तरीके से करता है: एक क्वांटाइजेशन (मॉडल को बनाने वाले संख्याओं की सटीकता को कम करने के लिए तकनीकी शब्द) को बाद में लागू किया जाता है, पहले से प्रशिक्षित मॉडल पर, 128 वजन के छोटे समूहों द्वारा साझा किए गए कैलिब्रेशन सेटिंग के साथ। दूसरे शब्दों में, हम पहले से तैयार Qwen3.6 27B लेते हैं, और इसे छोटे पैकेटों में संकुचित करते हैं बिना पूर्ण प्रशिक्षण के। कागज पर, बिना फिर से प्रशिक्षण के इतनी कठोर संकुचन से एक मॉडल आधा खराब होना चाहिए। व्यक्तिगत रूप से, यही आंकड़ा है जिसने मुझे चौंकाया: तृतीयक संस्करण मूल मॉडल के 15 परीक्षणों में से 94.6% स्कोर बनाए रखता है जो PrismML अपने मॉडलों की तुलना करने के लिए उपयोग करता है, और यहां तक कि 1-बिट संस्करण भी 89.5% बनाए रखता है। विवरण में, यह कुछ कार्यों पर अधिक खराब होता है: कोड में, 1-बिट 81.9 पर गिरता है जबकि पूर्ण मॉडल के लिए 88.7; उन कार्यों पर जहां मॉडल को अकेले उपकरणों का उपयोग करना होता है, अंतर और भी बढ़ता है, 66 बनाम 80। कुछ भी असंभव नहीं है, लेकिन अगर आप Bonsai पर एक एजेंट को स्वायत्तता में चलाने के लिए भरोसा कर रहे थे तो यही वह जगह है जहां यह सबसे अधिक चुभता है।
वास्तविक उपयोग में यह कैसा है
iPhone 17 Pro Max पर, PrismML 1-बिट संस्करण के साथ प्रति सेकंड लगभग 11 टोकन उत्पन्न करने की घोषणा करता है (एक टोकन, वह छोटा सा शब्द है जो मॉडल हर चरण में उत्पन्न करता है, मोटे तौर पर एक शब्द के तीन चौथाई)। Mac M5 Max पर, तृतीयक संस्करण उनके अपने आंकड़ों के अनुसार प्रति सेकंड लगभग 87 टोकन तक पहुंचता है। RTX 5090 ग्राफिक्स कार्ड पर, हम प्रति सेकंड 163 टोकन तक पहुंचते हैं। संदर्भ विंडो, यानी वह मात्रा जो मॉडल एक बार में पढ़ सकता है और याद रख सकता है, 262,000 टोकन तक जाती है: यह पूरी कोड फ़ाइल को पढ़ने के लिए पर्याप्त है बिना यह भूलने के कि शुरुआत में क्या था।
थोड़ी सावधानी बरतें, क्योंकि ये PrismML हैं जो अपने आंकड़े मापते हैं: MarkTechPost द्वारा प्रकाशित स्वतंत्र परीक्षण मैक पर तृतीयक में प्रति सेकंड लगभग 26 टोकन के काफी अधिक विनम्र आंकड़े देते हैं। अक्सर एक लॉन्च के साथ, आधिकारिक प्रस्तुति का आंकड़ा सबसे अच्छा मामला होता है, औसत नहीं। इसके आधार पर एक परियोजना बनाने से पहले, इसे अपने उपकरण पर स्वयं परीक्षण करें।
यह एक डेवलपर के लिए क्यों महत्वपूर्ण है
रुचि यह नहीं है कि आपकी जेब में एक और चैटबॉट हो। यह एक ऐसा मॉडल होने के बारे में है जो सीधे डिवाइस पर चलता है, बिना इंटरनेट कनेक्शन के, महीने के अंत में API बिल के बिना, वास्तविक एजेंट कार्यों के लिए पर्याप्त मेमोरी के साथ: एक प्रोजेक्ट पढ़ना, उपकरणों को कॉल करना, कई चरणों में तर्क करना। सब कुछ, अब तक, केवल क्लाउड में चलता था क्योंकि इस आकार का कोई मॉडल सामान्य डिवाइस में नहीं समा सकता था।
मॉडल को Hugging Face (प्लेटफ़ॉर्म जहां अधिकांश ओपन AI मॉडल होस्ट किए जाते हैं) और GitHub पर प्राप्त किया जा सकता है, या सीधे iOS ऐप Locally AI के माध्यम से उन लोगों के लिए जो बिना किसी होम इनफेरेंस सिस्टम को सेट किए इसे सिर्फ आजमाना चाहते हैं। Apache 2.0 लाइसेंस, इसलिए व्यावसायिक उपयोग के लिए कोई रोक नहीं।
जब तक मैंने इसे खुद एक असली कोड प्रोजेक्ट पर नहीं चलाया है, तब तक मैं 90% रिटेंशन पर सतर्क रहूंगा, लेकिन इस क्लास का एक मॉडल जो सीधे डिवाइस पर जवाब देता है, बिना नेटवर्क लेटेंसी के और बिना आपके प्रॉम्प्ट किसी के पास जाने के, यह स्पष्ट रूप से इसके लायक है।
वैसे, मैंने अपने iPhone Pro 17 पर Locally AI के साथ सबसे बड़े मॉडल का प्रयास किया है, मैं प्रभावित हूं (बेशक मैं फ्रांसीसी हूं, यहां एक स्क्रीनशॉट है जिसमें एक फ्रांसीसी में उत्तर है), प्रभावशाली!


No comments yet.