IA Bonsai 27B : 27 अरब पैरामीटर का एक मॉडल जो जेब में समा जाता है

अब 27 अरब पैरामीटर का एक मॉडल एक iPhone पर चल रहा है


27 अरब पैरामीटर का एक मॉडल, इसके पूर्ण संस्करण में, लगभग 54 जीबी का है। इसे एक फोन पर लोड करना असंभव है, यहां तक कि एक सही मैक पर भी मुश्किल है। PrismML ने Bonsai 27B जारी किया है, जो उसी मॉडल का एक संकुचित संस्करण है जो 3.9 जीबी में समाहित है और सीधे एक iPhone पर चलता है। यह कोई प्रयोगशाला में तैयार की गई डेमो नहीं है: यह एक मॉडल है जिसे आज ही मुफ्त में डाउनलोड किया जा सकता है, एक लाइसेंस के तहत जो व्यावसायिक उपयोग की भी अनुमति देता है (Apache 2.0)।

PrismML Qwen3.6 27B से शुरू होता है, जो चीनी Alibaba का एक मॉडल है, और इसे दो हल्के संस्करणों में संकुचित करता है। तृतीयक संस्करण (मॉडल का प्रत्येक वजन, जो यह "जानता है" उसे परिभाषित करने वाले संख्याओं में से एक, अब केवल -1, 0 या +1 के बजाय एक संख्या है) का वजन 5.9 जीबी है और यह लैपटॉप के लिए लक्षित है। 1-बिट संस्करण, जो और भी अधिक कट्टर है (वजन अब केवल -1 या +1 होते हैं), का वजन 3.9 जीबी है और यह फोन के लिए लक्षित है। यह कागज पर ऐसा दिखता है।

Bonsai 27B के पूर्ण संस्करण, तृतीयक संस्करण और 1-बिट संस्करण के डिस्क पर आकार की तुलना

तकनीक: फिर से प्रशिक्षण की आवश्यकता नहीं

इस प्रकार की घोषणा को दिलचस्प बनाने वाली बात यह है कि यह शायद ही कभी संकुचन का आंकड़ा होता है, बल्कि यह वह विधि होती है जिसका उपयोग इसे प्राप्त करने के लिए किया जाता है। BitNet, माइक्रोसॉफ्ट की सबसे प्रसिद्ध परियोजना तृतीयक वजन पर, एक मॉडल को शून्य से फिर से प्रशिक्षित करती है इस बाधा के साथ जो शुरुआत से ही रखी गई है। यह गणना में बहुत महंगा है, और इसका मतलब है कि हर नए मॉडल बेस से शून्य से शुरू करना।

Bonsai अलग तरीके से करता है: एक क्वांटाइजेशन (मॉडल को बनाने वाले संख्याओं की सटीकता को कम करने के लिए तकनीकी शब्द) को बाद में लागू किया जाता है, पहले से प्रशिक्षित मॉडल पर, 128 वजन के छोटे समूहों द्वारा साझा किए गए कैलिब्रेशन सेटिंग के साथ। दूसरे शब्दों में, हम पहले से तैयार Qwen3.6 27B लेते हैं, और इसे छोटे पैकेटों में संकुचित करते हैं बिना पूर्ण प्रशिक्षण के। कागज पर, बिना फिर से प्रशिक्षण के इतनी कठोर संकुचन से एक मॉडल आधा खराब होना चाहिए। व्यक्तिगत रूप से, यही आंकड़ा है जिसने मुझे चौंकाया: तृतीयक संस्करण मूल मॉडल के 15 परीक्षणों में से 94.6% स्कोर बनाए रखता है जो PrismML अपने मॉडलों की तुलना करने के लिए उपयोग करता है, और यहां तक कि 1-बिट संस्करण भी 89.5% बनाए रखता है। विवरण में, यह कुछ कार्यों पर अधिक खराब होता है: कोड में, 1-बिट 81.9 पर गिरता है जबकि पूर्ण मॉडल के लिए 88.7; उन कार्यों पर जहां मॉडल को अकेले उपकरणों का उपयोग करना होता है, अंतर और भी बढ़ता है, 66 बनाम 80। कुछ भी असंभव नहीं है, लेकिन अगर आप Bonsai पर एक एजेंट को स्वायत्तता में चलाने के लिए भरोसा कर रहे थे तो यही वह जगह है जहां यह सबसे अधिक चुभता है।

वास्तविक उपयोग में यह कैसा है

iPhone 17 Pro Max पर, PrismML 1-बिट संस्करण के साथ प्रति सेकंड लगभग 11 टोकन उत्पन्न करने की घोषणा करता है (एक टोकन, वह छोटा सा शब्द है जो मॉडल हर चरण में उत्पन्न करता है, मोटे तौर पर एक शब्द के तीन चौथाई)। Mac M5 Max पर, तृतीयक संस्करण उनके अपने आंकड़ों के अनुसार प्रति सेकंड लगभग 87 टोकन तक पहुंचता है। RTX 5090 ग्राफिक्स कार्ड पर, हम प्रति सेकंड 163 टोकन तक पहुंचते हैं। संदर्भ विंडो, यानी वह मात्रा जो मॉडल एक बार में पढ़ सकता है और याद रख सकता है, 262,000 टोकन तक जाती है: यह पूरी कोड फ़ाइल को पढ़ने के लिए पर्याप्त है बिना यह भूलने के कि शुरुआत में क्या था।

थोड़ी सावधानी बरतें, क्योंकि ये PrismML हैं जो अपने आंकड़े मापते हैं: MarkTechPost द्वारा प्रकाशित स्वतंत्र परीक्षण मैक पर तृतीयक में प्रति सेकंड लगभग 26 टोकन के काफी अधिक विनम्र आंकड़े देते हैं। अक्सर एक लॉन्च के साथ, आधिकारिक प्रस्तुति का आंकड़ा सबसे अच्छा मामला होता है, औसत नहीं। इसके आधार पर एक परियोजना बनाने से पहले, इसे अपने उपकरण पर स्वयं परीक्षण करें।

यह एक डेवलपर के लिए क्यों महत्वपूर्ण है

रुचि यह नहीं है कि आपकी जेब में एक और चैटबॉट हो। यह एक ऐसा मॉडल होने के बारे में है जो सीधे डिवाइस पर चलता है, बिना इंटरनेट कनेक्शन के, महीने के अंत में API बिल के बिना, वास्तविक एजेंट कार्यों के लिए पर्याप्त मेमोरी के साथ: एक प्रोजेक्ट पढ़ना, उपकरणों को कॉल करना, कई चरणों में तर्क करना। सब कुछ, अब तक, केवल क्लाउड में चलता था क्योंकि इस आकार का कोई मॉडल सामान्य डिवाइस में नहीं समा सकता था।

मॉडल को Hugging Face (प्लेटफ़ॉर्म जहां अधिकांश ओपन AI मॉडल होस्ट किए जाते हैं) और GitHub पर प्राप्त किया जा सकता है, या सीधे iOS ऐप Locally AI के माध्यम से उन लोगों के लिए जो बिना किसी होम इनफेरेंस सिस्टम को सेट किए इसे सिर्फ आजमाना चाहते हैं। Apache 2.0 लाइसेंस, इसलिए व्यावसायिक उपयोग के लिए कोई रोक नहीं।

जब तक मैंने इसे खुद एक असली कोड प्रोजेक्ट पर नहीं चलाया है, तब तक मैं 90% रिटेंशन पर सतर्क रहूंगा, लेकिन इस क्लास का एक मॉडल जो सीधे डिवाइस पर जवाब देता है, बिना नेटवर्क लेटेंसी के और बिना आपके प्रॉम्प्ट किसी के पास जाने के, यह स्पष्ट रूप से इसके लायक है।

वैसे, मैंने अपने iPhone Pro 17 पर Locally AI के साथ सबसे बड़े मॉडल का प्रयास किया है, मैं प्रभावित हूं (बेशक मैं फ्रांसीसी हूं, यहां एक स्क्रीनशॉट है जिसमें एक फ्रांसीसी में उत्तर है), प्रभावशाली!

Join the conversation

You need an account to comment on this article. Creating one is free and takes under a minute.

  • The XMLTV file, free to download every day
  • Comment on articles and reply to other readers
  • Get an e-mail when an article you follow is updated

No comments yet.

Une erreur s'est produite. Cette application peut ne plus répondre jusqu'à ce qu'elle soit rechargée.Veuillez contacter l'auteur. Reload 🗙