IA Bonsai 27B : ένα μοντέλο 27 δισεκατομμυρίων παραμέτρων που χωράει στην τσέπη

Ένα μοντέλο 27 δισεκατομμυρίων παραμέτρων τρέχει τώρα σε ένα iPhone


Ένα μοντέλο 27 δισεκατομμυρίων παραμέτρων, στην πλήρη του έκδοση, ζυγίζει περίπου 54 GB. Αδύνατο να φορτωθεί σε τηλέφωνο, δύσκολο ακόμα και σε έναν καλό Mac. PrismML μόλις κυκλοφόρησε Bonsai 27B, μια συμπιεσμένη έκδοση του ίδιου μοντέλου που χωράει σε 3,9 GB και τρέχει απευθείας σε ένα iPhone. Όχι μια πρόχειρη επίδειξη σε εργαστήριο: ένα μοντέλο που μπορεί να κατέβει από σήμερα, δωρεάν, υπό άδεια που επιτρέπει ακόμα και εμπορική χρήση (Apache 2.0).

Το PrismML ξεκινά από Qwen3.6 27B, ένα μοντέλο της κινεζικής Alibaba, και το συμπιέζει σε δύο πιο ελαφριές εκδόσεις. Η έκδοση τριών τιμών (κάθε βάρος του μοντέλου, ένας από τους αριθμούς που καθορίζουν τι "ξέρει", αξίζει μόνο -1, 0 ή +1 αντί για έναν αριθμό με δεκαδικά) ζυγίζει 5,9 GB και στοχεύει σε φορητούς υπολογιστές. Η έκδοση 1-bit, ακόμα πιο ριζοσπαστική (τα βάρη αξίζουν μόνο -1 ή +1), ζυγίζει 3,9 GB και στοχεύει το τηλέφωνο. Να πώς φαίνεται αυτό στο χαρτί.

Σύγκριση του μεγέθους στον δίσκο του Bonsai 27B στην πλήρη έκδοση, στην τριών τιμών έκδοση και στην 1-bit έκδοση

Η τεχνική: δεν χρειάζεται να επαναεκπαιδευτεί όλο το μοντέλο

Αυτό που καθιστά αυτό το είδος ανακοίνωσης ενδιαφέρον είναι σπάνια ο αριθμός συμπίεσης, είναι η μέθοδος που χρησιμοποιείται για να το πετύχει. BitNet, το πιο γνωστό έργο της Microsoft για τα τριών τιμών βάρη, επαναεκπαιδεύει ένα μοντέλο από το μηδέν με αυτή την προϋπόθεση από την αρχή. Αυτό κοστίζει πολύ σε υπολογιστική ισχύ, και σημαίνει ότι πρέπει να ξεκινάς από το μηδέν σε κάθε νέα βάση μοντέλου.

Το Bonsai το κάνει διαφορετικά: μια ποσοτικοποίηση (ο τεχνικός όρος για "μείωση της ακρίβειας των αριθμών που συνθέτουν το μοντέλο") εφαρμόζεται εκ των υστέρων, σε ένα μοντέλο που έχει ήδη εκπαιδευτεί, με μια ρύθμιση βαθμονόμησης που μοιράζεται από μικρές ομάδες 128 βαρών. Με άλλα λόγια, παίρνουμε το Qwen3.6 27B που είναι ήδη έτοιμο, και το συμπιέζουμε σε μικρές δόσεις χωρίς να περάσουμε από μια πλήρη επανεκπαίδευση. Στο χαρτί, μια τόσο σφοδρή συμπίεση χωρίς επαναεκπαίδευση θα έπρεπε να δώσει ένα μοντέλο ημιτελές. Προσωπικά, αυτός ο αριθμός με έκανε να αναρωτηθώ: η τριών τιμών έκδοση διατηρεί το 94,6 % της βαθμολογίας του αρχικού μοντέλου στις 15 δοκιμές που χρησιμοποιεί το PrismML για να συγκρίνει τα μοντέλα του, και ακόμα και η 1-bit έκδοση διατηρεί το 89,5 %. Στις λεπτομέρειες, η απόδοση υποχωρεί περισσότερο σε ορισμένες εργασίες: στον κώδικα, η 1-bit πέφτει στο 81,9 έναντι 88,7 για το πλήρες μοντέλο; σε εργασίες όπου το μοντέλο πρέπει να χρησιμοποιήσει εργαλεία μόνο του, η διαφορά μεγαλώνει ακόμα περισσότερο, 66 έναντι 80. Τίποτα μη αναγνώσιμο, αλλά εκεί είναι που πονάει περισσότερο αν υπολογίζατε στο Bonsai για να τρέξει έναν πράκτορα αυτόνομα.

Τι σημαίνει στην πραγματική χρήση

Σε ένα iPhone 17 Pro Max, το PrismML ανακοινώνει περίπου 11 tokens ανά δευτερόλεπτο στη γεννήτρια με την 1-bit έκδοση (ένα token είναι το μικρό κομμάτι λέξης που παράγει το μοντέλο σε κάθε βήμα, χονδρικά τα τρία τέταρτα μιας λέξης). Σε έναν Mac M5 Max, η τριών τιμών έκδοση ανεβαίνει γύρω στα 87 tokens ανά δευτερόλεπτο σύμφωνα με τα δικά τους στοιχεία. Σε μια κάρτα γραφικών RTX 5090, φτάνουμε στα 163 tokens ανά δευτερόλεπτο. Το παράθυρο συμφραζομένων, δηλαδή η ποσότητα κειμένου που το μοντέλο μπορεί να διαβάσει και να κρατήσει στο μυαλό του ταυτόχρονα, φτάνει τα 262 000 tokens: αρκετά για να διαβάσει ολόκληρο ένα φάκελο κώδικα χωρίς να ξεχάσει την αρχή.

Μικρή προειδοποίηση, γιατί είναι το PrismML που μετράει τα δικά τους νούμερα: οι ανεξάρτητες δοκιμές που δημοσιεύθηκαν από MarkTechPost δίνουν σαφώς πιο μετριοπαθείς ρυθμούς σε Mac, γύρω στα 26 tokens ανά δευτερόλεπτο στην τριών τιμών έκδοση. Όπως συμβαίνει συχνά με μια κυκλοφορία, ο αριθμός της επίσημης παρουσίασης είναι η καλύτερη περίπτωση, όχι ο μέσος όρος. Πριν χτίσετε ένα έργο πάνω σε αυτό, δοκιμάστε το μόνοι σας στο υλικό σας.

Γιατί έχει σημασία για έναν προγραμματιστή

Το ενδιαφέρον δεν είναι να έχεις έναν chatbot παραπάνω στην τσέπη. Είναι να έχεις ένα μοντέλο που τρέχει απευθείας στη συσκευή, χωρίς σύνδεση στο διαδίκτυο, χωρίς χρέωση API στο τέλος του μήνα, με αρκετή μνήμη για πραγματικές εργασίες πράκτορα: να διαβάσει ένα έργο, να καλέσει εργαλεία, να συλλογιστεί σε πολλά βήματα. Ό,τι μέχρι τώρα λειτουργούσε μόνο στο cloud επειδή κανένα μοντέλο αυτού του μεγέθους δεν χωρούσε σε μια κανονική συσκευή.

Το μοντέλο ανακτάται από Hugging Face (η πλατφόρμα όπου φιλοξενούνται τα περισσότερα ανοιχτά μοντέλα AI) και από GitHub, ή απευθείας μέσω της εφαρμογής iOS Locally AI για όσους θέλουν απλώς να το δοκιμάσουν χωρίς να στήσουν ολόκληρο σύστημα οικιακής πληροφορικής. Άδεια Apache 2.0, επομένως καμία απαγόρευση για εμπορική χρήση.

Παραμένω επιφυλακτικός για το 90% της διατήρησης όσο δεν το έχω τρέξει ο ίδιος σε ένα πραγματικό έργο κώδικα, αλλά η ιδέα να έχεις ένα μοντέλο αυτής της κλάσης που απαντά απευθείας στη συσκευή, χωρίς καθυστέρηση δικτύου και χωρίς να στέλνονται οι προτροπές σου σε κανέναν, αξίζει σίγουρα τον κόπο.

Σε κάθε περίπτωση, δοκίμασα το μεγαλύτερο μοντέλο στο iPhone Pro 17 μου με το Locally AI, είμαι εντυπωσιασμένος (προφανώς είμαι Γάλλος, εδώ μια στιγμιότυπο οθόνης με μια απάντηση στα γαλλικά), εντυπωσιακό!

iallmopen-sourceiphonemacquantizationon-device

No comments yet.

Une erreur s'est produite. Cette application peut ne plus répondre jusqu'à ce qu'elle soit rechargée.Veuillez contacter l'auteur. Reload 🗙