AI vs IKEA: Τι έγινε όταν έβαλαν την Τεχνητή Νοημοσύνη να συναρμολογήσει τα έπιπλα που κανείς μας δεν μπορεί;
Αυτός ο... πονοκέφαλος της κατασκευής ίσως χρησιμεύει και κάπου🕛 χρόνος ανάγνωσης: 5 λεπτά ┋ 🗣️ Ανοικτό για σχολιασμό

Η συναρμολόγηση επίπλων IKEA δεν είναι εύκολη υπόθεση. Τόσο πολύ που η συναρμολόγηση μιας συρταριέρας ή ενός κρεβατιού... μπορεί να κλείσει σπίτια!
Ωστόσο, αυτός ο... πονοκέφαλος της κατασκευής ίσως χρησιμεύει και κάπου! Όπως αποδεικνύεται, η επίλυση γρίφων και η λογική που απαιτούνται για να στήσεις μια βιβλιοθήκη είναι το τέλειο κριτήριο για να μετρήσουμε πόσο πραγματικά «έξυπνη» είναι η AI.
Ο Έιντεν Έιμεντ και ο Γκρεγκ Μπέρνχαμ, ερευνητές στον μη κερδοσκοπικό οργανισμό έρευνας τεχνητής νοημοσύνης Epoch AI, δημοσίευσαν πρόσφατα μια έκθεση με λεπτομέρειες για το Furniture Assembly Benchmark -ένα πρωτότυπο τεστ που σχεδιάστηκε για να μετρήσει την πραγματική νοημοσύνη των μοντέλων AI. Ο δείκτης εστιάζει στο πόσο καλά μπορεί ένα μοντέλο να εντοπίσει λάθη σε ημιτελώς συναρμολογημένα έπιπλα IKEA.
Σε μια εποχή που οι εταιρείες τεχνολογίας λατρεύουν να καυχιούνται για το πόσο έξυπνα είναι τα μοντέλα τους, μπορεί να είναι περίπλοκο να αξιολογηθεί πόσο «έξυπνο» είναι στην πραγματικότητα το καθένα -ειδικά σε σύγκριση με τα υπόλοιπα. Το να ζητάς από το ChatGPT ή το Claude να εντοπίσουν λάθη στη συναρμολόγηση επίπλων IKEA θέτει τα μοντέλα σε δοκιμασία σε εφαρμογές του πραγματικού κόσμου. Και παρόλο που κανένα μοντέλο δεν τα κατάφερε σωστά στο 100% των περιπτώσεων, φαίνεται πως βελτιώνονται με ταχείς ρυθμούς.
Το τεστ της IKEA
Οι ερευνητές ξεκίνησαν αρχικά να αναπτύσσουν το σημείο αναφοράς κατά τη διάρκεια μιας εταιρικής συνάντησης, προσπαθώντας να βρουν τρόπο να σχεδιάσουν ένα πείραμα για να δοκιμάσουν τις δυνατότητες της AI, όπως γράφει το Fast Company.
«Αρχικά, προσπαθήσαμε να ενεργήσουμε ως το "ρομπότ της AI", όπου της ζητούσαμε οδηγίες για το τι να κάνουμε και προσπαθούσαμε να τις ακολουθήσουμε σχεδόν κατά γράμμα. Τα αποτελέσματα ήταν συχνά χαοτικά», αναφέρει ο Μπέρνχαμ στο Fast Company.
«Μου αρέσει περισσότερο η τελική ιδέα, η οποία ανήκει στον συνάδελφό μου Έιντεν Έιμεντ: να ζητάμε από την AI να εντοπίσει τα λάθη», λέει ο Μπέρνχαμ. «Αυτό αντικατοπτρίζει την πραγματικότητα ότι είναι θεμιτό να κάνεις λάθη κατά τη διάρκεια της συναρμολόγησης, αρκεί να μπορείς να τα εντοπίσεις και να τα διορθώσεις».
Οι ερευνητές χρησιμοποίησαν τρία προϊόντα της IKEA για το πείραμα, επιλέγοντάς τα με βάση τους διαφορετικούς βαθμούς δυσκολίας σύμφωνα με τον ίδιο τον Δείκτη Πολυπλοκότητας της εταιρείας: την παπουτσοθήκη Stall για το εύκολο επίπεδο, το πλαίσιο κρεβατιού Tonstad για το μεσαίο επίπεδο και τη συρταριέρα Gullaberg ως το πιο σύνθετο.
Προχώρησαν στη συναρμολόγηση κάθε επίπλου, κάνοντας εσκεμμένα λάθη κατά τη διάρκεια της διαδικασίας, και τράβηξαν 60 φωτογραφίες από διάφορα στάδια για να τις τροφοδοτήσουν στα διάφορα μοντέλα AI από τις OpenAI, Anthropic, Google, Moonshot και Alibaba. Εκτός από τις εικόνες, οι ερευνητές παρείχαν σε κάθε μοντέλο AI ένα αρχείο PDF με τις οδηγίες συναρμολόγησης, ένα εργαλείο για μεγέθυνση (zoom) σε κάθε εικόνα και έναν διερμηνέα Python.
Στο κάθε μοντέλο ανατέθηκε να εντοπίσει ποια λάθη έγιναν από τον χρήστη και σε ποιο σημείο της συναρμολόγησης, και βαθμολογήθηκε ανάλογα με βάση το σημείο αναφοράς. Επιπλέον, οι ερευνητές ζήτησαν από το μοντέλο να παράσχει στους χρήστες μια εξηγητική ανάλυση για κάθε λάθος που εντοπίστηκε.
Ποιο...chatbot το έκανε καλύτερα
Ο δείκτης αξιολόγησης δεν αφορά μόνο τη συναρμολόγηση επίπλων. Προορίζεται να πάει παραπέρα, μετρώντας το πόσο καλά θα μπορούσαν αυτά τα μοντέλα να καθοδηγήσουν και να επιλύσουν προβλήματα σε πιο σύνθετες κατασκευές.
«Εάν τα μοντέλα μπορούν να σκεφτούν με αρκετή ταχύτητα και ακρίβεια σε αυτόν τον τομέα, είναι πιθανό η AI να μπορέσει σύντομα να παρέχει αξιόπιστη καθοδήγηση σε πραγματικό χρόνο για σύνθετες εργασίες φυσικής συναρμολόγησης και επισκευής», έγραψαν οι Έιμεντ και Μπέρνχαμ στην έκθεσή τους.
«Πιστεύουμε ότι αυτή η πρόκληση λειτουργεί ως ένας καλός δείκτης για μια σειρά από οικονομικά σημαντικές εργασίες που απαιτούν παρόμοια οπτική και χωρική αντίληψη, όπως η επισκευή ενός αυτοκινήτου ή η επιδιόρθωση οικιακών συσκευών», σημείωσαν.
Αρχικά, το μοντέλο με την υψηλότερη βαθμολογία στο τεστ της IKEA ήταν το Claude Opus 4.5 της Anthropic, σημειώνοντας ποσοστό ακρίβειας μόλις 28%. Ωστόσο, μέσα σε 10 μήνες, η OpenAI κάλυψε γρήγορα τη διαφορά, με το μοντέλο της GPT-6 Astra να φτάνει το 80%. Ανάμεσα στα πιο αξιοσημείωτα ευρήματα ήταν το πόσο γρήγορα μπορούσαν τα μοντέλα να δώσουν απάντηση, με το νικηφόρο GPT-6 Astra να χρειάζεται περίπου 3 λεπτά ανά φωτογραφία -έως και 10 φορές ταχύτερα από άλλα μοντέλα.
Τα κινεζικά μοντέλα φάνηκε να υστερούν ιδιαίτερα στην πρόοδο, μένοντας πίσω από τα αμερικανικά.
Παρόλα αυτά, αν και η πρόοδος στη χωρική αντίληψη και την επίλυση προβλημάτων μέσα σε τόσο σύντομο χρονικό διάστημα φαίνεται υποσχόμενη, τα μοντέλα εξακολουθούν να έχουν περιορισμούς, ειδικά όσον αφορά την ταχύτητα και τη σταθερή ακρίβεια.
«Η ανάπτυξη της Τεχνητής Νοημοσύνης είναι μια διαδικασία που απαιτεί τεράστια κεφάλαια, και η αύξηση των εσόδων των εταιρειών AI είναι απαραίτητη για τη συνέχιση των επενδύσεων. Γι' αυτό αναζητούμε πάντα τομείς αξιολόγησης όπου προς το παρόν δεν βλέπουμε μεγάλη επίδραση από την AI», αναφέρει ο Μπέρνχαμ στο Fast Company. «Αν η AI μπορεί, για παράδειγμα, να αναβαθμίσει τις δεξιότητες των εργαζομένων σε εργοστάσια ώστε να επισκευάζουν σύνθετα μηχανήματα, αυτό θα μπορούσε να οδηγήσει σε λιγότερο χρόνο εκτός λειτουργίας».
Ωστόσο, μην ανησυχείτε: η δουλειά σας στη συναρμολόγηση επίπλων είναι ασφαλής -προς το παρόν.
«Όργιο» παρανομιών με botox, υαλουρονικό και βλαστοκύτταρα: Τι βρήκε το MedWatch - Έρευνες για Πατούλη και Καρυστιανού
«Ο Μαζωνάκης δεν είναι καλά»: Τι αποκάλυψε νοσηλεύτρια του ιατρείου που κατέθεσε πρώτη φορά
Υγρά απόβλητα εταιρείας στη Μεταμόρφωση κατέληγαν στον Κηφισό - Συνελήφθη 55χρονος
AI vs IKEA: Τι έγινε όταν έβαλαν την Τεχνητή Νοημοσύνη να συναρμολογήσει τα έπιπλα που κανείς μας δεν μπορεί;
Live όλες οι εξελίξεις λεπτό προς λεπτό, με την υπογραφή του www.ethnos.gr
δημοφιλές τώρα: 



