清晨好,您是今天最早来到科研通的研友!由于当前在线用户较少,发布求助请尽量完整地填写文献信息,科研通机器人24小时在线,伴您科研之路漫漫前行!

Effective methodologies for 3D perception in autonomous vehicles

作者
Γεώργιος Ζαμανάκος
标识
DOI:10.12681/eadd/58128
摘要

Τα αυτόνομα οχήματα είναι στο επίκεντρο τόσο της ερευνητικής κοινότητας, όσο και της αυτοκινητοβιομηχανίας καθώς η χρήση τους θα μειώσει τα ατυχήματα που προκαλούνται από τον ανθρώπινο παράγοντα και θα αυξήσει την αποδοτικότητά τους μέσω της βέλτιστης χρήσης από πολλαπλούς χρήστες. Όμως, προκειμένου να μπορεί να κινηθεί ένα αυτόνομο όχημα με ασφάλεια σε αστικό και περιαστικό περιβάλλον, θα πρέπει να μπορεί να αντιληφθεί με ακρίβεια την οδηγική σκηνή στην οποία καλείται να δράσει. Το σύστημα αντίληψης ενός αυτόνομου οχήματος έχει ως στόχο να επεξεργαστεί τα δεδομένα των αισθητήρων του αυτόνομου οχήματος, ώστε να εντοπίζει και να αναγνωρίζει με ακρίβεια τα τριδιάστατα (3Δ) αντικείμενα που περιέχονται σε μια οδηγική σκηνή. Ένα σύστημα αντίληψης αποτελείται από αισθητήρες όπως είναι η οπτική κάμερα και ο αισθητήρας Light Detection And Ranging (LiDAR).Ο κάθε τύπος αισθητήρα έχει τα πλεονεκτήματα του αλλά και τους περιορισμούς του. Η χρήση συμπληρωματικών και διαφορετικών τύπων αισθητήρων περιορίζει σημαντικά τα επιμέρους μειονεκτήματα του κάθε αισθητήρα και αυξάνει συνολικά την αξιοπιστία του συστήματος αντίληψης. Όμως, προκειμένου να συσχετιστούν τα δεδομένα μεταξύ των διαφορετικών τύπων αισθητήρων, αυτά θα πρέπει να ενοποιηθούν σε ένα κοινό σύστημα συντεταγμένων. Κρίσιμο σημείο αυτής της διαδικασίας αποτελεί η βαθμονόμηση των αισθητήρων ως προς τα εξωγενή τους χαρακτηριστικά, δηλαδή ως προς τον προσανατολισμό και την θέση που έχουν τοποθετηθεί πάνω στο αυτόνομο όχημα. Έπειτα, τα δεδομένα των αισθητήρων μπορούν να χρησιμοποιηθούν από το αυτόνομο όχημα για τον εντοπισμό αντικειμένων. Τα 3Δ αντικείμενα που περιέχονται σε μια οδηγική σκηνή ορίζονται με την μορφή 3Δ κουτιών οριοθέτησης. Το κάθε 3Δ κουτί οριοθέτησης επισημαίνεται με συγκεκριμένα χαρακτηριστικά όπως είναι η θέση του, ο προσανατολισμός του και η κλάση του, π.χ. αυτοκίνητο, πεζός ή ποδηλάτης. Όμως, για την πλήρη αντίληψη της οδηγικής σκηνής μπορεί να απαιτηθεί να επισημανθεί επιπλέον σημασιολογική πληροφορία σε κάθε δομικό στοιχείο των δεδομένων των αισθητήρων, όπως είναι το νέφος σημείων από τον αισθητήρα LiDAR ή ακόμη και να αναγνωριστούν αλλαγές που έχουν συμβεί σε μια οδηγική σκηνή μεταξύ δύο διακριτών χρονικών στιγμών. Για τους σκοπούς αυτούς, οι σύγχρονες μεθοδολογίες που έχουν αναπτυχθεί βασίζονται σε δίκτυα βαθιάς μάθησης, κρίσιμο σημείο των οποίων αποτελεί η εκάστοτε αρχιτεκτονική που θα χρησιμοποιηθεί για την εξαγωγή χαρακτηριστικών. Στην πλειονότητά τους, οι μεθοδολογίες βασίζονται αποκλειστικά σε δεδομένα αισθητήρων LiDAR κυρίως λόγω της αυξημένης απόδοσης που επιδεικνύουν αλλά και της εκτέλεσής τους σε πραγματικό χρόνο σε ενσωματωμένα υπολογιστικά συστήματα. Η παρούσα διδακτορική διατριβή στοχεύει στην ανάπτυξη καινοτόμων και αποτελεσματικών μεθοδολογιών για την τριδιάστατη αντίληψη για αυτόνομα οχήματα. Συγκεκριμένα, μετά από εκτενή βιβλιογραφική ανασκόπηση και ανάλυση των διαθέσιμων μεθοδολογιών της τρέχουσας τεχνολογικής στάθμης, παρουσιάζονταιτέσσερις καινοτόμες προτάσεις. Η πρώτη σχετίζεται με την εγκατάσταση αισθητήρων κάμερας και LiDAR, οι οποίοι χρησιμοποιούνται για την καταγραφή μιας σκηνής οδήγησης, έτσι ώστε να καταστεί δυνατή η βέλτιστη συσχέτιση δεδομένων μεταξύ των δύο τύπων αισθητήρων. Προτείνεται μια μέθοδος για την βαθμονόμηση, ως προς τα εξωγενή χαρακτηριστικά, της κάμερας και του LiDAR από πολλαπλές στατικές σκηνές, χρησιμοποιώντας έναν απλό σχέδιο ως στόχο βαθμονόμησης το οποίο βασίζεται σε δείκτες ArUco. Προς το σκοπό αυτό, χρησιμοποιείται ένα νέο συνεργατικό σχήμα LiDAR-κάμερας. Αρχικά, η ανίχνευση του δείκτη που βασίζεται στην κάμερα καθοδηγεί την επεξεργασία του νέφους σημείων από τον αισθητήρα LiDAR ώστε να εντοπιστεί ο τριδιάστατος δείκτης σε αυτό. Μόλις εντοπιστεί με ακρίβεια ο δείκτης στο νέφος σημείων, πραγματοποιείται περαιτέρω διόρθωση σχετικά με την εκτίμηση πόζας του δείκτη από τον αισθητήρα της κάμερας. Με αυτόν τον τρόπο, τα πλεονεκτήματα του κάθε αισθητήρα χρησιμοποιούνται για τη βελτίωση του εντοπισμού των δεικτών. Η βελτιωμένη ακρίβεια που επιτυγχάνεται στον υπολογισμό των εξωγενών παραμέτρων βαθμονόμησης έχει αποδειχθεί πειραματικά τόσο με ποσοτικούς όσο και με ποιοτικούς όρους. Στην δεύτερη καινοτόμο πρόταση αντιμετωπίζεται το αντικείμενο του τριδιάστατου εντοπισμού αντικειμένων, το οποίο αποτελεί βασικό στοιχείο για την τριδιάστατη αντίληψη των αυτόνομων οχημάτων. Οι αισθητήρες LiDAR χρησιμοποιούνται για την αντίληψη περιβάλλοντος, παράγοντας μια αραιή αναπαράσταση της σκηνής με τη μορφή ενός νέφους σημείων. Η τρέχουσα τάση είναι η χρήση αρχιτεκτονικών που βασίζονται σε νευρωνικά δίκτυα βαθιάς μάθησης, τα οποία προβλέπουν τριδιάστατα κουτιά οριοθέτησης. Η συντριπτική πλειονότητα των αρχιτεκτονικών επεξεργάζεται απευθείας το νέφος σημείων LiDAR, αλλά, λόγω περιορισμών ως προς τους υπολογιστικούς πόρους και της μνήμης, σε κάποιο σημείο συμπιέζουν την είσοδο σε μια διδιάστατη (2Δ) αναπαράσταση τύπου Bird’s Eye View (BEV). Η προτεινόμενη αρχιτεκτονική 2Δ νευρωνικού δικτύου, συγκεκριμένα το Feature Aware Re-weighting Network, χρησιμοποιείται για την εξαγωγή χαρακτηριστικών στο επίπεδο BEV χρησιμοποιώντας το τοπικό περιεχόμενο της σκηνής μέσω ενός μηχανισμού προσοχής, για τη βελτίωση της απόδοσης των τριδιάστατων εντοπιστών αντικειμένων που βασίζονται στο LiDAR. Εκτεταμένα πειράματα σε πέντε εντοπιστές 3Δ αντικειμένων της τελευταίας τεχνολογικής στάθμης και σε τρία σύνολα δεδομένων συγκριτικής αξιολόγησης, συγκεκριμένα τα KITTI, Waymo και nuScenes, καταδεικνύουν την αποτελεσματικότητα της προτεινόμενης μεθόδου όσον αφορά τόσο την απόδοση ανίχνευσης όσο και την ελάχιστη πρόσθετη υπολογιστική επιβάρυνση. Η τρίτη και η τέταρτη συνεισφορά σχετίζονται με την ενσωμάτωση μηχανισμών προσοχής σε αρχιτεκτονικές βαθιάς μάθησης για τις εργασίες της τριδιάστατης σημασιολογικής τμηματοποίησης και της ανίχνευσης αλλαγής νέφους σημείων, αντίστοιχα, που διευκολύνουν την τριδιάστατη αναγνώριση μιας σκηνής οδήγησης. Η τριδιάστατη σημασιολογική τμηματοποίηση είναι βασικό στοιχείο στα αυτόνομα οχήματα. Για αυτές τις εφαρμογές, τα τριδιάστατα δεδομένα λαμβάνονται συνήθως από αισθητήρες LiDAR με την μορφή ενός νέφους σημείων. Για το έργο της τριδιάστατης σημασιολογικής τμηματοποίησης όπου τα αντίστοιχα νέφη σημείων θα πρέπει να επισημαίνονται με σημασιολογική πληροφορία, η τρέχουσα τάση είναι η χρήση αρχιτεκτονικών νευρωνικών δικτύων βαθιάς μάθησης για την αποτελεσματική εκμάθηση της αναπαράστασης. Από την άλλη πλευρά, διάφορες εργασίες σε 2Δ και 3Δ εφαρμογές όρασης υπολογιστών έχουν χρησιμοποιήσει μηχανισμούς προσοχής που έχουν ως αποτέλεσμα την αποτελεσματική επαναστάθμιση των διανυσμάτων χαρακτηριστικών. Σε αυτή τη διατριβή, διερευνάται ο ρόλος των μηχανισμών προσοχής για το αντικείμενο της τριδιάστατης σημασιολογικής τμηματοποίησης για εφαρμογές αυτόνομης οδήγησης, εντοπίζοντας τη σημαντικότητα των διαφορετικών μηχανισμών προσοχής όταν υιοθετούνται σε υπάρχοντα δίκτυα βαθιάς μάθησης. Πραγματοποιήθηκαν εκτενή πειράματα σε δύο σύνολα δεδομένων για αυτόνομη οδήγηση, συγκεκριμένα στο Street3D και στο SemanticKITTI, που επιτρέπουν την εξαγωγή συμπερασμάτων τόσο σε ποσοτικό όσο και σε ποιοτικό επίπεδο. Τα πειραματικά αποτελέσματα δείχνουν ότι υπάρχει σαφές πλεονέκτημα όταν υιοθετούνται μηχανισμοί προσοχής, με αποτέλεσμα την ανώτερη απόδοση του δικτύου. Συγκεκριμένα, αποδεικνύεται ότι η υιοθέτηση ενός Μετασχηματιστή Σημείου (Point Transformer) στο δίκτυο βαθιάς μάθησης SPVCNN, έχει ως αποτέλεσμα μια αρχιτεκτονική που ξεπερνά την απόδοση του δικτύου της τρέχουσας τεχνολογικής στάθμης στο σύνολο δεδομένων Street3D. Η ανίχνευση αλλαγής νέφους σημείων χρησιμοποιείται για τον εντοπισμό και την ταξινόμηση χωρικών αλλαγών μεταξύ δύο νεφών σημείων LiDAR, που καταγράφονται στην ίδια σκηνή οδήγησης σε διαφορετικές χρονικές στιγμές. Η τρέχουσα τάση είναι η χρήση δικτύων βαθιάς μάθησης, με σιαμαία δομή, για την επεξεργασία των δύο νεφών σημείων. Σε αυτή τη διατριβή, εξετάζονται δύο διακριτές προσεγγίσεις για το έργο της ανίχνευσης αλλαγής νέφους σημείων. Στην πρώτη προσέγγιση, προτείνεται μια νέα αρχιτεκτονική, συγκεκριμένα η SiamGCN-GCA, η οποία προκύπτει από την ενσωμάτωση ενός καινοτόμου μηχανισμού προσοχής στο δίκτυο βαθιάς μάθησης SiamGCN, για την εξαγωγή χρήσιμων γεωμετρικών και συναφών πληροφοριών (Geometry Context Aware). Στη δεύτερη προσέγγιση προτείνεται μια αρχιτεκτονική βαθιάς μάθησης, συγκεκριμένα το SiamVFE, η οποία βασίζεται για την εξαγωγή των χαρακτηριστικών σε ένα υπολογιστικά αποδοτικό δίκτυο κορμού από έναν εντοπιστή 3Δ αντικειμένων LiDAR. Τα πειραματικά αποτελέσματα τόσο από τα πραγματικά όσο και από τα συνθετικά σύνολα δεδομένων, καταδεικνύουν ότι η υιοθέτηση του προτεινόμενου μηχανισμού προσοχής GCA, βελτιώνει την απόδοση της προτεινόμενης μεθοδολογίας SiamGCN-GCA, σε σύγκριση με τη βασική μεθοδολογία SiamGCN. Επίσης, η προτεινόμενη μεθοδολογία SiamVFE επιτυγχάνει μια αποδεκτή απόδοση και είναι προτιμότερη για εφαρμογές αυτόνομης οδήγησης σε πραγματικό χρόνο. Η παρούσα διατριβή δομείται ως εξής: Στο πρώτο κεφάλαιο παρατίθενται εισαγωγικές πληροφορίες. Το δεύτερο κεφάλαιο αφορά στην βαθμονόμηση ως προς τα εξωγενή χαρακτηριστικά ενός ζεύγους αισθητήρων LiDAR-κάμερας, όπου η προτεινόμενη μεθοδολογία βασίζεται στην συνεργατικότητα, ώστε να αντιμετωπιστούν οι επιμέρους περιορισμοί των δύο τύπων αισθητήρων. Στο τρίτο κεφάλαιο γίνεται μια λεπτομερής ανάλυση της τρέχουσας βιβλιογραφικής στάθμης για τον εντοπισμό 3Δ αντικειμένων, όπου οι μεθοδολογίες που χρησιμοποιούν τα δεδομένα του αισθητήρα LiDAR και βασίζονται στην βαθιά μάθηση, κατηγοριοποιούνται σύμφωνα με την αναπαράσταση των δεδομένων του αισθητήρα, την αρχιτεκτονική για την εξαγωγή των χαρακτηριστικών και τον πυρήνα εντοπισμού για την ανίχνευση των αντικειμένων. Επίσης, παρατίθενται τα διαθέσιμα σύνολα δεδομένων καθώς και οι μετρικές αξιολόγησης αυτών. Στο τέταρτο κεφάλαιο αναλύεται εκτενώς και αξιολογείται πειραματικά η προτεινόμενη μεθοδολογία για την εξαγωγή χαρακτηριστικών στο επίπεδο BEV. Το πέμπτο κεφάλαιο αφορά την 3Δ σημασιολογική τμηματοποίηση μιας οδηγικ

科研通智能强力驱动
Strongly Powered by AbleSci AI
科研通是完全免费的文献互助平台,具备全网最快的应助速度,最高的求助完成率。 对每一个文献求助,科研通都将尽心尽力,给求助人一个满意的交代。
实时播报
TingtingGZ发布了新的文献求助10
1秒前
威武的碧玉完成签到,获得积分10
8秒前
Rain发布了新的文献求助10
9秒前
震动的秋凌完成签到,获得积分10
18秒前
脑洞疼的应助被dudu采纳,获得10
34秒前
Rain发布了新的文献求助10
37秒前
阳光手机完成签到,获得积分10
38秒前
Elytra发布了新的文献求助10
42秒前
洁净凡波完成签到,获得积分10
58秒前
Elytra完成签到,获得积分10
1分钟前
CodeCraft的应助被meir采纳,获得30
1分钟前
1分钟前
快点毕业的应助被科研通管家采纳,获得10
1分钟前
快点毕业的应助被科研通管家采纳,获得10
1分钟前
Rain发布了新的文献求助10
1分钟前
1分钟前
liwang发布了新的文献求助10
1分钟前
deki完成签到,获得积分10
1分钟前
迷人海蓝完成签到,获得积分10
1分钟前
野性的幼萱完成签到,获得积分10
1分钟前
正直盼秋完成签到,获得积分10
1分钟前
刻苦寻双完成签到,获得积分10
2分钟前
陆上飞完成签到,获得积分10
2分钟前
2分钟前
dudu发布了新的文献求助10
2分钟前
JamesPei的应助被369ninja采纳,获得10
2分钟前
Rain发布了新的文献求助10
2分钟前
年轻静蕾完成签到,获得积分10
2分钟前
2分钟前
爆米花的应助被sanbuzhiwai采纳,获得10
2分钟前
乐观的黎云完成签到,获得积分10
2分钟前
靓丽的淇完成签到,获得积分10
3分钟前
快点毕业的应助被科研通管家采纳,获得10
3分钟前
快点毕业的应助被科研通管家采纳,获得10
3分钟前
快点毕业的应助被科研通管家采纳,获得10
3分钟前
Rain发布了新的文献求助10
3分钟前
糊涂的电话完成签到,获得积分10
3分钟前
3分钟前
着急的靖柔完成签到,获得积分10
3分钟前
369ninja发布了新的文献求助10
3分钟前
高分求助中
(应助此贴封号)通过应助OA文献获取积分 10000
Rosenblum, Global Change Biology 800
中国器官捐献和移植发展报告(2024) 520
Organizational Behavior 510
Arbitrage Theory in Discrete and Continuous Time 500
Production Logging: Theoretical and Interpretive Elements 400
English Longitudinal Study of Ageing: Waves 0-11, 1998-2024 300
热门求助领域 (近24小时)
化学 材料科学 医学 生物 计算机科学 工程类 纳米技术 有机化学 化学工程 内科学 物理 生物化学 复合材料 催化作用 细胞生物学 人工智能 心理学 无机化学 基因 遗传学
热门帖子
关注 科研通微信公众号,转发送积分 7823963
求助须知:如何正确求助?哪些是违规求助? 9350348
关于积分的说明 20556901
捐赠科研通 7416741
什么是DOI,文献DOI怎么找? 3334321
关于科研通互助平台的介绍 2479669
邀请新用户注册赠送积分活动 2354497