Teknik mühendislik makalesi incelemesi
DOI: 10.1038/s41598-023-38259-7Derin Pekiştirmeli Öğrenme ile Solo12 Dört Bacaklı Robotunun Denetimi
Dört bacaklı robot sistemleri, karmaşık ve zorlu arazi koşullarında yüksek hareket kabiliyeti sunma potansiyeline sahiptir. Geleneksel denetim yaklaşımları genellikle yörünge optimizasyonu, model öngörülü denetim (MPC) ve elle ayarlanan parametrelere dayanır.
Makalenin anahtar kelimeleri
- Yazar
- Michel Aractingi et al.
- Yayın
- Scientific Reports
- Tarih
- 2023-07-24
Makalenin Kapsamı ve Akademik İçeriği
Dört bacaklı robotik sistemlerin karmaşık arazilerde dinamik hareket kabiliyeti sergilemesi, modern robotik araştırmalarının en kritik konuları arasında yer almaktadır. Geleneksel Yörünge Optimizasyonu ve Model Öngörülü Denetim (MPC) yöntemleri yüksek fiziksel doğruluk sağlasa da, çevre koşullarına uyarlanması gereken çok sayıda elle ayarlanmış parametre içermekte ve yüksek anlık hesaplama maliyetleri gerektirmektedir. Son dönemde veri odaklı bir alternatif olarak öne çıkan derin pekiştirmeli öğrenme yaklaşımları ise simülasyon ortamındaki fiziksel model ile gerçek dünya arasındaki uyumsuzluktan kaynaklanan sim-to-real aktarım engellerine takılmaktadır. Bu çalışma, açık kaynaklı Solo12 robot platformunda simülasyondan gerçeğe aktarım hatasını ek eyleyici modellemesine gerek kalmadan çözen ve enerji verimliliği yüksek bir uçtan uca denetim mimarisi geliştirmeyi amaçlamaktadır.
Çalışmanın temel amacı, Solo12 robotunun kullanıcı tarafından iletilen 3 boyutlu hız komutlarını hassasiyetle takip etmesini sağlayan, Yakınsal Politika Optimizasyonu (PPO) tabanlı bir empedans denetleyicisi tasarlamaktır. Yöntem kapsamında, Markov Karar Süreci durum alanı robotun öz duyusal verileri, eklem açıları, hızları, geçmiş hata sinyalleri ve IMU ölçümleriyle oluşturulmuştur. Doğrudan tork denetimi yerine esnek bir yay-sönümleyici davranışı sergileyen eklem açısı hedef değişimleri eğitilmiştir. Eğitim sürecinde ödül fonksiyonuna Coulomb ve viskoz sürtünme ile Joule ısı kayıplarını hesaplayan fiziksel bir enerji cezası eklenmiştir. Ayrıca, eğitimin kararlılığını ve aktarılabilirliğini sağlamak amacıyla ödül, gürültü ve arazi zorluğuna dayalı kademeli müfredat öğrenimi (curriculum learning) ve alan rastgeleleştirmesi uygulanmıştır.
Deneysel bulgular, geliştirilen denetim politikasının Solo12 robotunu hem simülasyonda hem de gerçek dünyada başarıyla yönlendirebildiğini göstermiştir. Robot, Raspberry Pi 4 donanımı üzerinde yalnızca 10 mikrosaniyelik hesaplama süresiyle 100 Hz frekansta denetim kararları üretebilmiştir. Fiziksel enerji cezası ağırlığının artırılmasıyla, hız takip hassasiyetinde minimal bir kayıpla toplam enerji tüketiminde %30'un üzerinde tasarruf sağlanmıştır. Ayrıca yürüyüş frekansının komut edilen doğrusal hız ile orantılı olarak kendiliğinden adapte olduğu tespit edilmiştir. Alan ve dinamik rastgeleleştirmesi sayesinde, eyleyici bant genişliği veya karmaşık motor modelleri eklenmeksizin ilk denemede başarılı bir sim-to-real aktarımı gerçekleştirilmiştir.
Elde edilen sonuçlar, derin pekiştirmeli öğrenme modellerinde fizik tabanlı enerji kaybı cezalarının kullanılmasının ve durum geçmişinin doğru eklenmesinin aktarım başarısındaki rolünü kanıtlamaktadır. Literatürdeki diğer ANYmal veya Mini-Cheetah uygulamalarından farklı olarak, Solo12 platformunun hafif yapısı ve yüksek bant genişlikli eyleyicileri sayesinde karmaşık motor modeli öğrenme zorunluluğunun ortadan kalktığı gösterilmiştir. Bu çalışma, açık kaynaklı robotik topluluğu için hem üretilebilir hem de düşük hesaplama maliyetli bir kontrol altyapısı sunmaktadır. Gelecek araştırmalarda model tabanlı MPC denetleyicileri ile derin pekiştirmeli öğrenmenin doğrudan karşılaştırılması ve daha zorlu engebeli alanlarda robot performansının sınanması önerilmektedir.
Araştırmanın amacı
Bu çalışmanın temel amacı, açık kaynaklı Solo12 dört bacaklı robotu için uçtan uca çalışan, kullanıcının hız komutlarını takip eden, yüksek enerji verimliliğine sahip ve simülasyondan gerçek ortama ek aktarım modellemesine ihtiyaç duymadan doğrudan aktarılabilen derin pekiştirmeli öğrenmeye dayalı bir eklem empedans denetleyicisi geliştirmektir(Aractingi et al., 2023).
İnceleme ve modelleme yöntemi
Bu çalışmada, Raisim fizik simülasyon ortamında eğitilen derin pekiştirmeli öğrenme politikalarının, eklem empedans referanslarını kullanarak Solo12 dört bacaklı robotu üzerinde uçtan uca kontrolünün sağlanması yöntemi benimsenmiştir. Politika ağı tarafından üretilen eklem açısı hedef yer değiştirmeleri, düşük seviyeli bir oransal türevsel (PD) denetleyici yardımıyla motor torklarına dönüştürülmüştür(Aractingi et al., 2023).
Kuramsal ve kavramsal çerçeve
Çalışma, sürekli durum ve eylem alanlarına sahip Markov Karar Süreci (MDP) kuramsal çerçevesine dayanmaktadır. Politika ağacının optimizasyonunda Yakınsal Politika Optimizasyonu (PPO) algoritması kullanılmıştır. Eylem alanı doğrudan tork üretmek yerine, nominal eklem pozisyonlarına göre yer değiştirmeleri belirleyen empedans tabanlı Proportional-Derivative (PD) denetim mekanizmasıyla modellenmiştir. Gerçek robot üzerindeki doğrusal hız tahmini ise denetim politikasından bağımsız olarak eğitilen gözetimli bir taban hız tahmin ağı üzerinden yürütülmektedir.
Makalenin ele aldığı literatür
Çalışmada ANYmal, Mini-Cheetah, HyQ ve Solo gibi robot platformlarında kullanılan model tabanlı optimizasyon teknikleri (Bellicoso vd., DiCarlo vd., Kim vd., Léziart vd.) incelenmiştir. Ayrıca pekiştirmeli öğrenmenin robotik harekete uygulanmasında simülasyon aktarımı sağlayan dinamik rastgeleleştirme, durum tahmini ve merkezi desen üreteci (CPG) entegrasyonu üzerine yapılan önceki araştırmalar (Hwangbo vd., Miki vd., Lee vd., Ji vd.) ele alınmıştır. Çalışma, eyleyici karmaşıklığını ve eyleyici modelleme ihtiyacını azaltan yaklaşımıyla mevcut robotik pekiştirmeli öğrenme literatüründen ayrılmaktadır.
Araştırma Tasarımı
- Evren veya inceleme alanı
- Solo12 dört bacaklı robotik platformu ve Raisim çok gövdeli fizik simülasyonu ortamı
- Örneklem veya araştırma materyali
- 12 serbestlik dereceli, tork kontrollü, hafif yapılı Solo12 dört bacaklı robotu ile 300 paralel robot simülasyon süreci
- Veri toplama süreci
- Simülasyonda 300 paralel robot ile 10.000 eğitim iterasyonunda toplanan 300 milyon veri adımı, 50.000 adımdan oluşan durum tahmin veri seti ve gerçek dünyada hareket yakalama ile IMU sensörlerinden elde edilen telemetri verileri
- Veri analiz yöntemi
- Yakınsal Politika Optimizasyonu (PPO) gradyan güncellemeleri, durum tahmin ağı için Adam optimizasyonu ile ortalama karesel hata (MSE) analizi, yürüyüş frekanslarını belirlemek amacıyla ortak eklem yörüngelerine uygulanan Hızlı Fourier Dönüşümü (FFT) ve Fadini güç modeli hesaplamaları
Araştırmanın Bulguları
Geliştirilen pekiştirmeli öğrenme tabanlı uçtan uca kontrolör, Solo12 robotunun gerçek ortamdaki hız takip performansını yüksek doğrulukla yerine getirmesini sağlamış ve bu durum hareket yakalama verileriyle doğrulanmıştır(Aractingi et al., 2023).
Durum ve dinamik rastgeleleştirme süreçlerinde uygulanan aşamalı gürültü müfredatı, kontrol politikasının simülasyondaki ideal koşullardan gerçek dünyadaki fiziksel sapmalara ve gürültülere uyum sağlamasını kolaylaştırmıştır(Aractingi et al., 2023).
Robotun ilerleme hızı ile bacak adım frekansı arasında eğitim sürecinde kendiliğinden gelişen doğrusal bir ilişki keşfedilmiş olup, bu dinamik uyarlama dışarıdan elle kodlanmış bir kural olmaksızın pekiştirmeli öğrenme ile elde edilmiştir(Aractingi et al., 2023).
Fiziksel modeldeki kaçınılmaz eksikliklere ve aktüatör gürültülerine rağmen, geliştirilen kontrol politikaları simülasyondan gerçek Solo12 robotuna hiçbir ek aktarım modellemesine ihtiyaç duymadan ilk denemede başarıyla aktarılmıştır(Aractingi et al., 2023).
Bulguların Tartışılması ve Araştırmanın Sonucu
Bulguların Yazarlar Tarafından Yorumlanışı
Çalışmada elde edilen bulgular, derin pekiştirmeli öğrenme ile eğitilen eklem empedans kontrolörlerinin Solo12 quadruped robotu üzerinde son derece dayanıklı ve kararlı bir hareket kabiliyeti ürettiğini göstermektedir. Geliştirilen uçtan uca ağ yapısı, robotun iç mekanlardaki düz zeminlerden dış mekanlardaki çakıl, çim ve eğimli arazilere kadar geniş bir yelpazede kararlı adımlar atmasını mümkün kılmıştır.
Yazarlar, simülasyon ortamı ile gerçek dünya arasındaki fiziksel uyumsuzlukların (sim-to-real gap) aşılması için ayrıntılı bir aktüatör modeli çıkarmak yerine, durumlara ve kontrolör kazançlarına aşamalı gürültü ekleyen bir müfredat öğrenimi tasarlamışlardır. Bu durum, Solo12 platformunun sahip olduğu düşük ataletli ve yüksek bant genişliğine sahip aktüatör yapısı sayesinde, basit rastgeleleştirme yöntemlerinin dahi başarılı bir sıfırıncı saniye (zero-shot) transferi gerçekleştirmek için yeterli olduğunu açıklamaktadır.
Elde edilen sonuçlar, literatürdeki benzer çalışmalarla karşılaştırıldığında önemli metodolojik katkılar barındırmaktadır. Örneğin, robotun durum tahmini ve kontrol ağlarının eş zamanlı olarak eğitilmesi yerine, durum tahmininin kontrol politikasından bağımsız olarak ardışık eğitilmesinin, simülasyon hızını düşürmeden ve performanstan ödün vermeden işlem maliyetlerini azalttığı deneysel olarak ortaya konmuştur.
Son olarak, literatürde tork, hız ve ivme için ayrı ayrı cezalandırma terimleri kullanılması yerine, Joule ısınması ve mekanik sürtünme kayıplarını birleştiren tek bir fiziksel güç cezası fonksiyonunun entegre edilmesi tartışılmıştır. Bu yaklaşım, sadece hiperparametre optimizasyonunu kolaylaştırmakla kalmamış, aynı zamanda robotun hız takip hassasiyetinde çok küçük sapmalar karşılığında yüzde otuzun üzerinde enerji tasarrufu yapmasını sağlayan yürüyüş stillerini başarıyla türetmiştir.
Bulguların Önceki Araştırmalarla Karşılaştırılması
Yazarlar, durum tahmini ve kontrol ağlarının eş zamanlı olarak eğitilmesini öneren Ji ve ark. (2022) yönteminin aksine, bu çalışmada iki ağın ardışık eğitilmesinin öğrenme hızını yavaşlatmadığını ve eş zamanlı eğitime kıyasla herhangi bir performans kaybı yaratmadığını deneysel olarak ortaya koymuşlardır(Aractingi et al., 2023).
Yazarlar, ANYmal gibi robotlarda simülasyondan gerçeğe aktarım için ayrıntılı eyleyici dinamiklerinin öğrenilmesini zorunlu kılan Hwangbo ve ark. (2019) yaklaşımının aksine, Solo12 gibi yüksek bant genişliğine sahip hafif robotlarda basit durum ve dinamik rastgeleleştirmenin doğrudan aktarım için yeterli olduğunu savunmaktadır(Aractingi et al., 2023).
Sonuç Bölümünün Sunduğu Çıkarımlar
Araştırmacılar, Solo12 quadruped robotu için geliştirdikleri derin pekiştirmeli öğrenme tabanlı uçtan uca kontrolörün, simülasyondan gerçek dünyaya doğrudan ve başarılı bir şekilde aktarılabildiğini; ayrıca eyleyici sürtünmesi ve Joule kayıplarını birleştiren fiziksel bir güç cezası terimi eklenerek, hız takibinde küçük ödünlerle yüzde 30'un üzerinde enerji tasarrufu sağlayan enerji verimli hareket politikalarının elde edilebildiğini ortaya koymuştur(Aractingi et al., 2023).
Literatür Taraması İçin Sunduğu Çerçeve
Bu çalışma, bacaklı robotik sistemlerin dinamik yürüyüş yeteneklerini geliştirmeyi hedefleyen literatürde, klasik model öngörülü denetim (MPC) yaklaşımları ile veri güdümlü pekiştirmeli öğrenme (RL) yöntemleri arasında sağlam bir ampirik köprü kurmaktadır. Geleneksel yörünge optimizasyonlarının yüksek hesaplama yükü, karmaşık modelleme ihtiyaçları ve çevreye uyum zorluklarına karşın, uçtan uca öğrenme tabanlı bir eklem empedans kontrolörünün pratik ve kararlı bir alternatif olduğunu gösterir. Çalışma, simülasyon ortamından gerçek fiziksel sisteme aktarımda karşılaşılan uyuşmazlıkları (sim-to-real gap) aşmak için hafif ve yüksek bant genişliğine sahip Solo12 robotik donanımının dinamik özelliklerini avantaja çeviren sade bir rastgeleleştirme yaklaşımı önermektedir. Bu yönüyle literatürdeki aşırı karmaşık aktüatör modellemelerine olan ihtiyacı azaltmaktadır.
Çalışma, ANYmal ve Mini-Cheetah gibi platformlarda yürütülen öncü pekiştirmeli öğrenme tabanlı hareket denetimi çalışmalarını (örneğin Hwangbo vd., Miki vd. ve Ji vd. çalışmaları) doğrudan temel almaktadır. Ancak bu çalışmalarda kullanılan doğrudan tork denetimi yerine, kararlılığı artıran eklem empedans referanslarının (konum tabanlı empedans kontrolü) öğrenilmesini önermekte ve bu yolla metodolojik olarak ayrışmaktadır. Ayrıca önceki literatürde yaygın olan durum tahmini ve kontrol politikalarının eş zamanlı eğitilmesi yaklaşımının yarattığı yüksek işlem yükünü eleştirerek, durum tahmin ağının bağımsız bir denetimli öğrenme süreciyle ardışık olarak eğitilmesini savunur. Enerji tasarrufu sağlamak adına literatürde tork, hız ve ivme terimlerinin ayrı ayrı cezalandırıldığı sezgisel yaklaşımlar yerine, motorların Joule ve sürtünme kayıplarını birleştiren tek bir fiziksel güç kaybı cezası önermektedir.
Bu makale, robotik hareket kontrolü üzerine yapılacak literatür taramalarına (review) çok yönlü bir metodolojik katkı sunmaktadır. İlk olarak, pekiştirmeli öğrenmede ödül fonksiyonu tasarımı (reward design) yaparken fiziksel kısıtların ve enerji verimliliğinin nasıl formüle edileceğini somut, fiziksel temelli bir güç kaybı denklemiyle standartlaştırmaktadır. İkinci olarak, simülasyondan gerçek dünyaya aktarımda (zero-shot transfer) aşamalı gürültü müfredatı (noise curriculum) kullanımının deneysel başarısını ortaya koyarak bu tekniğin etkinliğini ampirik olarak doğrulamaktadır. Üçüncü olarak, açık kaynak kodlu ve erişilebilir bir platform olan Solo12 quadruped robotunun kontrol çalışmalarındaki standardizasyon potansiyelini doğrulayarak, pahalı ve kapalı ticari robotlara olan bağımlılığı azaltacak alternatif bir bilimsel araştırma yolu açmaktadır.
Kaynakça
- Ji, G., Alatur, N., Guzzella, L. (2022). Concurrent reinforcement learning and state estimation for quadruped robots. IEEE Robotics and Automation Letters, 7(4), 10111-10118.
- Hwangbo, J., Sa, I., Siegwart, R. (2019). Learning agile and dynamic motor skills for quadrupedal robots. Science Robotics, 4(26), eaau5872.
Tez ve Makale Araştırmalarında Kullanım
Makalenin doğrulanmış yöntemi, bulguları ve kuramsal çerçevesi; tez ve makale çalışmalarında kullanılacağı bölümle birlikte aşağıdaki üç araştırma taslağına dönüştürülmüştür.
Tez veya makalede kullanım · Kavramsal çerçeve
Dört bacaklı robotik sistemlerde uçtan uca pekiştirmeli öğrenme temelli denetleyicilerin doğrudan gerçek robota aktarımında donanım özelliklerinin sim-to-real boşluğunu azaltmadaki etkisi tartışılabilir.
Robotun fiziksel dinamiklerinin sim-to-real aktarım kolaylığına katkısı tartışılırken, Solo12 platformunun hızlı dinamikleri sayesinde basit rastgeleleştirme ile doğrudan aktarılabildiği kanıt olarak sunulacaktır(Aractingi et al., 2023).
Farklı Zemin Pürüzlülüklerinde Dört Bacaklı Robotların Güç Tüketim Profillerinin Karşılaştırmalı Analizi
- Araştırma sorusu
- Farklı zemin tiplerinde (kum, çakıl, çim) fiziksel güç cezasıyla eğitilmiş empedans kontrolörünün enerji tasarrufu performansı nasıl değişmektedir?
- Yöntem taslağı
- Deneysel tasarımda, Solo12 veya benzeri bir quadruped robot simülasyon ortamında (Raisim) kum, çakıl ve çim zemin yükseklik haritaları tanımlanarak test edilecektir. Bağımsız değişken olarak güç kaybı katsayısı (c_E) 0 ile 10 arasında değiştirilerek, bağımlı değişkenler olan ortalama güç tüketimi (Watt) ve hız takip hatası ölçülecektir. Örneklem büyüklüğü simüle edilmiş 100 farklı deneme serisi ile belirlenecektir. Veriler ANOVA testi ile analiz edilecektir.
Makaleyle bağlantısı: Makalede c_E katsayısının artırılmasının güç tüketimini azalttığı fakat hız hatasını artırdığı bulgulanmıştır. Bu durumun farklı dış zemin pürüzlülüklerinde nasıl ölçeklendiği makalede açık bırakılmıştır(Aractingi et al., 2023).
Tez veya makalede kullanım · literatüre-review
Quadruped robotların enerji verimli hareket yetenekleri kazanmasında, fiziksel motor kayıplarını ve mekanik sürtünmeleri birleştiren güç cezası formülasyonlarının etkisi yüksektir.
Geleneksel tork, hız ve ivme cezaları yerine fiziksel tabanlı güç kaybı formülasyonunun tercih edilmesinin hem enerji tasarrufu hem de hiperparametre optimizasyon kolaylığı sağladığı iddiasını desteklemek için kullanılır(Aractingi et al., 2023).
Aşamalı Gürültü Müfredatının Sim-to-Real Aktarım Başarısına Etkisinin Nicel Analizi
- Araştırma sorusu
- Durum ve dinamik rastgeleleştirmedeki gürültü müfredatı katsayısının (k_c, noise) artış hızı, robotun gerçek dünyadaki yürüyüş kararlılığını nasıl etkiler?
- Yöntem taslağı
- Kontrollü bir deneysel simülasyon ve fiziksel test tasarımı kurulacaktır. İki farklı grup oluşturulacaktır: Birinci grupta gürültü doğrusal ve hızlı artırılacak, ikinci grupta ise makaledeki gibi yavaş bir gürültü müfredatı uygulanacaktır. Gerçek robot üzerinde 20'şer deneme yapılarak gövde yalpalaması (roll-pitch sapmaları) ve düşme frekansları ölçülecektir. Grup karşılaştırmaları t-testi ile yapılacaktır.
Makaleyle bağlantısı: Makalede gürültü müfredatının sim-to-real transferini kolaylaştırdığı belirtilmiş, ancak bu gürültünün artış hızının veya profillerinin transfer başarısı üzerindeki hassas sınırları araştırılmamıştır(Aractingi et al., 2023).
Tez veya makalede kullanım · method
Dört bacaklı robotların hareket denetiminde pekiştirmeli öğrenme modellerinin sınır ağı mimarisi tasarımı ve çalışma frekanslarının belirlenmesinde empedans tabanlı denetleyiciler tercih edilmelidir.
Çalışmada önerilen 3 gizli katmanlı MLP (256, 128, 32) mimarisi ve 100Hz frekanstaki kontrol döngüsünün yöntemsel kurulumunu temellendirmek için referans gösterilir(Aractingi et al., 2023).
Sıralı Durum Tahmini ile Eş Zamanlı Durum Tahminin Hesaplama Maliyeti ve Politika Yakınsaması Bakımından Karşılaştırılması
- Araştırma sorusu
- Durum tahmin ağının kontrol politikasıyla eş zamanlı eğitilmesi ile sıralı (ardışık) eğitilmesinin eğitim yakınsama hızı ve tahmin doğruluğu üzerindeki etkisi nedir?
- Yöntem taslağı
- İki farklı yazılımsal eğitim mimarisi tasarlanacaktır: Biri durum tahminini ve kontrol politikasını eş zamanlı optimize eden uçtan uca mimari, diğeri ise makalede önerilen sıralı eğitim mimarisidir. Her iki yaklaşım 10 farklı rastgele başlangıç tohumu (seed) ile 10.000 iterasyon boyunca eğitilecektir. Bağımlı değişkenler olarak toplam eğitim süresi (saat), ortalama ödül yakınsama hızı ve tahmin edilen hız ile gerçek hız arasındaki MSE hatası ölçülüp karşılaştırılacaktır.
Makaleyle bağlantısı: Yazarlar, durum tahmin ağının sıralı olarak eğitilmesinin performanstan ödün vermeden RL eğitimini hızlandırdığını savunmuş ancak bunu nicel olarak karşılaştıran ayrıntılı bir deney sunmamışlardır(Aractingi et al., 2023).