Dört bacaklı robotik sistemlerin karmaşık arazilerde dinamik hareket kabiliyeti sergilemesi, modern robotik araştırmalarının en kritik konuları arasında yer almaktadır. Geleneksel Yörünge Optimizasyonu ve Model Öngörülü Denetim (MPC) yöntemleri yüksek fiziksel doğruluk sağlasa da, çevre koşullarına uyarlanması gereken çok sayıda elle ayarlanmış parametre içermekte ve yüksek anlık hesaplama maliyetleri gerektirmektedir. Son dönemde veri odaklı bir alternatif olarak öne çıkan derin pekiştirmeli öğrenme yaklaşımları ise simülasyon ortamındaki fiziksel model ile gerçek dünya arasındaki uyumsuzluktan kaynaklanan sim-to-real aktarım engellerine takılmaktadır. Bu çalışma, açık kaynaklı Solo12 robot platformunda simülasyondan gerçeğe aktarım hatasını ek eyleyici modellemesine gerek kalmadan çözen ve enerji verimliliği yüksek bir uçtan uca denetim mimarisi geliştirmeyi amaçlamaktadır.
Çalışmanın temel amacı, Solo12 robotunun kullanıcı tarafından iletilen 3 boyutlu hız komutlarını hassasiyetle takip etmesini sağlayan, Yakınsal Politika Optimizasyonu (PPO) tabanlı bir empedans denetleyicisi tasarlamaktır. Yöntem kapsamında, Markov Karar Süreci durum alanı robotun öz duyusal verileri, eklem açıları, hızları, geçmiş hata sinyalleri ve IMU ölçümleriyle oluşturulmuştur. Doğrudan tork denetimi yerine esnek bir yay-sönümleyici davranışı sergileyen eklem açısı hedef değişimleri eğitilmiştir. Eğitim sürecinde ödül fonksiyonuna Coulomb ve viskoz sürtünme ile Joule ısı kayıplarını hesaplayan fiziksel bir enerji cezası eklenmiştir. Ayrıca, eğitimin kararlılığını ve aktarılabilirliğini sağlamak amacıyla ödül, gürültü ve arazi zorluğuna dayalı kademeli müfredat öğrenimi (curriculum learning) ve alan rastgeleleştirmesi uygulanmıştır.
Deneysel bulgular, geliştirilen denetim politikasının Solo12 robotunu hem simülasyonda hem de gerçek dünyada başarıyla yönlendirebildiğini göstermiştir. Robot, Raspberry Pi 4 donanımı üzerinde yalnızca 10 mikrosaniyelik hesaplama süresiyle 100 Hz frekansta denetim kararları üretebilmiştir. Fiziksel enerji cezası ağırlığının artırılmasıyla, hız takip hassasiyetinde minimal bir kayıpla toplam enerji tüketiminde %30'un üzerinde tasarruf sağlanmıştır. Ayrıca yürüyüş frekansının komut edilen doğrusal hız ile orantılı olarak kendiliğinden adapte olduğu tespit edilmiştir. Alan ve dinamik rastgeleleştirmesi sayesinde, eyleyici bant genişliği veya karmaşık motor modelleri eklenmeksizin ilk denemede başarılı bir sim-to-real aktarımı gerçekleştirilmiştir.
Elde edilen sonuçlar, derin pekiştirmeli öğrenme modellerinde fizik tabanlı enerji kaybı cezalarının kullanılmasının ve durum geçmişinin doğru eklenmesinin aktarım başarısındaki rolünü kanıtlamaktadır. Literatürdeki diğer ANYmal veya Mini-Cheetah uygulamalarından farklı olarak, Solo12 platformunun hafif yapısı ve yüksek bant genişlikli eyleyicileri sayesinde karmaşık motor modeli öğrenme zorunluluğunun ortadan kalktığı gösterilmiştir. Bu çalışma, açık kaynaklı robotik topluluğu için hem üretilebilir hem de düşük hesaplama maliyetli bir kontrol altyapısı sunmaktadır. Gelecek araştırmalarda model tabanlı MPC denetleyicileri ile derin pekiştirmeli öğrenmenin doğrudan karşılaştırılması ve daha zorlu engebeli alanlarda robot performansının sınanması önerilmektedir.
Araştırmanın amacı
Bu çalışmanın temel amacı, açık kaynaklı Solo12 dört bacaklı robotu için uçtan uca çalışan, kullanıcının hız komutlarını takip eden, yüksek enerji verimliliğine sahip ve simülasyondan gerçek ortama ek aktarım modellemesine ihtiyaç duymadan doğrudan aktarılabilen derin pekiştirmeli öğrenmeye dayalı bir eklem empedans denetleyicisi geliştirmektir(Aractingi et al., 2023).
İnceleme ve modelleme yöntemi
Bu çalışmada, Raisim fizik simülasyon ortamında eğitilen derin pekiştirmeli öğrenme politikalarının, eklem empedans referanslarını kullanarak Solo12 dört bacaklı robotu üzerinde uçtan uca kontrolünün sağlanması yöntemi benimsenmiştir. Politika ağı tarafından üretilen eklem açısı hedef yer değiştirmeleri, düşük seviyeli bir oransal türevsel (PD) denetleyici yardımıyla motor torklarına dönüştürülmüştür(Aractingi et al., 2023).
Kuramsal ve kavramsal çerçeve
Çalışma, sürekli durum ve eylem alanlarına sahip Markov Karar Süreci (MDP) kuramsal çerçevesine dayanmaktadır. Politika ağacının optimizasyonunda Yakınsal Politika Optimizasyonu (PPO) algoritması kullanılmıştır. Eylem alanı doğrudan tork üretmek yerine, nominal eklem pozisyonlarına göre yer değiştirmeleri belirleyen empedans tabanlı Proportional-Derivative (PD) denetim mekanizmasıyla modellenmiştir. Gerçek robot üzerindeki doğrusal hız tahmini ise denetim politikasından bağımsız olarak eğitilen gözetimli bir taban hız tahmin ağı üzerinden yürütülmektedir.
Makalenin ele aldığı literatür
Çalışmada ANYmal, Mini-Cheetah, HyQ ve Solo gibi robot platformlarında kullanılan model tabanlı optimizasyon teknikleri (Bellicoso vd., DiCarlo vd., Kim vd., Léziart vd.) incelenmiştir. Ayrıca pekiştirmeli öğrenmenin robotik harekete uygulanmasında simülasyon aktarımı sağlayan dinamik rastgeleleştirme, durum tahmini ve merkezi desen üreteci (CPG) entegrasyonu üzerine yapılan önceki araştırmalar (Hwangbo vd., Miki vd., Lee vd., Ji vd.) ele alınmıştır. Çalışma, eyleyici karmaşıklığını ve eyleyici modelleme ihtiyacını azaltan yaklaşımıyla mevcut robotik pekiştirmeli öğrenme literatüründen ayrılmaktadır.
Araştırma Tasarımı
- Evren veya inceleme alanı
- Solo12 dört bacaklı robotik platformu ve Raisim çok gövdeli fizik simülasyonu ortamı
- Örneklem veya araştırma materyali
- 12 serbestlik dereceli, tork kontrollü, hafif yapılı Solo12 dört bacaklı robotu ile 300 paralel robot simülasyon süreci
- Veri toplama süreci
- Simülasyonda 300 paralel robot ile 10.000 eğitim iterasyonunda toplanan 300 milyon veri adımı, 50.000 adımdan oluşan durum tahmin veri seti ve gerçek dünyada hareket yakalama ile IMU sensörlerinden elde edilen telemetri verileri
- Veri analiz yöntemi
- Yakınsal Politika Optimizasyonu (PPO) gradyan güncellemeleri, durum tahmin ağı için Adam optimizasyonu ile ortalama karesel hata (MSE) analizi, yürüyüş frekanslarını belirlemek amacıyla ortak eklem yörüngelerine uygulanan Hızlı Fourier Dönüşümü (FFT) ve Fadini güç modeli hesaplamaları
derin pekiştirmeli öğrenmeeklem empedans kontrolüdurum tahminisimülasyondan gerçeğe aktarım (sim-to-real)müfredat öğrenimi (curriculum learning)enerji verimliliğiSolo12 robotu
01Geliştirilen pekiştirmeli öğrenme tabanlı uçtan uca kontrolör, Solo12 robotunun gerçek ortamdaki hız takip performansını yüksek doğrulukla yerine getirmesini sağlamış ve bu durum hareket yakalama verileriyle doğrulanmıştır(Aractingi et al., 2023).
02Durum ve dinamik rastgeleleştirme süreçlerinde uygulanan aşamalı gürültü müfredatı, kontrol politikasının simülasyondaki ideal koşullardan gerçek dünyadaki fiziksel sapmalara ve gürültülere uyum sağlamasını kolaylaştırmıştır(Aractingi et al., 2023).
03Robotun ilerleme hızı ile bacak adım frekansı arasında eğitim sürecinde kendiliğinden gelişen doğrusal bir ilişki keşfedilmiş olup, bu dinamik uyarlama dışarıdan elle kodlanmış bir kural olmaksızın pekiştirmeli öğrenme ile elde edilmiştir(Aractingi et al., 2023).
04Fiziksel modeldeki kaçınılmaz eksikliklere ve aktüatör gürültülerine rağmen, geliştirilen kontrol politikaları simülasyondan gerçek Solo12 robotuna hiçbir ek aktarım modellemesine ihtiyaç duymadan ilk denemede başarıyla aktarılmıştır(Aractingi et al., 2023).