본문 바로가기
기술보고서

저고도 장기체공(LALE) 무인기 개발을 위한 기체 설계 및 환경 에너지 활용 제어 알고리즘 심층 분석

by 파서스에어로스페이스 2026. 8. 8.

1. 서론

무인기(Unmanned Aerial Vehicle, UAV) 산업이 고도화됨에 따라 정찰, 통신 중계, 환경 감시, 수색 및 구조 등 다양한 임무에서 저고도 장기체공(Low-Altitude Long-Endurance, LALE) 무인기의 수요가 급증하고 있다. 일반적으로 20~40분 내외의 짧은 고강도 임무에 초점을 맞추는 상용 무인기와 달리, 장기체공 무인기는 수 시간에서 수 주일에 이르는 연속적인 비행을 목표로 설계된다1. 전통적인 LALE 무인기는 고용량 리튬 배터리나 가솔린-전기 하이브리드 발전기를 탑재하여 체공 시간을 늘려왔으나, 탑재 중량(Payload)의 한계와 배터리의 에너지 밀도 한계로 인해 완전한 영구 체공(Perpetual Flight)을 달성하는 데에는 근본적인 제약이 존재한다1. 극단적인 체공을 위해 태양광 전지판을 결합한 Zephyr나 AtlantikSolar와 같은 고고도/저고도 태양광 무인기들이 14일 이상의 비행 기록을 달성하기도 했으나, 기상 조건과 일조량에 크게 의존한다는 한계가 있다4.

 

이러한 에너지 공급의 한계를 극복하기 위해 최근 학계와 산업계에서는 태양광 에너지 획득뿐만 아니라 대기 중의 바람(열용승 기류, 윈드 시어, 돌풍 등)이 가진 운동 에너지와 위치 에너지를 능동적으로 수확하여 비행에 필요한 에너지를 충당하는 '환경 에너지 활용(Environmental Energy Harvesting)' 비행 기법이 핵심 연구 분야로 대두되고 있다7. 알바트로스와 같은 조류의 비행 원리에서 착안한 이 기법은 무인기가 추가적인 동력 소모 없이도 장거리를 이동하거나 좁은 구역에 머물 수 있게 한다11.

 

특히 국경 감시나 재난 현장 모니터링과 같이 특정 위치 주변을 로이터링(Loitering)하는 임무를 수행할 때, 무인기는 지정된 상하좌우 공간 범위(Geofence, 지오펜스)를 이탈하지 않아야 하는 엄격한 공간적 제약(Spatial Margin)을 지닌다13. 한정된 공간 내에서 바람 에너지를 최대한 수확하면서도 비행 영역을 벗어나지 않도록 제어하는 것은 고도의 공기역학적 기체 설계, 실시간 비선형 궤적 제어, 공간 제약을 엄격히 보장하는 제어 방벽 함수(Control Barrier Functions, CBF), 그리고 복잡한 난류 환경에서도 최적의 결정을 내릴 수 있는 심층 강화학습(Deep Reinforcement Learning, DRL) 알고리즘의 유기적인 융합을 요구한다15.

 

본 보고서는 제한된 지오펜스 내에서 로이터링 임무를 수행하는 LALE 무인기의 개발을 위해, 극한의 효율과 내구성을 추구하는 공기역학적 기체 설계 방법론, 바람 에너지를 수확하는 고전적 제어 알고리즘(동적 활공 및 열용승 비행), 공간 제약을 보장하는 안전 필터 알고리즘, 그리고 불확실한 대기 환경에서 자율적 의사결정을 수행하는 강화학습 알고리즘의 적용 방안을 심층적으로 분석한다.

 

2. 장기체공 무인기의 기체 설계 및 공기역학적 최적화

바람 에너지를 활용하여 영구 체공에 가까운 비행을 달성하기 위해서는 잉여 동력 없이도 체공이 가능한 고효율 활공(Gliding) 능력이 필수적이다. 따라서 LALE 무인기는 멀티로터(Multi-rotor) 형태가 아닌 고정익(Fixed-wing) 플랫폼으로 설계되며, 높은 양항비(Lift-to-Drag ratio, L/D)와 낮은 추력대중량비(Thrust-to-weight ratio), 그리고 뛰어난 공기역학적 효율성을 최우선 목표로 한다2.

 

2.1. 무인기의 고도 및 체공 시간에 따른 분류와 LALE의 특성

무인기는 운용 고도와 체공 시간에 따라 크게 저고도(LALE), 중고도(MALE), 고고도(HALE)로 분류된다. 고도 프로필은 기체의 공기역학, 체공 효율성, 탑재체 구성 및 규제 요건에 결정적인 영향을 미친다1.

 

분류 (Category) 고도 (Altitude) 익면하중 (Wing Loading, kg/m2) 체공 시간 (Endurance) 임무 특성 및 대표 사례
LALE (Low Altitude Long Endurance) 5,000 ft 이하 낮음 (15~25 이하) 24시간 이상 인프라 검사, 정밀 농업, 국지적 정찰, 높은 위치 정밀도 요구 (예: AtlantikSolar, Phantom)
MALE (Medium Altitude Long Endurance) 10,000 ~ 15,000 ft 중간 (100 전후) 24 ~ 48시간 넓은 지역 감시, 전술 정찰, 무장 탑재 가능 (예: MQ-9 Reaper)
HALE (High Altitude Long Endurance) 20,000 ft 이상 높음 (100 이상) 48시간 이상 광역 감시, 통신 중계, 성층권 비행 (예: Global Hawk, Zephyr)

 

저고도 장기체공(LALE) 무인기는 정밀한 데이터 획득과 근접 작전이 요구되는 환경에서 운용되므로, 고고도의 극한 환경을 견디는 것보다는 기류의 변화(돌풍, 열기류 등)에 기민하게 반응하고 안정적인 호버링(또는 선회) 성능을 발휘하는 데 최적화되어야 한다1. LALE 무인기는 종종 태양광 에너지를 주 동력원으로 사용하는데, 기체의 총 이륙 중량(Maximum Take-Off Weight, MTOW) 중 배터리가 차지하는 질량 비율을 세밀하게 조율해야 한다. 예를 들어 SkySailor는 전체 질량의 25%, AtlantikSolar는 42%를 배터리에 할당하여 야간 비행을 대비한다8. 하지만 배터리 용량의 증가는 기체 중량의 증가를 의미하며, 이는 필연적으로 순항 속도의 증가와 더 큰 모터 출력을 요구하게 되어 잉여 에너지 소모를 초래할 수 있다8.

 

2.2. 공력 레이아웃 및 저 레이놀즈 수 익형(Airfoil) 최적화

고도 5km 이하의 저고도에서 운용되는 소형 LALE 무인기는 상대적으로 느린 비행 속도로 인해 낮은 레이놀즈 수(Low Reynolds Number, 대략 \(1.65\times 10^5\)수준) 환경에 놓이게 된다3. 이러한 유체 역학적 환경에서는 날개 표면에서 층류 박리 기포(Laminar Separation Bubble)가 쉽게 발생하여 항력이 급증하고 양력이 급감하는 실속(Stall) 현상이 빈번하게 일어난다3.

 

이를 방지하고 높은 효율을 달성하기 위해 유전 알고리즘(Genetic Algorithm, GA)과 CST(Class Shape Transformation) 매개변수화 기법을 결합한 익형 및 3D 날개 형상 최적화가 널리 사용된다4. 최적화 알고리즘은 날개의 스팬, 코드, 수평/수직 꼬리 날개의 기하학적 형상 등 약 17개의 설계 변수를 동시에 처리하며, 주어진 정적 여유(Static Margin) 조건을 만족하면서 양항비를 극대화하는 형태를 산출한다4. 태양광-활공 융합 무인기를 위해 설계된 KAYABU 익형이나 SD7037 익형에 대한 연구는 이러한 최적화의 중요성을 잘 보여준다. 기존 표준 익형(W.E 3.55-9.3)과 비교하여 KAYABU 익형은 양항비를 1.2% 증가시키고 파워 팩터(Power factor)를 16.5% 향상시켰을 뿐만 아니라, 실속 받음각(Stall angle)을 40% 이상 개선하여 급격한 바람 환경에서도 우수한 자세 제어 성능을 입증하였다3. 익형의 변화는 리브(Rib)와 날개 스킨의 무게 변화로 직결되므로, 기체 질량 추정 모델은 익형 형상 변화로 인한 추가적인 구조적 중량까지 고려하여 설계되어야 한다5.

 

2.3. 익면하중(Wing Loading) 최적화와 구조적 하중 한계 극복

바람의 속도 구배(Wind Gradient)를 가로지르며 비행하는 동적 활공(Dynamic Soaring)은 필연적으로 급격한 선회 기동과 상승/하강을 동반한다. 이때 무인기는 순간적으로 가속되며 날개 구조물에 극심한 물리적 압박을 가한다. 정기적인 순항 비행 시 무인기는 1g의 하중(Load factor)을 경험하지만, 극한의 동적 활공 상태(예: 시속 300마일 이상의 궤적 비행)에서는 뱅크각(Bank angle)이 88도에 달하며 기체에 가해지는 가속도가 중력의 30배(30g) 수준까지 폭증할 수 있다12.

 

따라서 LALE 무인기의 설계에는 가벼우면서도 강성이 높은 탄소섬유 복합재를 주 날개 스파(Spar)에 적용하는 것이 필수적이다. 익면하중(Wing Loading, \(W/S\))은 비행체의 실속 속도(\(V_s = \sqrt{\frac{2W}{SC_{Lmax}}}\)) 및 선회 반경과 직결되는 핵심 설계 파라미터이다8. 가벼운 중량과 넓은 익면적을 가질수록 비행 속도를 늦출 수 있어 저속에서 난기류와 상승 기류를 민첩하게 포착하는 데 유리하지만, 역으로 유도 항력(Induced drag)이 속도와 스팬 길이에 반비례하여 급증하는 단점이 존재한다22.

 

최근의 첨단 기체 설계 연구에서는 이러한 상충 관계를 정밀하게 분석하기 위해 ASWING과 같은 공탄성(Aeroelastic) 프레임워크를 활용한다. 6자유도 질점 모델을 넘어 날개의 굽힘 및 비틀림을 모사하는 최대 7단계의 보수적 제약 조건(Conservative constraints)을 추가하여, 플레어 폴딩 날개끝(Flared Folding Wingtips, FFWT)과 결합된 형태의 조인트 윙(Joined Wing)이 구조적 피로를 줄이고 성능을 극대화할 수 있음을 증명하고 있다9. 더 나아가 굽힘 하중을 견디는 날개 스파에 압전 소자(Piezoelectric material)를 삽입하여, 돌풍으로 인한 날개의 진동(Gust alleviation)을 기계적으로 감쇠시킴과 동시에 이를 전기 에너지로 변환하는 형태의 기체 일체형 에너지 획득 기술도 차세대 LALE 설계의 중요한 분기점이 되고 있다26.

 

2.4. 생체 모방형 가변형 날개(Morphing Wing) 기술의 적용

알바트로스와 같은 조류가 윈드 시어를 가로지를 때 날개의 모양과 각도를 실시간으로 변형하여 효율을 극대화하듯, LALE 무인기에도 가변형 날개(Morphing Wing) 기술을 적용하면 동적 활공 효율을 비약적으로 높일 수 있다. 동적 활공 시 무인기는 바람을 안고 상승할 때와 바람을 등지고 하강할 때 완전히 상반된 공기역학적 조건에 직면한다10.

 

비행 위상에 맞춰 날개의 상반각(Dihedral angle), 비틀림각(Twist angle), 후퇴각(Sweep angle)을 유연하게 변경하는 궤적 최적화 연구에 따르면, 날개의 상반각을 고정했을 때(-5도)보다 동적으로 변화시켰을 때 수확하는 총 에너지가 25.43% 증가하였으며, 동적 활공을 유지하기 위해 필요한 대기 최소 풍속 구배(Minimum wind gradient)는 15.56% 감소하는 결과를 보였다28. 즉, 가변형 날개를 도입한 무인기는 약한 바람 조건에서도 에너지를 잃지 않고 활공을 지속할 수 있으며, 이는 고정익 무인기 대비 더 넓고 다변화된 궤적(예: 넓은 반경의 사진 촬영 및 정찰 반경)을 포괄할 수 있음을 시사한다28.

 

 

3. 환경 에너지 획득의 물리적 메커니즘과 로이터링 비행 궤적

특정 위치 주변에서 여유 있는 상하좌우 공간 제약을 지키면서 배터리 소모를 억제하기 위해서는, 자연의 두 가지 주된 에너지원인 열용승 기류(Thermal Updraft)를 활용한 정적 활공과 수평풍의 고도별 속도 차이(Wind Shear)를 이용한 동적 활공을 완벽히 융합하는 궤적 계획 알고리즘이 필수적이다9.

 

3.1. 윈드 시어(Wind Shear)를 활용한 동적 활공(Dynamic Soaring) 로이터링

동적 활공은 고도에 따른 풍속 구배가 존재하는 대기 경계층(Atmospheric Boundary Layer)을 지속적으로 넘나들며 대지속도(Ground speed) 및 기계적 에너지를 추출하는 기법이다7. 이 기법을 이용하면 엔진의 추력 없이도 무인기가 에너지를 점진적으로 축적하여 장시간 고속 비행을 유지할 수 있다9. 무인기가 획득할 수 있는 동적 활공 힘(\(F_{dyn}\))은 질량(\(m\))과 풍속의 변화율(\(\dot{V}_w\)), 피치 각도(\(\gamma\))와 헤딩 각도(\(\psi\))의 함수로 \(F_{dyn}=m\dot{V}_w \cos \gamma \sin \psi\)와 같이 정의된다28.

 

동적 활공의 기본 메커니즘은 로드 레일리(Lord Rayleigh)가 제안한 레일리 사이클(Rayleigh Cycle) 이론을 따르며, 크게 네 단계의 위상으로 나뉜다11.

 

비행 위상 (Flight Phase) 고도 변화 바람과의 관계 에너지 획득 및 궤적 특성
1. 바람을 안고 상승 (Windward Climb) 상승 역풍 (Headwind) 하층의 고속 비행 상태에서 풍속이 강한 상층부로 진입하며 대기속도가 급증하여 위치 에너지와 운동 에너지를 동시 획득11.
2. 상층부 선회 (High-altitude Turn) 유지/미세 상승 측풍 (Crosswind) 전환 획득한 에너지가 정점에 달했을 때 기수를 돌려 바람을 등지는 방향으로 180도 선회 기동11.
3. 바람을 등지고 하강 (Leeward Descent) 하강 배풍 (Tailwind) 상층부에서 하강하며 강한 배풍을 타고 대지속도를 비약적으로 높임11.
4. 하층부 선회 (Low-altitude Turn) 유지 측풍 (Crosswind) 전환 풍속이 느린 하층부(수면 또는 지표 부근)에서 다시 기수를 역풍 방향으로 돌리며 다음 사이클 진입 준비28.

 

특정 지점을 중심으로 비행하는 '로이터 모드(Loiter mode)'의 경우, 초기 위치(\(x_0, y_0, h_0\))와 궤적 1사이클을 마친 최종 위치(\(x_f, y_f, h_f\))가 정확히 일치해야 한다는 제약 조건이 붙는다34. 이러한 제약 속에서 GPOPS-II 등과 같은 비선형 궤적 최적화 도구를 사용하여 O자형 원형 궤적 또는 8자형(Figure-eight) 호버 모드 궤적을 산출한다10.

 

특히, 무인기가 동적 활공을 지속하기 위해 필요한 최소 윈드 시어 구배(Minimum wind gradient)는 기체의 물리적 제원과 밀접한 관련이 있다. 최소 윈드 시어 구배는 익면적, 공기 밀도, 중력 가속도에 비례하며 무인기의 질량에 반비례한다28. 즉, 질량이 큰 무인기일수록 관성을 유지하기 쉬워 더 약한 풍속 구배에서도 활공을 유지할 수 있으나, 선회 시 날개에 가해지는 구조적 하중 인자(Load factor)가 급증한다는 트레이드오프(Trade-off)가 발생한다. 흥미롭게도 태양광 무인기의 경우, 윈드 시어의 풍상측(Windward side)에 태양이 위치할 때 최적화된 O자형 궤적을 비행하면 태양광 입사각 시너지가 극대화되어 종합 에너지 획득량이 증가함이 확인되었다7.

 

3.2. 열용승 기류(Thermal Updraft) 추적 및 순환 비행 알고리즘

동적 활공이 윈드 시어를 가로지르는 비행이라면, 열용승 기류(Static Soaring)는 지표면의 불균일한 가열로 인해 발생하는 상승 기류의 파이프를 타고 고도를 높이는 기법이다30. LALE 무인기가 열용승 기류를 능동적으로 활용하기 위해 개발된 대표적인 알고리즘으로 오픈소스 오토파일럿에 통합된 ArduSoar가 있다35.

 

열기류 비행은 탐지(Detection), 식별(Identification), 착취(Exploitation), 이탈(Exit)의 네 단계로 나뉜다35. 무인기는 기압계와 피토관에서 계측되는 수직 대기 속도(Variometer data)와 기체의 고유 하강률(Polar curve)을 실시간으로 비교한다. 무인기 주위의 공기가 정지해 있다면 무인기는 Polar curve에 명시된 자연 침하율(Natural sink rate)에 따라 하강해야 하지만, 계측된 하강률이 예상 침하율보다 적거나 고도가 상승한다면 이는 무인기가 열기류 내부에 진입했음을 의미한다35. 이러한 데이터가 탐지되면 알고리즘은 확장 칼만 필터(Extended Kalman Filter, EKF)를 통해 열기류 중심의 2차원 좌표(\(x, y\))와 반경(\(\hat{R}\))을 실시간으로 추정한다35. 이후 무인기는 LOITER 모드로 전환하여, 추정된 열기류의 중심을 기준으로 지속적인 선회 비행을 실시하며 고도를 끌어올린다35. 고도 한계선(상단 지오펜스)에 도달하거나, 열기류가 소산되어 무인기의 하강률이 다시 상승률을 초과하면 이탈 모드로 전환하여 원래의 감시 임무를 재개한다35.

 

3.3. 온보드(On-board) 실시간 바람장 추정(Wind Field Estimation) 알고리즘

환경 에너지를 효과적으로 수확하기 위해서는 현재 무인기 주변의 3차원 바람장(Wind field) 지도를 정확히 파악해야 한다. 소형 무인기에는 전방의 풍속을 입체적으로 관측할 수 있는 라이다(LiDAR)와 같은 무거운 센서를 탑재할 수 없으므로, 온보드 오토파일럿의 관성측정장치(GPS/INS)와 대기속도계 데이터를 융합하여 간접적으로 바람 벡터를 실시간 계산해야 한다37.

 

관성 계를 기준으로 한 3차원 바람 벡터(\(w_{ix}, w_{iy}, w_{iz}\))는 지면 속도 벡터(\(\dot{x}, \dot{y}, \dot{z}\))와 무인기의 대기속도(\(v_a\)), 피치(\(\gamma\)), 롤/옆미끄럼각(\(\beta\)), 헤딩(\(\psi\))의 기하학적 관계를 통해 계산된다37.

이 수식들을 선형화하면 제로-평균 가우시안 노이즈(Zero-mean Gaussian noise)를 기반으로 계측된 바람장의 불확실성(\(\Sigma_w\))을 정량화할 수 있다37. 실시간 추정을 위해 바람장을 공간에 대해 매개변수화된 다항식(Polynomial parameterization)으로 모델링한 뒤 선형 칼만 필터로 근사하거나37, 보다 정밀한 비선형 풍속 구배를 추정하기 위해 가우시안 프로세스 회귀(Gaussian Process Regression, GPR)와 파티클 필터(Particle Filter)가 혼용된다31. GPR은 획득된 산발적인 풍속 데이터를 바탕으로 대기 경계층 내의 바람장 분포와 그 예측 불확실성(분산)을 연속적인 확률 모델로 제공하므로, 불확실성이 낮은 영역(즉, 윈드 시어가 확실히 존재하는 구역)으로 무인기의 궤적 생성기(Trajectory planner)가 안전하게 진입하도록 유도한다31.

 

 

4. 지오펜스(Geofence) 제약 보장을 위한 제어 방벽 함수(CBF)

특정 구역을 감시하는 로이터링 임무에서 무인기는 사전에 지정된 3차원 입체 공간(상하좌우 및 반경 제약)을 절대 이탈해서는 안 된다. 동적 활공과 같이 고도의 기동성을 요구하는 비행 궤적은 필연적으로 넓은 선회 반경과 급격한 고도 강하/상승을 동반하므로, 바람장 획득 효율성과 지오펜스 제약 사이에는 극명한 충돌이 발생한다14. 제어기가 오직 에너지 획득만을 목표로 할 경우 기체가 지정된 영공을 벗어나 통신 두절이나 충돌 사고로 이어질 수 있다. 이를 수학적으로 완벽히 보장하기 위해 제어 방벽 함수(Control Barrier Functions, CBF)가 실시간 안전 필터(Safety Filter)로 통합된다.

 

4.1. 공간적 제약과 CBF의 수학적 원리 (Forward Invariance)

CBF는 비선형 제어 시스템의 상태(State)가 미리 정의된 안전 집합(Safe set, \(\mathcal{S}\)) 내부에 항상 머물도록(Forward Invariance) 보장하는 엄밀한 수학적 틀이다18. 지오펜스 내의 공간을 0보다 큰 수퍼레벨 집합(Superlevel set)으로 나타내는 연속 미분 가능한 함수 \(h(x)\)로 정의할 때, 시스템이 안전 영역을 벗어나지 않기 위한 필요충분조건은 다음과 같은 부등식으로 표현된다45.

여기서 \(x\)는 무인기의 상태 벡터(위치, 속도 등), \(u\)는 제어 입력(타각, 추력 등), \(\alpha\)는 엄격하게 증가하는 확장된 K-클래스 함수(Extended Class \(\mathcal{K}\)function)이다45. 이 수식의 직관적인 의미는 무인기가 지오펜스 경계(\(h(x) \to 0\))에 접근할수록, 경계를 넘어가려는 방향의 속도 성분을 강제로 억제하여 기체의 궤적을 안전 구역 내부로 굴절시키는 제어 입력을 산출한다는 것이다49.

 

4.2. CBF-QP 기반 실시간 최적화 및 간섭 최소화(Minimally Invasive) 제어

바람 에너지를 수확하기 위해 상위 제어기(명목 제어기, Nominal Controller)가 산출한 제어 입력 \(u_{des}\)가 지오펜스를 침범할 위험이 감지되면, CBF는 안전 필터로 개입하여 가장 원래의 목적 \(u_{des}\)과 유사하면서도 안전 조건을 만족하는 수정된 제어 입력 \(u^*\)를 산출한다. 이 과정은 다음과 같은 이차 계획법(Quadratic Programming, QP) 문제를 통해 실시간 최적화된다13.

이 CBF-QP 기법의 핵심은 간섭의 최소화(Minimally Invasive)에 있다. 무인기가 지오펜스 중앙과 같이 안전한 구역에 있을 때는 부등식 제약조건이 활성화되지 않으므로, 에너지를 극대화하기 위한 동적 활공 기동(\(u_{des}\))을 100% 허용한다. 하지만 기체가 상하단 고도 제한선이나 측면 반경 경계에 근접하여 궤적 이탈 위험이 수치적으로 임박해지면, QP 솔버가 실시간으로 부드럽고 신속하게 제어 입력을 수정하여 기수를 돌리거나 피치를 조절하도록 강제한다18.

 

궤적의 부드러움을 유지하고 액추에이터의 포화(Saturation)를 방지하기 위해 다중 CBF가 병렬로 구성되기도 한다. 예를 들어 목표 위치 제약(\(h_{pos}\)), 속도 한계 제약(\(h_{vel}\)), 가속도 한계 제약(\(h_{acc}\))을 동시에 평가하여, 급격한 장애물 회피 기동 중에도 모터의 물리적 한계를 초과하지 않는 유효한 제어 입력만을 획득한다50.

 

4.3. 고차 방벽 함수(HOCBF) 및 예측 기반 모델(PB-CBF) 적용

무인기의 공기역학적 동역학은 제어 입력(타각 변위)이 실제 위치 변화로 나타나기까지 다중 적분기를 거쳐야 하는 고상대도(High Relative Degree) 시스템이다. 단순한 1차 CBF로는 관성을 지닌 기체가 경계선에 도달했을 때 제동 거리를 확보하지 못해 경계를 침범할 위험이 있다46. 이를 해결하기 위해 고차 CBF(High-Order CBF, HOCBF)나 예측 기반 CBF(Prediction-Based CBF, PB-CBF)가 적용된다46. PB-CBF는 기체의 현재 상태뿐만 아니라 미래의 회피 궤적(Escape path)을 시뮬레이션하여, 최대 뱅크각이나 추력 제한 등 강한 제어 입력 제약(Input constraints) 하에서도 기체가 지오펜스를 안전하게 벗어나 원래 궤도로 복귀할 수 있는지 여부를 마진(Safety margin)으로 정량화한다51. 이는 고속으로 윈드 시어를 가로지르는 무인기가 예측 불가능한 돌풍을 만나 궤도에서 밀려나더라도, 물리적인 선회 반경 한계를 미리 계산하여 제약 범위를 절대 이탈하지 않도록 보장한다.

 

5. 심층 강화학습(DRL) 기반 자율 활공 및 제어 아키텍처

바람장이 수학적으로 완벽히 정형화되는 윈드 터널과 달리, 실제 대기 경계층은 예측 불가능한 돌풍, 지형지물에 의한 난류, 흩어진 파편처럼 산발적인 열용승 기류로 가득 차 있다. 기존의 고전적인 제어 기법(PID, LQR)이나 복잡한 편미분 방정식을 푸는 비선형 모델 예측 제어(NMPC)는 모델 불확실성에 대한 강건성(Robustness)이 부족하며 실시간 궤적 최적화 연산에 막대한 부하를 일으킨다7. 이에 반해 심층 강화학습(Deep Reinforcement Learning, DRL) 알고리즘은 비행체의 복잡한 비선형 공력 모델을 사전에 명시적으로 제공할 필요 없이(Model-free), 에이전트(무인기)가 시뮬레이션 및 실제 환경과 직접 상호작용하며 축적한 시행착오를 통해 최적의 제어 정책(Policy)을 신경망으로 학습할 수 있어 차세대 비행 제어의 패러다임으로 자리매김하고 있다15.

 

5.1. 마르코프 의사결정 과정(MDP): 상태, 행동, 보상 함수 설계

LALE 무인기가 동적 활공과 열기류 순환 비행을 자율적으로 수행하도록 강화학습 모델을 구성하기 위해서는 마르코프 의사결정 과정(Markov Decision Process, MDP)을 정교하게 설계해야 한다.

 

  • 상태 공간 (State Space, \(\mathcal{S}\)): 무인기의 3차원 위치 좌표(\(x, y, z\)), 대기속도(\(V_a\)), 대지속도 피치(\(\gamma\)), (\(\phi\)), (\(\psi\)) 각도, 받음각(\(\alpha\)), 옆미끄럼각(\(\beta\))뿐만 아니라, 온보드 센서로 획득된 타겟까지의 상대 거리(\(l_t\)) 및 추정된 3차원 풍속 벡터(\(W_x, W_y, W_z\)) 정보가 종합적으로 입력된다54. 상태 공간은 인공신경망 훈련 효율을 높이기 위해 값의 범위가 0에서 1 사이로 정규화(Scaling)된다56.
  • 행동 공간 (Action Space, \(\mathcal{A}\)): 무인기의 비행 자세를 변경하는 에일러론, 엘리베이터, 러더의 연속적인 조작 값(-1~1 범위) 및 모터 추력 조절 값(0~1 범위)으로 정의된다55.
  • 보상 함수 (Reward Function, \(R\)): 강화학습이 목표로 하는 행위를 결정짓는 가장 핵심적인 지표이다. 보상 함수는 단일 희소 보상(Sparse reward)이 아닌 촘촘하게 설계된 다목적 복합 보상(Dense multi-objective composite reward)으로 구성된다55.
  1. 에너지 수확 보상 (Energy/Altitude Reward): 동적 활공의 에너지 수확 방정식(운동/위치 에너지 변화율)에 따라 에너지를 획득하거나, 열기류 내에서 고도가 증가할 경우 큰 양의 보상(\(+6000\))을 부여한다15.
  2. 공간 유지 보상 (Geofence Penalty): 무인기가 목표 고도 범위를 이탈하거나 지오펜스를 넘어설 경우 즉시 에피소드를 종료하고 막대한 음의 보상(\(-100000\) 또는 \(-20000\))을 부여하여 안전 구역 이탈을 강하게 억제한다52.
  3. 제어 효율 보상 (Step/Control Penalty): 모터(추력)를 과도하게 사용하거나 조종면을 급격하게 꺾어 저항(유도 항력)이 발생할 때마다 매 스텝 음의 패널티(\(-0.1\))를 부여하여, 잉여 동력 사용을 최소화하고 최대한 매끄러운 활공 비행을 유도한다9.

 

5.2. PPO, SAC 및 최적화 알고리즘 비교 적용

연속적인 3차원 공간 비행과 연속적인 행동(조종면 제어)을 다루기 위해, 정책 경사(Policy Gradient) 방식의 Actor-Critic 알고리즘들이 주로 활용된다. 연구 목적에 따라 각기 다른 강화학습 알고리즘이 채택된다56.

 

알고리즘 구분 핵심 메커니즘 자율 비행(활공) 제어 적용 시 특성
DDPG (Deep Deterministic Policy Gradient) 결정론적 정책 기반, 오프폴리시 훈련 과정이 상대적으로 안정적이나, 하이퍼파라미터에 매우 민감하여 복잡한 풍속 환경에서 최적화 발산 위험이 존재함57.
TD3 (Twin Delayed DDPG) 가치 함수 과대평가 방지(이중 크리틱) DDPG를 개선한 모델로, 훈련 안정성이 높으면서도 동적 활공 에이전트의 '에너지 수확 효율'을 극대화하는 궤적을 산출하는 데 우수함57.
PPO (Proximal Policy Optimization) 신뢰 영역(Trust Region) 클리핑, 온폴리시 정책이 급격히 변하지 않도록 클리핑하여 훈련 안정성이 매우 뛰어나다. 비행 궤적이 튀지 않고 부드럽게 수렴하여 로이터링 궤도 추적 및 지오펜스 유지에 특히 적합함53.
SAC (Soft Actor-Critic) 오프폴리시 기반, 엔트로피 최대화 누적 보상뿐만 아니라 행동의 엔트로피(탐험성)를 목적 함수에 포함한다. 열기류가 희박하게 흩어진 환경에서 무인기가 더 과감하고 넓게 탐색하도록 유도하여 열기류 발견 확률을 극대화함61.

 

최근의 첨단 연구에서는 이 알고리즘들의 장점을 취합하여, 에너지를 수확하는 궤적 계획은 TD3나 SAC로 처리하고, 안정적인 자세 제어는 PPO를 활용하는 계층적 강화학습(Hierarchical Reinforcement Learning, HRL) 구조를 제안하고 있다17. 상위 계층(Top-level) 정책은 기체의 에너지 상태와 주변 기류 조건에 따라 '열기류 순환', '동적 활공', '동력 순항' 중 적합한 하위 계층(Bottom-level) 제어기를 스위칭하여 활성화하며, 하위 계층 제어기는 선택된 모드에 맞춰 최적의 피치와 롤 각도를 실시간으로 추종한다17. 이를 통해 LALE 무인기는 복잡한 임무 중에도 상황에 맞게 24시간 연속 고도 크루즈 시간을 0.98시간 연장하는 등 배터리 에너지를 보존하는 데 탁월한 효과를 입증하였다64.

 

 

 

5.3. 강화학습과 CBF의 안전한 결합 (Safe RL) 및 제약 조건의 처리

강화학습은 본질적으로 시행착오(Trial and Error)를 통해 발전하므로, 학습 초기 과정이나 돌풍으로 인한 외부 교란이 발생했을 때 무인기가 지오펜스 밖으로 튕겨 나가거나 비정상적인 기동으로 추락할 위험(Exploration risk)이 항상 존재한다46. PPO-Lagrangian과 같이 제한 조건을 목적 함수에 페널티로 결합하여 제약된 최적화를 수행하는 기법도 유용하지만55, 이는 평균적인 안전을 유도할 뿐 물리적인 하드 제약(Hard Constraints)의 완벽한 보장을 담보하지는 못한다.

 

이를 하드웨어 레벨에서 수학적으로 완벽히 보장하기 위해, 강화학습 에이전트가 산출한 제어 입력(\(u_{des}\))이 무인기의 액추에이터에 인가되기 직전, 4장에서 다룬 CBF-QP 안전 필터를 거치도록 하이브리드 아키텍처(Safe RL)를 구성한다13. 이 결합 구조 하에서 강화학습 에이전트는 기체의 세부적인 공력 제약이나 지오펜스 경계에 대해 보수적으로 학습할 필요 없이 오직 '대기 속도의 증가'와 '열기류 추적'이라는 에너지 최적화에만 100% 집중하여 공격적으로 정책을 훈련할 수 있다. 에이전트의 결정이 지오펜스를 넘어설 위험이 감지되는 그 찰나의 순간에만 CBF 필터가 개입하여 제어 입력을 기체가 안전 영역에 남도록 최소한의 굴절(\(u^*\))을 시킨다46. 이를 통해 복잡하고 예측 불가능한 돌풍 속에서도 충돌 및 이탈 제로(Zero-violation)를 확보한 채 최고 수준의 에너지 수확 비행을 달성할 수 있다.

 

5.4. 현실 세계 탑재를 위한 Sim-to-Real 전이 전략과 디지털 트윈

컴퓨터 시뮬레이션 환경에서 장기간 훈련된 DRL 모델을 실제 물리적 하드웨어(NVIDIA Jetson, Pixhawk 기반 플라이트 컨트롤러 등)에 탑재하여 성공적으로 구동시키는 데에는 필연적으로 '현실 간극(Reality Gap)'이라는 치명적인 장애물이 존재한다70. 시뮬레이터에서는 완벽히 구현하기 어려운 난류 모델, 센서의 가우시안 노이즈 특성, 액추에이터의 응답 지연(Latency) 등이 현실의 비행을 방해하기 때문이다70.

 

이 간극을 줄이기 위해 훈련 단계에서 도메인 무작위화(Domain Randomization) 기법이 적용된다. 풍속, 윈드 시어의 두께와 고도, 열기류의 상승 강도, 기체의 관성 모멘트(\(I_x, I_y, I_z\)), 관성 센서의 편향성 등에 광범위한 편차(Variance)를 인위적으로 무작위 주입하며 강화학습을 진행한다70. 이렇게 학습된 강건한(Robust) 정책 네트워크는 하나의 이상적인 기상 조건에 과적합(Overfitting)되지 않고, 예상치 못한 실제 대기 환경의 요동 앞에서도 범용적인 복원력을 지닌다71.

 

또한, 하드웨어 연산 부하를 분산시키기 위해 Cascade Control 아키텍처가 동원된다. 높은 연산 능력이 필요한 기류 탐색 및 궤적 결정(고수준 제어)은 Jetson 보드에서 구동되는 DRL이 담당하고, 모터와 타면을 제어하는 고주파 자세 제어(저수준 제어)는 Pixhawk의 고전적 제어기(PID)가 처리하도록 역할을 분담한다70. 나아가 디지털 트윈(Digital Twin) 기술을 통해 시뮬레이션 상의 무인기와 현실의 무인기를 동기화하여 실시간 병렬 처리를 수행함으로써, DRL 기반의 에너지 수확 알고리즘이 실험실 환경을 넘어 거친 해상이나 협곡의 실제 LALE 임무에도 투입될 수 있는 수준으로 실증되고 있다54.

 

6. 결론

저고도 장기체공(LALE) 무인기가 특정 공간(지오펜스) 내에서 배터리 소모를 억제하며 연속적인 로이터링 감시 임무를 수행하기 위해서는, 공기역학적 한계를 극복하는 기체 설계와 자연의 대기 흐름을 역이용하는 인공지능 기반의 비행 제어 알고리즘의 유기적인 통합이 반드시 이루어져야 한다.

 

저 레이놀즈 수에 최적화된 CST 기반 익형 설계와 고강성 탄소섬유 복합재 및 가변형 날개(Morphing Wing) 기술은 동적 활공 시 발생하는 30g 이상의 극심한 구조적 하중 인자(Load factor)를 견뎌내며 다양한 기류 환경에서 최적의 양항비를 이끌어낸다. 비행 제어 시스템은 온보드 센서 퓨전을 통한 3차원 바람장 추정(GPR, 확장 칼만 필터)을 기반으로, 바람의 속도 구배를 가로지르는 레일리 사이클(Rayleigh Cycle) 기반 동적 활공과 열용승 기류 순환 비행을 수행하여 기체의 에너지를 능동적으로 수확한다.

 

더 나아가 시시각각 변화하는 불규칙한 대기 난류 속에서 윈드 시어를 포착하고 에너지를 획득하는 고도의 비선형적 의사결정은 PPO, SAC 등의 계층적 심층 강화학습(DRL) 알고리즘이 관장하여 극한의 적응력을 발휘한다. 동시에 무인기가 지정된 지오펜스를 이탈하지 않도록 억제하는 안전판 역할은 이차 계획법 기반의 제어 방벽 함수(CBF-QP)가 실시간으로 담당하여 완전한 충돌 및 이탈 제로(Zero-violation)를 담보한다. 이러한 다학제적 융합 설계와 Safe RL 아키텍처는 향후 무제한 체공에 근접하는 친환경 자율형 무인기 시스템 구현을 위한 가장 이상적이고 확고한 공학적 해답으로 자리매김할 것이다.

 

참고 자료

  1. Long Endurance Drone | Low, Medium And High Altitude - Acecore Technologies, https://acecoretechnologies.com/long-endurance-drone/
  2. Taiwan solar-powered UAV flight endurance record - Canadian Science Publishing, https://cdnsciencepub.com/doi/10.1139/dsa-2023-0014
  3. Conceptual design of low altitude long endurance solar powered unmanned aerial vehicle, https://www.researchgate.net/publication/354563831_Conceptual_design_of_low_altitude_long_endurance_solar_powered_unmanned_aerial_vehicle
  4. Design of Low Altitude Long Endurance Solar-Powered UAV Using Genetic Algorithm, https://www.mdpi.com/2226-4310/8/8/228
  5. Design of Low Altitude Long Endurance Solar-Powered UAV Using Genetic Algorithm - Semantic Scholar, https://pdfs.semanticscholar.org/8288/fe8ea0b05fca2d71979bd5debc5e5f3dc9ad.pdf
  6. Design of Low Altitude Long Endurance Solar-Powered UAV Using Genetic Algorithm, https://www.researchgate.net/publication/353934111_Design_of_Low_Altitude_Long_Endurance_Solar-Powered_UAV_Using_Genetic_Algorithm
  7. Optimal trajectory planning of a small UAV using solar energy and wind energy - AIP Publishing, https://pubs.aip.org/aip/adv/article/13/5/055134/2893155/Optimal-trajectory-planning-of-a-small-UAV-using
  8. Flight Capability Analysis Among Different Latitudes for Solar Unmanned Aerial Vehicles, https://www.mdpi.com/1996-1073/18/6/1331
  9. Energy-Harvesting Mechanisms for UAV Flight by Dynamic Soaring - ResearchGate, https://www.researchgate.net/publication/281650268_Energy-Harvesting_Mechanisms_for_UAV_Flight_by_Dynamic_Soaring
  10. Dynamic Soaring Parameters Influence Regularity Analysis on UAV and Soaring Strategy Design - MDPI, https://www.mdpi.com/2504-446X/7/4/271
  11. On the feasibility of the Rayleigh cycle for dynamic soaring trajectories - PMC, https://pmc.ncbi.nlm.nih.gov/articles/PMC7053723/
  12. (PDF) High-Speed Robotic Albatross: Unmanned Aerial Vehicle powered by dynamic soaring - ResearchGate, https://www.researchgate.net/publication/259297213_High-Speed_Robotic_Albatross_Unmanned_Aerial_Vehicle_powered_by_dynamic_soaring
  13. Control Barrier Function-Based Quadratic Programming for Safe Operation of Tethered UAVs - arXiv, https://arxiv.org/html/2502.08129v1
  14. Incident-Aware Geofenced UAV Surveillance with YOLO-Based Object Detection for Industrial Facility Security - Preprints.org, https://www.preprints.org/manuscript/202509.1996
  15. Harvesting energy from turbulent winds with Reinforcement Learning - arXiv, https://arxiv.org/html/2412.13961v1
  16. Autonomous Soaring Using Reinforcement Learning for Trajectory Generation | Request PDF - ResearchGate, https://www.researchgate.net/publication/269248124_Autonomous_Soaring_Using_Reinforcement_Learning_for_Trajectory_Generation
  17. Stefan Notter Doctor of Engineering Research Associate at University of Stuttgart, https://www.researchgate.net/profile/Stefan-Notter
  18. Safe Input Regulation for Robotic Systems - ProQuest, https://search.proquest.com/openview/12c7aae2d46d29a529981f76949f9ec8/1?pq-origsite=gscholar&cbl=18750&diss=y
  19. UAV Design and Development Insights | PDF | Unmanned Aerial Vehicle | Aircraft - Scribd, https://www.scribd.com/document/845103791/UAVs
  20. Exploring drone classifications and applications: a review | International Journal of Engineering and Geosciences - DergiPark, https://dergipark.org.tr/en/download/article-file/4374242
  21. Status and Development Prospects of Solar-Powered Unmanned Aerial Vehicles—A Literature Review - MDPI, https://www.mdpi.com/1996-1073/18/8/1924
  22. Basic Aerodynamics and Flight Mechanics - Van's Air Force, https://vansairforce.net/threads/basic-aerodynamics-and-flight-mechanics.30807/
  23. Radi C ntr lled - RC Soaring.COM, https://www.rcsoaring.com/rcsd/RCSD-2012-06.pdf
  24. Introduction to UAV Systems (Aerospace Series) [5 ed.] 111980261X, 9781119802617, https://dokumen.pub/introduction-to-uav-systems-aerospace-series-5nbsped-111980261x-9781119802617.html
  25. (PDF) Evaluation of ASWING for overall aircraft design of unconventional configurations. Application to joined wings with flared folding wingtips. - ResearchGate, https://www.researchgate.net/publication/383978121_Evaluation_of_ASWING_for_overall_aircraft_design_of_unconventional_configurations_Application_to_joined_wings_with_flared_folding_wingtips
  26. Piezoelectric Energy Harvesting from A Fixed-wing Unmanned Aerial Vehicle | Request PDF, https://www.researchgate.net/publication/347266564_Piezoelectric_Energy_Harvesting_from_A_Fixed-wing_Unmanned_Aerial_Vehicle
  27. Concurrent Active Piezoelectric Control and Energy Harvesting of Highly Flexible Multifunctional Wings, https://asdr.eng.ua.edu/doc/pdf/j/009_2017_AIAA_JA_54_02_724.pdf
  28. Effects of Bio-Inspired Wing Dihedral Variations on Dynamic Soaring Performance of Unmanned Aerial Vehicles - MDPI, https://www.mdpi.com/2504-446X/8/11/623
  29. Smooth Parameterized Trajectory Planning and Control for Autonomous Dynamic Soaring | AIAA SciTech Forum, https://arc.aiaa.org/doi/10.2514/6.2024-1595
  30. Long Endurance Autonomous Flight for Unmanned Aerial Vehicles - AerospaceLab, https://aerospacelab.onera.fr/sites/default/files/2024-01/AL08-05.pdf
  31. Towards Robust Optimization-Based Autonomous Dynamic Soaring with a Fixed-Wing UAV, https://arxiv.org/html/2512.06610v2
  32. Energy Harvesting Mechanisms for UAV Flight by Dynamic Soaring - ResearchGate, https://www.researchgate.net/publication/268470303_Energy_Harvesting_Mechanisms_for_UAV_Flight_by_Dynamic_Soaring
  33. UAV 2D trajectories for loiter mode. | Download Scientific Diagram - ResearchGate, https://www.researchgate.net/figure/UAV-2D-trajectories-for-loiter-mode_fig8_327531326
  34. (PDF) Review of Dynamic Soaring: Technical Aspects, Nonlinear Modeling Perspectives and Future Directions - ResearchGate, https://www.researchgate.net/publication/327531326_Review_of_Dynamic_Soaring_Technical_Aspects_Nonlinear_Modeling_Perspectives_and_Future_Directions
  35. ArduSoar: an Open-Source Thermalling Controller for Resource-Constrained Autopilots - arXiv, https://arxiv.org/pdf/1802.08215
  36. Autonomous Thermal Soaring Methods: A Systematic Review - ResearchGate, https://www.researchgate.net/publication/394704081_Autonomous_Thermal_Soaring_Methods_A_Systematic_Review
  37. Wind Field Estimation for Autonomous Dynamic Soaring - Penn State Aerospace Engineering, https://www.aero.psu.edu/avia/pubs/LanSpl12.pdf
  38. Wind Field Estimation for Autonomous Dynamic Soaring - ResearchGate, https://www.researchgate.net/publication/223129793_Wind_Field_Estimation_for_Autonomous_Dynamic_Soaring
  39. Wind-Field Estimation and Curvature Continuous Path Planning for Low Altitude Urban Aerial Mobility, https://www.ri.cmu.edu/app/uploads/2020/08/Jay_MSR_Thesis-2.pdf
  40. WIND SHEAR PARAMETER ESTIMATION FOR DYNAMIC SOARING WITH UNMANNED AERIAL VEHICLES - ICAS - International Council of the Aeronautical Sciences, https://www.icas.org/icas_archive/ICAS2018/data/papers/ICAS2018_0464_paper.pdf
  41. A New Utility Function for Smooth Transition Between Exploration and Exploitation of a Wind Energy Field - GitHub Pages, https://jenjenchung.github.io/anthropomorphic/Papers/Chung2012new.pdf
  42. Autonomous Thermalling as a Partially Observable Markov Decision Process - Robotics, https://www.roboticsproceedings.org/rss14/p68.pdf
  43. Constrained Control of UAVs in Geofencing Applications | Request PDF - ResearchGate, https://www.researchgate.net/publication/327194950_Constrained_Control_of_UAVs_in_Geofencing_Applications
  44. A Control Barrier Function for Safe Navigation with Online Gaussian Splatting Maps - NSF PAR, https://par.nsf.gov/servlets/purl/10681410
  45. Onboard Safety Guarantees for Racing Drones: High-Speed Geofencing With Control Barrier Functions - Aaron Ames, http://ames.caltech.edu/singletary2022onboard.pdf
  46. Invariance Guarantees using Continuously Parametrized Control Barrier Functions - arXiv, https://arxiv.org/pdf/2507.12743
  47. Ensuring Quadrotor Safety Through Geofencing with Run Time Assurance by Arturo de la Barcena A thesis submitted to the Faculty o, https://uh-ir.tdl.org/bitstreams/006194e0-4320-46cf-adf0-3dd619e1d86c/download
  48. Learning Performance-oriented Control Barrier Functions Under Complex Safety Constraints and Limited Actuation - arXiv, https://arxiv.org/html/2401.05629v2
  49. Modern Control Meets Machine Learning: A Review and Taxonomy of Synergistic Approaches for Robotics Applications - MDPI, https://www.mdpi.com/2076-0825/15/5/235
  50. Trajectory Planning and Tracking Using Decoupled CBF-QPs for Safe Navigation of Quadrotors | J. Dyn. Sys., Meas., Control. | ASME Digital Collection, https://asmedigitalcollection.asme.org/dynamicsystems/article/147/2/021002/1200664/Trajectory-Planning-and-Tracking-Using-Decoupled
  51. Obstacle Avoidance for Multirotor Urban Air Mobility via Prediction-Based Control Barrier Functions - MDPI, https://www.mdpi.com/2673-4591/121/1/30
  52. A Deep Reinforcement Learning-Based Adaptive Control Strategy for UAVs in Dynamic and Complex Environments - ResearchGate, https://www.researchgate.net/publication/393720819_A_Deep_Reinforcement_Learning-Based_Adaptive_Control_Strategy_for_UAVs_in_Dynamic_and_Complex_Environments
  53. (PDF) A pretrained proximal policy optimization algorithm with reward shaping for aircraft guidance to a moving destination in three-dimensional continuous space - ResearchGate, https://www.researchgate.net/publication/349193498_A_pretrained_proximal_policy_optimization_algorithm_with_reward_shaping_for_aircraft_guidance_to_a_moving_destination_in_three-dimensional_continuous_space
  54. Revealing principles of autonomous thermal soaring in windy conditions using vulture-inspired deep reinforcement-learning | bioRxiv, https://www.biorxiv.org/content/10.1101/2023.09.18.558216v1.full
  55. Research on reinforcement learning-based safe decision-making methodology for multiple unmanned aerial vehicles - Frontiers, https://www.frontiersin.org/journals/neurorobotics/articles/10.3389/fnbot.2022.1105480/full
  56. Reinforcement Learning Based Autopilot - GitHub Pages, https://priya007007.github.io/Website527/Documents/CS_527_Technical_Paper_v2_0.pdf
  57. Mimicking Albatross Flight Strategies: Dynamic Soaring Path Planning via Deep Reinforcement Learning - ResearchGate, https://www.researchgate.net/publication/397535413_Mimicking_Albatross_Flight_Strategies_Dynamic_Soaring_Path_Planning_via_Deep_Reinforcement_Learning
  58. Research on Improved PPO-Based Unmanned Surface Vehicle Trajectory Tracking Control Integrated with Pure Pursuit Guidance - MDPI, https://www.mdpi.com/2077-1312/14/1/70
  59. Joint Trajectory Optimization and Resource Allocation in UAV-MEC Systems: A Lyapunov-Assisted DRL Approach - IEEE Computer Society, https://www.computer.org/csdl/journal/sc/2025/02/10896833/24uGtFxJPe8
  60. Research on Unmanned Aerial Vehicle Intelligent Maneuvering Method Based on Hierarchical Proximal Policy Optimization - MDPI, https://www.mdpi.com/2227-9717/13/2/357
  61. Deep Reinforcement Learning for Integrated Non-Linear Control of Autonomous UAVs - PSE Community.org, https://psecommunity.org/wp-content/plugins/wpor/includes/file/2302/LAPSE-2023.1977-1v1.pdf
  62. Learning Obstacle-Avoiding Drone Navigation with PPO and SAC, https://cs224r.stanford.edu/spring_2025/projects/pdfs/CS224R_Final_Report__1_1.pdf
  63. Extended Abstract - Stanford University, https://cs224r.stanford.edu/spring_2025/projects/pdfs/CS_224R_Final_Report%20(2).pdf
  64. Energy Optimal Trajectory Planning for the Morphing Solar-Powered Unmanned Aerial Vehicle Based on Hierarchical Reinforcement Learning - MDPI, https://www.mdpi.com/2504-446X/9/7/498
  65. Hierarchical Reinforcement Learning Approach for Autonomous Cross-Country Soaring | Journal of Guidance, Control, and Dynamics - Aerospace Research Central, https://arc.aiaa.org/doi/10.2514/1.G006746
  66. To my family and friends. - KTH DiVA portal, https://kth.diva-portal.org/smash/get/diva2:2058802/FULLTEXT01.pdf
  67. Optimizing Energy and Data Collection in UAV-aided IoT Networks using Attention-based Multi-Objective Reinforcement Learning - arXiv, https://arxiv.org/pdf/2601.14092
  68. Robust Fast 3D Beam Alignment for UAV-Assisted mmWave and Terahertz Communications, https://www.preprints.org/manuscript/202605.1286
  69. Systems Theoretic Process Analysis of a Run Time Assured Neural Network Control System - arXiv, https://arxiv.org/pdf/2209.00552
  70. Sim-to-Real Transfer in Reinforcement Learning for Maneuver Control of a Variable-Pitch MAV - arXiv, https://arxiv.org/html/2504.07694v1
  71. Quantifying the Sim-To-Real Gap in UAV Disturbance Rejection - DROPS, https://drops.dagstuhl.de/storage/01oasics/oasics-vol125-dx2024/OASIcs.DX.2024.16/OASIcs.DX.2024.16.pdf
  72. Deep Learning-Based Real-Time Multiple-Object Detection and Tracking from Aerial Imagery via a Flying Robot with GPU-Based Embedded Devices - PMC, https://pmc.ncbi.nlm.nih.gov/articles/PMC6695703/
  73. Machine Learning Subsystem for Autonomous Collision Avoidance, https://www.androcs.com/wp/bfd_download/machine-learning-subsystem-for-autonomous-collision-avoidance-on-a-small-uas-with-embedded-gpu/
  74. GamaFlyware: An Open-Source Simulation Platform for ... - UnB, https://bdm.unb.br/bitstream/10483/42664/1/2025_RenatoBrittoAraujo_tcc.pdf
  75. Autonomous Drone Control: A Reinforcement Learning Approach - MatheO, https://matheo.uliege.be/bitstream/2268.2/23358/4/TFE_HANSEN_Julien.pdf
  76. A Systematic Mapping of UAV Swarming Strategies: From Fundamentals to Coordination Mechanisms and Algorithmic Paradigms - Preprints.org, https://www.preprints.org/manuscript/202603.2299
  77. Model-Based RL Decision-Making for UAVs Operating in GNSS-Denied, Degraded Visibility Conditions with Limited Sensor Capabilities - MDPI, https://www.mdpi.com/2504-446X/9/6/410
  78. (PDF) Deep Reinforcement Learning Approach for Integrated Updraft Mapping and Exploitation - ResearchGate, https://www.researchgate.net/publication/373411206_Deep_Reinforcement_Learning_Approach_for_Integrated_Updraft_Mapping_and_Exploitation