본문 바로가기
기술보고서

전술환경 특화 AI 음성명령 인식 엔진 및 군집 무인체계 통제 아키텍처 설계와 실증 연구

by 파서스에어로스페이스 2026. 8. 6.

1. 서론

현대 전장은 고도의 비대칭성과 복잡성을 띠고 있으며, 도심 지역을 포함한 다영역 작전(Multi-Domain Operations)에서 소규모 단위 부대의 생존성과 타격력을 극대화하기 위해 다수의 무인기(UAV) 및 무인차량(UGV)으로 구성된 군집 로봇 시스템의 도입이 가속화되고 있다. 특히, 양손에 무기를 소지하고 전술 기동을 수행해야 하는 보병 전투원에게 있어 별도의 컨트롤러 조작 없이 웨어러블 디바이스를 통한 음성 인식 기반의 정보 전달 및 무인 체계 조종은 필수적인 전술적 우위 요소로 평가받고 있다1.

 

그러나 실제 야전 및 도심지 교전 환경은 총성, 장갑차량의 엔진 소음, 폭발음 등 85dB 이상의 극심한 비정상(Non-stationary) 소음이 지속적으로 발생하는 가혹한 음향 환경을 지닌다. 더불어, 적의 전자전(EW) 공격이나 통신 인프라 파괴로 인해 지상관제소(GCS)와의 클라우드 통신이 두절되는 상황(Comm-denied)이 빈번하게 발생한다. 이러한 악조건 속에서 단일 조작자가 수십에서 수백 대의 이기종 무인기를 오류 없이 통제하기 위해서는 클라우드 서버에 의존하지 않는 독립적인 엣지(Edge) 기반의 온디바이스(On-device) AI 시스템이 요구된다.

 

본 보고서는 미 국방고등연구계획국(DARPA)의 OFFSET(OFFensive Swarm-Enabled Tactics) 프로그램에서 수행된 대규모 인간-군집 상호작용(HCI) 연구 결과를 심층 분석하고, 여기서 도출된 한계점을 극복하기 위한 새로운 아키텍처를 제시한다. 군사 전술 용어, 단위부대 식별 코드, MGRS(Military Grid Reference System) 좌표계를 정확히 인식할 수 있도록 파인튜닝(Fine-tuning)된 온디바이스 음성 인식 모델의 설계부터, 전장 소음 필터링 파이프라인, 그리고 인식된 자연어 명령을 무인기 표준 제어 프로토콜인 MAVLink 임무 시퀀스로 자동 변환하여 오프라인 통신 환경에서도 무인기가 구조화된 임무를 수행하게 하는 전체 시스템의 구현 방안을 논증한다.

 

2. DARPA OFFSET 프로그램 분석 및 전술 통제 인터페이스의 진화

2.1 대규모 이기종 군집 시스템의 실증 및 통제 구조

DARPA가 2017년부터 2021년까지 추진한 OFFSET 프로그램은 복잡한 도심 환경에서 소규모 보병 부대가 최대 250대 이상의 소형 무인기(UAS) 및 무인 지상 차량(UGS)을 군집 형태로 운용하여 임무를 수행하는 것을 목표로 하였다2. 프로그램은 군집 전술(Swarm Tactics), 군집 자율성, 인간-군집 팀 구성, 가상 환경, AI 적용, 물리적 테스트베드라는 6가지 핵심 테마를 중심으로 연구를 진행하였다2. 2021년 11월 테네시주 포트 캠벨(Fort Campbell)의 Cassidy 도심전투훈련장(CACTF)에서 실시된 최종 6차 현장 실험(FX-6)에서는 Northrop Grumman과 Raytheon BBN이 주도하는 두 개의 시스템 통합 팀이 300대 이상의 물리적, 가상적 군집 에이전트를 성공적으로 전개하며 프로그램의 대미를 장식하였다2.

 

이 실험에서 Raytheon BBN, SIFT(Smart Information Flow Technologies), Oregon State University 등으로 구성된 CCAST(Command and Control of Aggregate Swarm Tactics) 팀은 단일 '군집 지휘관(Swarm Commander)'이 100대 이상의 이기종 물리 로봇을 동시에 감독하고 임무를 수행할 수 있음을 입증하였다8. CCAST 시스템은 최대 3.5시간 동안 군집 작전을 지속하며 600개 이상의 목표물(Artifacts) 정보를 성공적으로 탐지해냈다6. 이 과정에서 개별 로봇이 LTE 네트워크를 통해 장애물 및 목표물 정보를 전송하면, 중앙 디스패처(Dispatcher)는 지휘관의 상위 수준 명령을 해석하여 적절한 탑재체(예: 전면 카메라, 하향 카메라)를 가진 인접 로봇들에게 임무를 자율적으로 할당하고 충돌을 방지하였다9. 이는 조작자가 개별 플랫폼을 조종하는 전통적인 1:1 통제 방식에서 벗어나 1:150 이상의 극대화된 통제 범위(Span of control)를 달성한 혁신적인 사례이다11. FX-6 실험에는 이외에도 Sentien Robotics의 HiveXL 드론 캐리어(최대 80대 자동 충전 및 발진)와 Michigan Tech의 음향 기만(Acoustic spoofing) 페이로드 등 혁신적인 스프린트 기술들이 통합되어 그 실효성을 검증받았다2.

 

이러한 고도의 군집 통제를 구현하기 위해 DARPA OFFSET의 RISE(Rapid Integration Swarming Ecosystem) 프레임워크는 작전 요구사항(Warfighting needs)을 하드웨어로 전달하기 위한 명확한 계층적 분해 모델을 채택하였다. 인간 조작자가 하달하는 거시적인 임무 목표는 PyC2(Python Command and Control) 아키텍처를 통해 '전술(Tactics)' 단위로 번역되며, 이는 다시 하위 시스템에서 '로봇 기본 동작(Primitives)'으로 분해되고, 최종적으로 기체의 모터를 구동하는 '알고리즘(Algorithms)'으로 세분화되어 실행된다11. 이러한 구조적 접근은 로봇 공학 지식이 없는 일반 전술 운용자도 스케치나 언어를 통해 새로운 전술을 신속하게 조합하고 하달할 수 있도록 돕는다11.

 

2.2 가상현실(VR) 기반 상호작용과 음성 명령의 치명적 한계

OFFSET 프로그램은 조작자의 인지 부하를 줄이기 위해 다양한 인간-컴퓨터 상호작용(HCI) 인터페이스를 실험하였다. 그중 SIFT가 개발한 I3(Immersive Interaction Interface) 가상현실 시스템은 조작자가 '모래판(Sand Table)' 메타포 위에서 거인과 같은 시점으로 군집 전체를 조감하며 통제할 수 있게 설계되었다10. 각 무인 플랫폼은 통신 상태, 배터리 잔량, 페이로드 종류, 현재 수행 중인 전술 상태를 나타내는 글리프(Glyph)로 렌더링되어 방대한 군집 상태를 한눈에 파악할 수 있도록 지원하였다10. I3는 물리 기체와 가상 시뮬레이션 기체를 경계 없이 조작할 수 있는 환경을 제공하였다2.

 

그러나 초기에 기획되었던 다중 모달(Multi-modal) 인터페이스 중 음성 명령 체계는 실제 야전 환경에서 심각한 한계를 노출하였다. 당초 시스템은 "주어-동사-목적어" 구조의 규격화된 음성 입력을 통해 전술을 구성하고 텍스트 변환(TTS) 시스템으로 피드백을 제공하도록 설계되었다10. 하지만 훈련장의 극심한 소음, 군용 통신 붐 마이크의 제한된 음향 품질, 그리고 안전 통제 요원과의 지속적인 교신이 섞이면서 상용 수준의 음성 인식 엔진은 빈번한 오작동을 일으켰다10. 또한 군집 규모가 100대를 넘어서면서 개별 기체의 이벤트마다 발생하는 오디오 피드백은 조작자에게 심각한 인지 과부하(Cognitive overload)를 유발하였다9. 다차원 작업량 평가(Multi-dimensional workload algorithm) 결과, 조작자의 음성 작업 부하(Speech workload)가 임계치를 초과하는 현상이 빈번하게 관측되었다8.

 

결국 OFFSET 프로그램의 후반부로 갈수록 음성 기반 제어는 사실상 폐기(Deprecated)되거나 사용이 극히 제한되었으며, 단 1개의 훈련 데이터만으로도 90% 이상의 인식률을 보이는 디바이스 독립적 제스처 인식기인 'Jackknife' 모듈과 VR 컨트롤러 기반의 직접 선택 방식으로 대체되었다10. 이 실패 사례는 향후 군사 특화 음성 인터페이스를 설계할 때, 클라우드 기반의 범용 인식기가 아닌 극저지연 소음 제거 전처리와 전술 도메인에 특화된 온디바이스 방어적 파싱(Parsing) 아키텍처가 반드시 선행되어야 함을 시사한다. 더불어 인식된 결과는 독자적인 폐쇄 시스템에 머물지 않고 ATAK(Android Tactical Assault Kit)과 같은 보편적 전술 상황도(COP)에 플러그인(Plugin) 형태로 연동되어야 실전성을 확보할 수 있다15.

 

3. 전장 소음(85dB 이상) 환경 극복을 위한 강건한 오디오 파이프라인

DARPA 실험의 교훈을 바탕으로, 전술 음성 인식 엔진의 첫 번째 관문은 극단적인 소음 환경을 정제하는 것이다. 총성이나 장갑차의 궤도 소음 등 85dB을 초과하는 환경에서는 단일 마이크의 소프트웨어 노이즈 캔슬링만으로는 유의미한 신호 대 잡음비(SNR) 확보가 불가능하다. 따라서 물리적 차원의 센서 융합과 온디바이스 기반 딥러닝 필터링이 결합된 다단 파이프라인이 필수적이다.

 

3.1 하드웨어적 접근: 인후 마이크와 음향 마이크의 듀얼 융합

전통적인 대안으로 성대의 진동을 피부를 통해 직접 수음하여 공기 중의 소음에 영향을 받지 않는 인후 마이크(Throat Microphone)가 있다18. 인후 마이크는 주변 배경 소음을 극적으로 차단할 수 있으나, 인체 조직의 본질적인 탄성 특성으로 인해 약 3kHz 대역 이상이 깎여나가는 저역 통과 필터(Low-pass filter) 현상을 겪게 된다19. 그 결과, 마찰음과 파찰음 등 고주파 자음의 정보가 유실되어 명료도(Intelligibility)가 급감한다. 미군 연구에 따르면, Modified Rhyme Test (MRT)를 통한 명료도 평가에서 일반 음향 마이크는 69.70%를 기록한 반면, 인후 마이크는 55.97%에 불과하여 빠르고 정확한 지시가 생명인 상황에서 단독으로 사용하기 부적합함이 증명되었다19.

 

이를 해결하기 위해 인후 마이크와 지향성 붐 마이크를 동시에 사용하는 듀얼 마이크(Dual-microphone) 기반의 POF(Probabilistic Optimum Filter) 매핑 기법이 요구된다18. 인후 마이크의 소음 없는 저주파 발화 신호를 '트리거' 및 음성 구간의 기준점(Reference signal)으로 활용하고, 음향 마이크에서 수집된 광대역 신호에서 배경 소음을 적응형으로 차감(Adaptive Noise Cancellation)함으로써 소음 차단과 음성 명료도 확보라는 상충되는 목표를 동시에 달성할 수 있다18.

 

3.2 엣지 기반 소프트웨어 전처리: DeepFilterNet3를 활용한 실시간 저지연 필터링

하드웨어 계층을 통과한 음성 신호는 곧바로 DeepFilterNet3 기반의 딥러닝 소음 억제(Noise Suppression) 모듈을 거친다22. 기존 마스킹 기반 소음 제거 방식이 음성 신호 자체를 훼손하는 부작용이 있던 반면, DeepFilterNet3는 복소수 기반 심층 필터링(Complex Deep Filtering)과 STFT(Short-Time Fourier Transform) 분석을 통해 음성 스펙트럼의 자연스러운 특성을 보존한다25.

 

DeepFilterNet3의 아키텍처는 인지 음향학적 원리에 기반하여 두 단계로 작동한다. 첫 번째 단계는 ERB(Equivalent Rectangular Bandwidth) 필터 뱅크를 활용해 주파수 대역을 32개로 대폭 압축한 후 스펙트럼의 포락선(Envelope)을 추정하여 광대역 배경 소음을 1차적으로 상쇄한다22. 이어진 두 번째 단계에서는 심층 필터(DF) 디코더를 활용해 5kHz 이하의 주기적(Periodic) 유성음 성분의 위상을 복원하고 강화한다26.

 

이러한 이중 구조 최적화를 통해 DeepFilterNet3는 파라미터를 극도로 경량화(약 8MB)하였다29. 가장 중요한 것은 전술 환경에 요구되는 극저지연(Ultra-low latency) 성능이다. 48kHz 샘플링 레이트 기준 20ms 윈도우와 10ms 홉(Hop) 단위로 동작하며, 모델의 룩어헤드(Look-ahead) 프레임을 포함한 엔드투엔드(End-to-end) 알고리즘 지연 시간은 약 30~40ms에 불과하다26. 이는 C++ 및 ONNX Runtime 환경에 최적화되어 Python이나 PyTorch 없이 작동하며, Qualcomm SoC와 같은 모바일 NPU나 CPU 단일 스레드 환경에서도 0.15~0.20 수준의 뛰어난 실시간 처리 속도(RTF, Real-Time Factor)를 제공하여 엣지 디바이스 통신 체계에 즉시 탑재가 가능하다30.

 

3.3 음성 활동 감지(VAD)를 통한 연산 효율 극대화

군용 엣지 디바이스의 제한된 배터리와 발열 조건을 고려할 때, 대규모 음성 인식(ASR) 모델이 상시 활성화되어 배터리를 소진하는 것을 막아야 한다. 이를 위해 음성이 감지된 순간에만 ASR 엔진을 기상(Wake-up)시키는 음성 활동 감지기(VAD)가 파이프라인의 핵심 노드로 삽입된다. 전통적인 에너지 기반 임계값 모델 대신, 가혹한 소음 속에서도 정밀하게 동작하는 신경망 기반의 Silero VAD가 널리 사용된다36.

 

모델 특성 Pyannote Segmentation-3.0 Silero VAD (Streaming v6.2.1)
적용 목적 오프라인 고정밀 배치(Batch) 처리 엣지 기반 초저지연 실시간 스트리밍
모델 파라미터 약 1.49M (용량: 5.7MB) 약 309K (용량: 1.2MB)
아키텍처 구성 SincNet (80 필터) + 4-Layer BiLSTM 1D Conv + LSTM 구조 지속 상태 전달
처리 단위 10초 슬라이딩 윈도우 (1초 스텝) 512 샘플 청크 (16kHz 기준 32ms)
특징 히스테리시스 스무딩 적용, 지연 큼 상태 머신 기반 Onset/Offset 실시간 결정

 

Silero VAD는 위 표와 같이 309K 개의 극소형 파라미터만으로 구성되며 32ms 단위 청크로 스트리밍 데이터를 분석한다37. 내부의 LSTM 모듈이 청크 간 상태를 유지하며 헬기 소음이나 장갑차 소음을 배제하고 오직 사람의 발화 구간 시작점(Onset)과 종료점(Offset) 확률을 정확히 계산하여 리소스 낭비를 원천 차단한다34.

 

4. 온디바이스 기반 전술 특화 음성 인식 파인튜닝 모델 구현

오디오 파이프라인에서 정제된 신호는 이제 폐쇄망 환경에서도 독립적으로 동작하는 ASR 엔진으로 전달된다. 작전 보안 유지와 적의 통신 방해(Jamming)가 상존하는 전술 공간에서는 Google STT나 OpenAI API와 같은 외부 클라우드 통신망 접속이 불가능하므로, 모든 추론 과정은 엣지 디바이스 내에서 오프라인(On-device)으로 완결되어야 한다.

 

4.1 파라미터 효율적 미세 조정(PEFT)과 LoRA 아키텍처 적용△

오프라인 음성 인식의 베이스 모델로는 68만 시간 이상의 다국어 음성 데이터를 통해 학습되어 기본 성능과 범용성이 압도적인 OpenAI의 Whisper 모델이 주로 채택된다38. 하지만 상용 데이터로 학습된 Whisper 모델은 군사 도메인 고유의 전술 용어, 8자리 이상의 MGRS 좌표계 체계(예: 52S CG 1234 5678), 암호화된 단위 부대 식별 부호 등을 처리할 때 심각한 전사 오류나 환각(Hallucination) 증세를 보인다. 이를 해결하기 위해 전체 모델을 재학습하는 대신 LoRA(Low-Rank Adaptation) 기술을 적용한 파인튜닝(Fine-tuning)을 수행한다.

 

LoRA 기법은 사전 학습된 대형 모델의 가중치 행렬 W를 고정(Freeze)한 채, 트랜스포머 아키텍처 내 어텐션 모듈(주로 Query 및 Value 프로젝션 계층)에 훈련 가능한 저랭크(Low-Rank) 분해 행렬 A와 B를 삽입하여 업데이트 값 △W=BA를 학습하는 구조를 갖는다38. 이 방식을 통해 미세 조정에 필요한 매개변수를 수천 분의 일로 대폭 감소시켜, VRAM이 제한적인 개발 환경에서도 대형 모델의 최적화를 가능하게 하며 모델의 추론 속도 저하를 방지한다38. 특히 엣지 디바이스에서는 십여 MB 수준에 불과한 훈련된 LoRA 어댑터 모듈만 교체 탑재함으로써 파병 지역이나 작전 성격에 따라 유연하게 모델을 변경할 수 있다는 것이 극대화된 장점이다38.

 

저자원 언어나 특정 사투리 도메인에 대한 최근 연구에서는 LoRA 행렬을 단순 무작위 초기화하는 대신 이산 웨이블릿 변환(DWT, Discrete Wavelet Transform)을 통해 음성 신호의 시공간적 주파수 특성을 반영하여 초기화하는 DWTLoRA 기법이 제안되었다45. 이러한 구조적 초기화는 학습 초기 단계에서 불필요한 가중치 탐색 공간을 줄여주어 훈련 안정성과 문자인식오류율(CER) 성능을 대폭 개선한다45. 여기에 Optuna와 같은 하이퍼파라미터 최적화 프레임워크를 결합하면 오버피팅을 방지하면서 극한의 도메인 적응력을 확보할 수 있다44.

 

4.2 한국어 군사 전술 데이터 학습 결과 및 성능 입증

국내 방산 연구 기관과 학계의 협력을 통해 한국어 군사 용어 데이터셋을 활용하여 트랜스포머 기반 ASR 모델을 파인튜닝하는 연구가 활발히 진행 중이다1. 훈련 데이터는 전술 교리의 핵심 문맥을 담고 있는 '군사 교범(Military regulations)', 고유 명사와 부대 식별 부호 위주의 '군사 용어 사전(Military glossaries)', 그리고 '군사 간행물' 등 세 가지 하위 도메인으로 분류되어 구축되었다1. 연구 결과, LoRA를 통해 미세 조정된 모델들은 기존 상용 엔진 대비 압도적인 성능을 보였으며, 특히 '군사 교범' 데이터를 기반으로 학습한 모델이 구조화된 좌표 체계와 긴급 전술 지시어 인식에서 가장 우수한 오류 감소율을 입증하였다1.

 

유사한 한국어 도메인 특화 모델(복지 상담, 원격 의료 시스템 등 KsponSpeech 기반)에 Whisper LoRA 파인튜닝을 적용한 선행 연구를 살펴보면 그 효과를 구체적으로 가늠할 수 있다39.


 

결과 데이터가 보여주듯, 기본 모델의 단어 오류율(WER) 42.36%가 파인튜닝 후 25.92%로 약 38.8% 개선되었고, 음절 오류율(CER)은 15.88%에서 5.84%로 무려 63.2%의 비약적인 개선을 이루어내었다47. 교착어인 한국어의 특성상 형태소 변이와 띄어쓰기 오류를 더 정밀하게 반영하는 CER 지표의 향상은 MGRS 단위 코드나 특정 무기체계 명칭과 같은 복합 고유명사를 완벽하게 인식해 내는 데 결정적인 역할을 수행한다47.

 

4.3 Sherpa-onnx 기반 C++ 엣지 배포 아키텍처

이렇게 완성된 파인튜닝 모델(Whisper, Zipformer 등)은 파이썬 인터프리터 없이 C/C++ 네이티브 환경에서 작동할 수 있도록 변환되어야 한다. 이를 위해 차세대 Kaldi 프로젝트에서 분기된 'Sherpa-onnx' 프레임워크가 배포 모듈로 핵심적인 기능을 수행한다49. Sherpa-onnx는 인터넷 연결 없는 오프라인 스트리밍 음성 인식을 지원하며, 가중치를 INT8 수준으로 양자화(Quantization)하여 모델 사이즈와 메모리 대역폭 점유를 획기적으로 줄여준다34. 이 런타임 환경은 ARM 계열 코어, Raspberry Pi, Qualcomm SOC 등 국방용 차세대 전술 라디오와 상용 안드로이드 스마트폰에 제약 없이 이식(Porting)될 수 있어 군의 무기체계 플랫폼 다양화 요구에 부응한다34.

 

5. 비정형 자연어 명령의 구조화 및 MAVLink 임무 시퀀스 자동 변환

최첨단 음향 하드웨어와 온디바이스 STT 엔진을 거쳐 "3번 드론, 좌측 고지 52S CG 1234 5678로 이동 후 정찰하라"와 같은 명령이 무결점의 텍스트로 치환되었다면, 다음 단계는 이 비정형 텍스트를 무인기 비행 제어기(FC)가 해석할 수 있는 표준 통신 프로토콜인 MAVLink 임무 시퀀스로 구조화하는 구문 분석(Semantic Parsing)이다.

 

5.1 구문 분석 및 논리적 매핑 (Tactical Intent Resolution)

자연어 명령은 엣지 디바이스 내부에 탑재된 초경량 소형언어모델(sLLM) 또는 정규식 규칙(Rule-based) 엔진을 통해 작전 의도(Tactical Intent)로 분해된다.

 

  1. 타겟 식별(Target ID): 전술 네트워크 상에 등록된 해당 기체의 시스템 ID나 그룹 ID로 매핑된다 (예: "3번 드론" → target_system: 3).
  2. 동작 분류(Action Classification): "정찰하라"와 같은 지시어는 사전 정의된 전술 딕셔너리에 따라 일련의 단위 로봇 기동(Primitives)으로 치환된다11.
  3. 좌표 분해(Coordinate Resolution): "좌측 고지" 또는 구두로 전달된 MGRS 좌표계는 지리정보시스템(GIS) 변환 플러그인을 거쳐 WGS84 기준의 절대 위도(Latitude), 경도(Longitude), 고도(Altitude) 값으로 실시간 번역된다53.

 

5.2 MAVLink 커맨드 컴파일

MAVLink는 무인 항공기와 지상관제소(GCS) 사이의 데이터를 주고받는 매우 가볍고 직렬화된 XML 기반 메시징 프로토콜이다55. 분해된 작전 의도는 드론의 궤적과 액션을 정의하는 여러 개의 MAV_CMD 임무 아이템 시퀀스로 컴파일된다57.

 

MAVLink 명령어 매핑된 파라미터 (Param 1 ~ 7) 군사 작전 상 의미
MAV_CMD_NAV_WAYPOINT (Cmd 16) Param 1: 대기 시간 (Delay)

Param 2: 허용 반경 (Accept Radius)

Param 5~7: 위도, 경도, 고도
목표 MGRS 좌표로의 정확한 기동 및 도착 대기 지시58.
MAV_CMD_NAV_LOITER_TURNS (Cmd 18) Param 1: 선회 횟수 (Turns)

Param 3: 회전 반경 (Radius)

Param 5~7: 중심점 위도, 경도, 고도
도착 좌표 상공에서 지속적인 원형 선회 비행을 통한 감시 정찰 유지61.
MAV_CMD_DO_SET_CAM_TRIGG_DIST Param 1: 셔터 간격 (거리/m)

Param 2~7: 사용 안 함
지정된 간격마다 정찰 이미지를 수집하기 위해 즉각적인 페이로드 구동59.

 

명령 체계는 이동을 관장하는 탐색적 명령군(MAV_CMD_NAV_*)과 기체의 모터나 카메라 등 특정 상태를 즉각적으로 변경하는 수행 명령군(MAV_CMD_DO_*)이 순차적 미션 리스트로 엮이며 완전한 자율 비행 알고리즘을 형성한다55.

 

6. 통신 두절(Comm-Denied) 상황에서의 마이크로 트랜잭션 전송 및 엣지 독립 운용

전술 환경에서는 적의 재밍(Jamming)이나 지형지물에 의해 지상관제소(GCS) 단말과 전진 배치된 드론 간의 통신이 불안정하거나 완전히 단절되는 상황을 전제로 시스템을 설계해야 한다. 생성된 MAVLink 시퀀스는 끊임없이 연결을 요구하는 방식이 아닌, 일괄 업로드(Batch Upload) 후 독립 실행되는 '마이크로 트랜잭션' 교환 방식을 채택하여 데이터 무결성과 자율성을 보장한다57.

 

6.1 MAVLink 임무 전송 핸드셰이크 프로토콜

시퀀스를 드론의 비행 제어 컴퓨터(Flight Controller) 메모리에 안전하게 이식하기 위한 프로토콜 교환 과정은 다음과 같다56.

 

  1. 조작자 단말(GCS)은 드론에 업로드할 총 임무 아이템 개수를 포함한 MISSION_COUNT 메시지를 전송하고 대기(Timeout) 루프를 시작한다64.
  2. 드론이 이를 수신하면 첫 번째 아이템(seq==0) 전송을 요구하는 MISSION_REQUEST_INT 메시지를 역으로 발송한다64.
  3. GCS는 7개의 파라미터가 담긴 MISSION_ITEM_INT 메시지를 순차적으로 전송하며, 드론은 시퀀스가 맞지 않거나 누락된 패킷이 발생하면 해당 시퀀스 번호의 아이템을 재요청(Re-request)한다64.
  4. 마지막 임무 아이템(seq==count-1)까지 오류 없이 수신이 완료되면 드론은 MISSION_ACK (MAV_MISSION_ACCEPTED) 메시지를 반환하여 수신이 완료되었음을 GCS에 최종 확약한다64.

 

이러한 단계별 응답(Ack-based) 구조는 간헐적인 통신 단절(Comm-degraded) 환경에서도 명령 데이터의 손실을 방지한다. 무엇보다, 이 프로세스가 완료되어 임무가 기체에 이식되는 즉시 드론은 GCS와의 연결이 완전히 끊어지더라도 부여된 정찰 기동 및 교전 임무를 자율적으로 지속하여 완수하는 'Fire-and-Forget' 수준의 독립 동작이 가능하다.

 

6.2 전술 상황도(COP) 시스템과의 융합

모든 작전 데이터는 고립된 제어기로 작동하는 것이 아니라 ATAK(Android Tactical Assault Kit)과 같은 상용 전술 상황도 플랫폼에 플러그인 형태로 통합되어 시각화된다15. 드론이 비행 중 통신 가능 구역에 들어올 때마다 송신하는 MISSION_ITEM_REACHED 상태 메시지는 ATAK 지도 상에 실시간 위치 및 임무 진척도로 업데이트되어 소대 및 분대 단위에 투명하게 공유된다64.

 

7. 결론

미래 다영역 작전에서 드론 군집 체계를 병사가 효과적으로 운용하기 위해서는 극단적인 인지 부하의 경감과 전장 환경에 대한 시스템의 물리적, 소프트웨어적 내구성이 동시에 충족되어야 한다. DARPA OFFSET 프로그램은 250대 이상의 무인기를 1인의 군집 지휘관이 통제하는 역사적 이정표를 세웠으나, 복잡한 야전 환경에서의 음성 인터페이스 실패 사례를 통해 클라우드 의존적이고 방어 기제가 부족한 범용 인식 시스템의 치명적 한계를 선명하게 보여주었다4.

 

본 연구에서 도출된 '전술환경 특화 AI 음성명령 엔진' 아키텍처는 이를 극복하기 위해 물리적 마이크로폰의 하이브리드 구성(음향-인후 융합), DeepFilterNet3를 위시한 극저지연 온디바이스 오디오 전처리, 전술 교리와 MGRS 체계로 파인튜닝(LoRA)되어 한국어 처리 정확도를 63% 이상 끌어올린 Whisper 엔진, 그리고 이를 C++ 네이티브 환경에서 추론하는 Sherpa-onnx 모듈을 유기적으로 엮어내었다19. 이와 함께 비정형의 자연어 명령을 MAVLink의 구조화된 미션 시퀀스로 변환하는 아키텍처는 통신이 두절되는 극한의 전장 속에서도 무인기의 독립적인 작전 지속 능력을 보장한다58. 본 아키텍처는 향후 무인체계 도입을 본격화하는 각국 군의 보병용 웨어러블 C4I 단말기 및 차세대 지능형 전술 라디오 설계에 있어 가장 실전적인 표준 레퍼런스가 될 것이다.

 

참고 자료

  1. 트랜스포머 기반 군사용 자동음성인식 모델 제안 및 평가 - 논문 - DBpia, https://www.dbpia.co.kr/journal/articleDetail?nodeId=NODE11743730
  2. CHIPS Articles: OFFSET Swarms Take Flight in Final Field Experiment, https://www.doncio.navy.mil/chips/ArticleDetails.aspx?ID=15306
  3. Raytheon and others developing networked drone swarms for combat - ZDNET, https://www.zdnet.com/article/raytheon-and-others-developing-networked-drone-swarms-for-combat/
  4. OFFSET: OFFensive Swarm-Enabled Tactics - DARPA, https://www.darpa.mil/research/programs/offensive-swarm-enabled-tactics
  5. US DARPA's OFFSET programme conducts final field experiment - Army Technology, https://www.army-technology.com/news/darpa-offset-programme-conducts-fx6-experiment/
  6. Contractors demonstrate single-user drone swarm at DARPA experiment - C4ISRNet, https://www.c4isrnet.com/unmanned/2022/01/20/contractors-demonstrate-single-user-drone-swarm-at-darpa-experiment/
  7. Fort Campbell hosts final field experiment for large-scale drone program | Article - Army.mil, https://www.army.mil/article/252556/fort_campbell_hosts_final_field_experiment_for_large_scale_drone_program
  8. Congestion Analysis for the DARPA OFFSET CCAST Swarm - ResearchGate, https://www.researchgate.net/publication/372784757_Congestion_Analysis_for_the_DARPA_OFFSET_CCAST_Swarm
  9. Can A Single Human Supervise A Swarm of 100 Heterogeneous Robots? - ResearchGate, https://www.researchgate.net/publication/372827851_Can_A_Single_Human_Supervise_A_Swarm_of_100_Heterogeneous_Robots
  10. (PDF) Immersive Interaction Interface (I3): A Virtual Reality Swarm Control Interface - ResearchGate, https://www.researchgate.net/publication/370014896_Immersive_Interaction_Interface_I3_A_Virtual_Reality_Swarm_Control_Interface
  11. (PDF) From Warfighting Needs to Robot Actuation: A Complete Rapid Integration Swarming Solution - ResearchGate, https://www.researchgate.net/publication/370070942_From_Warfighting_Needs_to_Robot_Actuation_A_Complete_Rapid_Integration_Swarming_Solution
  12. OFFSET Swarms Take Flight in Final Field Experiment - DARPA, https://www.darpa.mil/news/2021/offset-swarms-take-flight
  13. The DARPA OFFSET view on how warfighting needs may be hierarchically... - ResearchGate, https://www.researchgate.net/figure/The-DARPA-OFFSET-view-on-how-warfighting-needs-may-be-hierarchically-decomposed-into_fig2_370070942
  14. The VR command and control system. | Download Scientific Diagram - ResearchGate, https://www.researchgate.net/figure/The-VR-command-and-control-system_fig3_328109116
  15. Kyle Usbeck, https://kyle.usbeck.us/
  16. DARPA - CivTAK / ATAK, https://www.civtak.org/category/government/darpa/
  17. DARPA OFFSET Demo - CivTAK / ATAK, https://www.civtak.org/2023/02/09/darpa-offset-demo/
  18. Robust Speaker Recognition with Combined Use of Acoustic and Throat Microphone Speech - ISCA Archive, https://www.isca-archive.org/interspeech_2016/sahidullah16b_interspeech.pdf
  19. Speech intelligibility in noise using throat and acoustic microphones - ResearchGate, https://www.researchgate.net/publication/7351076_Speech_intelligibility_in_noise_using_throat_and_acoustic_microphones
  20. Conference Program and Abstract Book - ISCA Archive, https://www.isca-archive.org/interspeech_2019/interspeech_2019.pdf
  21. Neural network modeling of a dolphin's sonar discrimination capabilities - DTU Inside, https://backend.orbit.dtu.dk/ws/portalfiles/portal/4415030/Andersen.pdf
  22. DeepFilterNet3: Real-Time AI Noise Suppression Review and Setup Guide [2026], https://aiadoptionagency.com/deepfilternet-3-noise-suppression/
  23. Adding DeepFilterNet Noise Reduction to Easy Effects on Arch Linux, https://adamgradzki.com/adding-deepfilternet-noise-reduction-to-easy-effects-on-arch-linux.html
  24. Deep-Learning Framework for Efficient Real-Time Speech Enhancement and Dereverberation - MDPI, https://www.mdpi.com/1424-8220/25/3/630
  25. [2110.05588] DeepFilterNet: A Low Complexity Speech Enhancement Framework for Full-Band Audio based on Deep Filtering - ar5iv, https://ar5iv.labs.arxiv.org/html/2110.05588
  26. DeepFilterNet: Perceptually Motivated Real-Time Speech Enhancement - ISCA Archive, https://www.isca-archive.org/interspeech_2023/schroter23b_interspeech.pdf
  27. arXiv:2110.05588v2 [eess.AS] 1 Feb 2022, https://arxiv.org/pdf/2110.05588
  28. Low Latency Speech Enhancement for Hearing Aids Using Deep Filtering - ResearchGate, https://www.researchgate.net/publication/362818237_Low_Latency_Speech_Enhancement_for_Hearing_Aids_Using_Deep_Filtering
  29. Realtime lightweight speech enhancers : r/speechtech - Reddit, https://www.reddit.com/r/speechtech/comments/1s742gr/realtime_lightweight_speech_enhancers/
  30. DeepFilterNet3 on Android — ONNX noise removal + ready APK | Soniqo, https://soniqo.audio/guides/denoise/android
  31. Deepfilternet Parameters, Sample Rate, Latency, Audio Length - Noise Reducer AI, https://noisereducerai.com/blogs/deepfilternet-parameters/
  32. GitHub - wuxuedaifu/deepfilter-stream: Real-time streaming noise cancellation with DeepFilterNet3 on ONNX Runtime, https://github.com/wuxuedaifu/deepfilter-stream
  33. shimondoodkin/deepfilter-rt: Real-time DeepFilterNet noise suppression using ONNX Runtime - GitHub, https://github.com/shimondoodkin/deepfilter-rt
  34. On-device speech pipeline with a C API — VAD + STT + TTS for Yocto/automotive, runs on Qualcomm SoCs : r/embedded - Reddit, https://www.reddit.com/r/embedded/comments/1scj74q/ondevice_speech_pipeline_with_a_c_api_vad_stt_tts/
  35. [2305.08227] DeepFilterNet: Perceptually Motivated Real-Time Speech Enhancement, https://arxiv.org/abs/2305.08227
  36. 음성 활동 감지 | Georgy Dev Docs, https://docs.georgy.dev/ko/runtime-audio-importer/voice-activity-detection/
  37. 음성 활동 감지 — Silero VAD - Soniqo, https://soniqo.audio/ko/guides/vad
  38. Fine-tuning Whisper with LoRA - Medium, https://medium.com/@anitaliubfsu/fine-tuning-whisper-with-lora-c796781f00f5
  39. Exploring the feasibility of fine-tuning large-scale speech recognition models for domain-specific applications: A case study on Whisper model and KsponSpeech dataset, https://www.eksss.org/archive/view_article?pid=pss-15-3-83
  40. Behind the Scenes: Mechanistic Interpretability of LoRA-adapted Whisper for Speech Emotion Recognition - arXiv, https://arxiv.org/html/2509.08454v3
  41. LoRA-Whisper: Parameter-Efficient and Extensible Multilingual ASR - arXiv, https://arxiv.org/html/2406.06619v1
  42. Fine-tune Whisper models on Amazon SageMaker with LoRA | Artificial Intelligence - AWS, https://aws.amazon.com/blogs/machine-learning/fine-tune-whisper-models-on-amazon-sagemaker-with-lora/
  43. martin-mwiti/whisper-small-hi-lora-r32-alpha64-20241231 - Hugging Face, https://huggingface.co/martin-mwiti/whisper-small-hi-lora-r32-alpha64-20241231
  44. Low-Resource Speech Recognition by Fine-Tuning Whisper with Optuna-LoRA - MDPI, https://www.mdpi.com/2076-3417/15/24/13090
  45. Enhancing Whisper Fine-Tuning with Discrete Wavelet Transform-Based LoRA Initialization, https://www.mdpi.com/2079-9292/15/3/586
  46. 트랜스포머 기반 군사용 자동음성인식 모델 제안 및 평가, https://www.kais99.org/jkais/journal/Vol25no03/Vol25no03p11.pdf
  47. Optimizing whisper for Korean telemedicine: Fine-tuning domain-specific ASR for clinical telephone transcription - PMC, https://pmc.ncbi.nlm.nih.gov/articles/PMC13091973/
  48. jaehyeono/whisper-base-korean-lora - Hugging Face, https://huggingface.co/jaehyeono/whisper-base-korean-lora
  49. Zipformer-transducer-based Models - sherpa-onnx, https://k2-fsa.github.io/sherpa/onnx/pretrained_models/online-transducer/zipformer-transducer-models.html
  50. XDcobra/react-native-sherpa-onnx - GitHub, https://github.com/XDcobra/react-native-sherpa-onnx
  51. sense-voice-c-api.c - k2-fsa/sherpa-onnx - GitHub, https://github.com/k2-fsa/sherpa-onnx/blob/master/c-api-examples/sense-voice-c-api.c
  52. Voice Control in Flutter: How to Add Local Speech Recognition to Your App - Medium, https://medium.com/@khlebobul/voice-control-in-flutter-how-to-add-local-speech-recognition-to-your-app-4bcd96bfd896
  53. MGRS grids | ArcGIS Pro documentation - Esri, https://doc.esri.com/en/arcgis-pro/latest/help/layouts/mgrs-grids.html
  54. Military Grid Reference System (MGRS) - Blue Marble Geographics, https://www.bluemarblegeo.com/knowledgebase/calculator/Military_Grid_Reference_System_(MGRS).htm
  55. Drone Design and Control Systems Guide | PDF - Scribd, https://www.scribd.com/document/941866917/Principles-of-Drone-Design
  56. MAVLink XML File Schema / Format, https://mavlink.io/en/guide/xml_schema.html
  57. MAVLINK Common Message Set (common.xml), https://mavlink.io/en/messages/common.html
  58. Mission Commands — Mission Planner documentation - ArduPilot, https://ardupilot.org/planner/docs/common-mavlink-mission-command-messages-mav_cmd.html
  59. Mission Commands — Plane documentation - ArduPilot, https://ardupilot.org/plane/docs/common-mavlink-mission-command-messages-mav_cmd.html
  60. Mission Commands — Copter documentation - ArduPilot, https://ardupilot.org/copter/docs/common-mavlink-mission-command-messages-mav_cmd.html
  61. Lockheed Martin Robocopters Project Senior Design I Presentation - Academia.edu, https://www.academia.edu/35717260/Lockheed_Martin_Robocopters_Project_Senior_Design_I_Presentation
  62. ardupilotmega package - github.com/bluenviron/gomavlib/v2/pkg/dialects/ardupilotmega - Go Packages, https://pkg.go.dev/github.com/bluenviron/gomavlib/v2/pkg/dialects/ardupilotmega
  63. pythonarraytest package - github.com/bluenviron/gomavlib/v2/pkg/dialects/pythonarraytest - Go Packages, https://pkg.go.dev/github.com/bluenviron/gomavlib/v2/pkg/dialects/pythonarraytest
  64. Mission (Plan) Protocol - MAVLink Guide, https://mavlink.io/ko/services/mission.html