EdgeGround-VLA: Heterogeneous Grounding
for On-Device Goal-Directed Navigation

Open-vocabulary detection + lightweight action head for mobile robot basket navigation.
95.0% real-robot success (95/100 · 5 target positions × 20 trials · 2026-08-07)

모델 구조 & 학습 방식 Research Story GitHub
95%
실기 성공률
95/100 · 5위치 × 20회 (2026-08-07 재검증)
90.5%
그라운딩 성공률
985/1088 프레임 · 같은 100세션 실측
1902 ms
검출 지연 (병목)
OWL-v2 fp32 · 전체 지연의 97%
0.46B
실연산 파라미터
학습 파라미터는 1.128M · 언어 디코더 미사용

Abstract

EdgeGround-VLA는 이동로봇의 바구니 접근 주행을 다룹니다. Kosmos-2를 LoRA로 end-to-end 미세조정하는 방식은 text attention이 구조적으로 0%가 되어 폐루프 성공률 0%로 붕괴했고, 이 경로를 이탈해 분해 파이프라인으로 전환했습니다. 현재 구성은 OWL-v2 오픈 보캐블러리 검출기 + Kosmos-2 비전 인코더(frozen) + MLP 액션 헤드이며, 프레임당 260차원(비전 256 + bbox 4)을 6프레임 묶어 8클래스 이산 액션을 출력합니다. 언어 디코더는 사용하지 않으므로 엄밀히는 VLA가 아니라 "오픈 보캐블러리 검출 + 액션 헤드"입니다. 실기 100회 테스트(5개 목표위치 × 20회)에서 95% 성공(95/100)을 달성했습니다(2026-08-07 재검증). 핵심 발견은 병목이 정책이 아니라 인지라는 것입니다 — 검출이 되면 주행은 대체로 성공하지만 그 역은 성립하지 않아, 검출 난이도와 주행 난이도는 별개의 축입니다 (배치별 정량 근거는 CH64·CH65 참조). 학습되는 파라미터는 액션 헤드 0.866M뿐이고, 실연산 파라미터는 0.46B이며 지연의 97%(1902ms)를 검출기가 차지합니다 — 이것이 경량화의 표적입니다.

Key Findings

Main Results

구분구성실기 성공률 ↑검출 지연비고
E2E VLAKosmos-2 + LoRA (Exp11) 0%text attention 0% 붕괴
구 배포모델exp71 w3 + Transformer 헤드 23.8% (5/21)1902 msthreshold 0.25 · 회복가드 없음
exp73 챔피언OWL-v2 + MLP 헤드 (cadence-aligned) 50.0% (29/58)1902 msthreshold 0.25 · 회복가드 없음
threshold+가드 적용동일 + threshold 0.20 + 회복가드 89.0% (89/100)1902 ms2026-07-31 배치 · 5위치 × 20회
현재 배포동일 (exp73_owl_stage1v3_v6_mlp.pt) 95.0% (95/100)1902 ms2026-08-07 재검증 · 5위치 × 20회 · 판정 기준
검출기 대체(실험)Kosmos-2 patch + 0.279M 헤드 미측정53.8 ms (35배↓) 위치추정만 해결 · has_bbox 미해결로 대체 불가

⚠️ 해석 주의: 구 배포모델 → exp73 챔피언 → 현재 배포는 서로 다른 위치 구성에서 수집돼 교란되어 있습니다. 요인 기여분(체크포인트 교체 vs threshold+회복가드)의 순위는 위치 가중 방식에 따라 뒤집혀 아직 확정하지 못했습니다 — 동일 위치 A/B가 필요합니다. 좌우 성능차(좌 80% vs 우 92.5%)도 Fisher p=0.193으로 유의하지 않습니다. 상세: CH64 64-19 / CH65 65-4.

📁 아래는 시뮬레이션(V5 offline) 이력입니다 — 위 실기 수치와 다른 척도

V5 데이터셋 재생 기반 폐루프 지표로, 실기 성공률과 직접 비교할 수 없습니다. 이 세션에서 offline 지표가 실기를 잘못 예측한 사례가 반복 확인돼(CH64 64-11 철회, CH65 65-1), 현재 판정 기준은 100건 실기 테스트로 고정했습니다. 아래 표는 당시 구조 선택의 근거로만 남겨둡니다.

CL = Closed-Loop success (FPE < 0.5m AND TLD ∈ [0.7, 1.5]). Evaluated on V5 dataset (30 ep val, 9 path types).

Pipeline Ablation (Exp66 계열)

HeadWindowCL ↑FPE ↓
Linear469.0%
FCHead493.1%
MLP ★496.6%0.094 m
LSTM1696.6%0.080 m

Architecture

카메라
720×1280 RGB
실기 저장 원본
OWL-v2
0.155B · 1902 ms
"gray basket" zero-shot
→ cx, cy, area, has_bbox
+
Kosmos-2 비전
0.303B · 54 ms
vision_model만 (frozen)
1024-dim mean pool
image_proj
0.262M · frozen
Linear 1024→256
+ L2 정규화
MLP 액션 헤드
0.866M · 학습대상
1560 → 512 → 128 → 8

프레임 특징 260-dim = bbox 4 (cx, cy, area, has_bbox; area는 bbox_scale=3.0) + 비전 256 (Kosmos-2 vision_model 1024 → image_proj → L2 norm). 헤드 입력은 window=6 프레임을 flatten한 1560-dim, 출력은 8클래스 로짓.
학습되는 것은 MLP 헤드 0.866M뿐입니다 — OWL-v2는 zero-shot, Kosmos-2 비전과 image_proj는 frozen. 언어 디코더는 호출되지 않습니다.
STOP: stop_mode=learned(헤드의 STOP 클래스) + 콜드스타트 가드 3프레임. 과거의 proximity 규칙(area≥0.25 & |cx−0.5|≤0.35)은 현재 미사용입니다.
추론 제어: threshold 0.20 · grounding_skip_n=3(→ 판단 주기 ~1.3Hz) · force_reground_on_miss · 회전 후 강제 재검출 · 회전 0.4s 제한 · 연속회전 차단. 학습 데이터에 has_bbox=False가 0건이라(0/16,599) 모델이 검출 실패 회복을 배운 적이 없어, 이를 제어 계층에서 대신 처리합니다.

상세: 모델 구조 & 학습 방식 · OWL-v2 그라운더 정리

Key Documents

현재 기준 자료입니다. 시뮬레이터 시대 및 구 세대 자료는 아래 이전 자료 모음에 정리해뒀습니다.

Future Work — 미검증 항목

현재 논문(KCI 초안)에는 포함하지 않되, 근거가 아직 없어 검증이 필요한 항목입니다. 논문 Future Work 절의 3항목(양자화·증류 경량화 / Raspberry Pi·Edge 가속기 이식 / 언어 모달리티 zero-shot 확장)과는 별개인, 런타임·검증 축의 남은 과제입니다.

  • ⏱️
    grounding_skip_n 민감도 — "왜 하필 3인가"
    실기 100세션에서 캐시 재사용률 50.8%(553/1088)는 실측했으나, skip_n = 1 / 3 / 5별 성공률 × 지연 트레이드오프 곡선이 없습니다. 현재 값 3은 CH49에서 "SR/FPE 변화 없음"으로 확인한 수준이라, 선택 근거를 곡선으로 제시하려면 별도 A/B가 필요합니다.
  • 🎚️
    OWL-v2 threshold 0.20 vs 0.25 — 실기 A/B 부재
    운영값 0.20의 근거는 ROC 오프라인 분석(오탐 0% · 정탐 94.9%)뿐이고, 0.25(코드 기본값)와의 실로봇 성공률 직접 비교는 수행되지 않았습니다. 100세션 전량이 0.2로 기록되어 있어 현 데이터로는 대조군을 만들 수 없습니다.
  • 🔍
    실패 5건 원인 분해 (95/100의 나머지)
    실패가 그라운딩 미검출에서 왔는지 과회전·정지 판정에서 왔는지 아직 분해하지 않았습니다. 세션 원본에 프레임별 bbox·score·latency가 모두 남아 있어 추가 실기 없이 계산 가능하나, 해당 배치 H5에 세션별 성공/실패 라벨이 없어 (status가 전량 manual_stop) 라벨 대조가 선행되어야 합니다.

이전 자료 모음

아래는 시뮬레이터 시대(V5 offline) 및 구 세대 자료입니다. 당시 결론과 수치(96.6% CL 등)는 현재 판정 기준인 100건 실기와 다른 척도이므로 그대로 인용하지 마세요. 진행 경위 추적용으로 남겨둡니다.