Open-vocabulary detection + lightweight action head for mobile robot basket navigation.
95.0% real-robot success (95/100 · 5 target positions × 20 trials · 2026-08-07)
EdgeGround-VLA는 이동로봇의 바구니 접근 주행을 다룹니다. Kosmos-2를 LoRA로 end-to-end 미세조정하는 방식은 text attention이 구조적으로 0%가 되어 폐루프 성공률 0%로 붕괴했고, 이 경로를 이탈해 분해 파이프라인으로 전환했습니다. 현재 구성은 OWL-v2 오픈 보캐블러리 검출기 + Kosmos-2 비전 인코더(frozen) + MLP 액션 헤드이며, 프레임당 260차원(비전 256 + bbox 4)을 6프레임 묶어 8클래스 이산 액션을 출력합니다. 언어 디코더는 사용하지 않으므로 엄밀히는 VLA가 아니라 "오픈 보캐블러리 검출 + 액션 헤드"입니다. 실기 100회 테스트(5개 목표위치 × 20회)에서 95% 성공(95/100)을 달성했습니다(2026-08-07 재검증). 핵심 발견은 병목이 정책이 아니라 인지라는 것입니다 — 검출이 되면 주행은 대체로 성공하지만 그 역은 성립하지 않아, 검출 난이도와 주행 난이도는 별개의 축입니다 (배치별 정량 근거는 CH64·CH65 참조). 학습되는 파라미터는 액션 헤드 0.866M뿐이고, 실연산 파라미터는 0.46B이며 지연의 97%(1902ms)를 검출기가 차지합니다 — 이것이 경량화의 표적입니다.
| 구분 | 구성 | 실기 성공률 ↑ | 검출 지연 | 비고 |
|---|---|---|---|---|
| E2E VLA | Kosmos-2 + LoRA (Exp11) | 0% | — | text attention 0% 붕괴 |
| 구 배포모델 | exp71 w3 + Transformer 헤드 | 23.8% (5/21) | 1902 ms | threshold 0.25 · 회복가드 없음 |
| exp73 챔피언 | OWL-v2 + MLP 헤드 (cadence-aligned) | 50.0% (29/58) | 1902 ms | threshold 0.25 · 회복가드 없음 |
| threshold+가드 적용 | 동일 + threshold 0.20 + 회복가드 | 89.0% (89/100) | 1902 ms | 2026-07-31 배치 · 5위치 × 20회 |
| 현재 배포 | 동일 (exp73_owl_stage1v3_v6_mlp.pt) | 95.0% (95/100) | 1902 ms | 2026-08-07 재검증 · 5위치 × 20회 · 판정 기준 |
| 검출기 대체(실험) | Kosmos-2 patch + 0.279M 헤드 | 미측정 | 53.8 ms (35배↓) | 위치추정만 해결 · has_bbox 미해결로 대체 불가 |
⚠️ 해석 주의: 구 배포모델 → exp73 챔피언 → 현재 배포는 서로 다른 위치 구성에서 수집돼 교란되어 있습니다. 요인 기여분(체크포인트 교체 vs threshold+회복가드)의 순위는 위치 가중 방식에 따라 뒤집혀 아직 확정하지 못했습니다 — 동일 위치 A/B가 필요합니다. 좌우 성능차(좌 80% vs 우 92.5%)도 Fisher p=0.193으로 유의하지 않습니다. 상세: CH64 64-19 / CH65 65-4.
V5 데이터셋 재생 기반 폐루프 지표로, 실기 성공률과 직접 비교할 수 없습니다. 이 세션에서 offline 지표가 실기를 잘못 예측한 사례가 반복 확인돼(CH64 64-11 철회, CH65 65-1), 현재 판정 기준은 100건 실기 테스트로 고정했습니다. 아래 표는 당시 구조 선택의 근거로만 남겨둡니다.
CL = Closed-Loop success (FPE < 0.5m AND TLD ∈ [0.7, 1.5]). Evaluated on V5 dataset (30 ep val, 9 path types).
| Head | Window | CL ↑ | FPE ↓ |
|---|---|---|---|
| Linear | 4 | 69.0% | — |
| FCHead | 4 | 93.1% | — |
| MLP ★ | 4 | 96.6% | 0.094 m |
| LSTM | 16 | 96.6% | 0.080 m |
"gray basket" zero-shotvision_model만 (frozen)
프레임 특징 260-dim = bbox 4 (cx, cy, area, has_bbox; area는 bbox_scale=3.0)
+ 비전 256 (Kosmos-2 vision_model 1024 → image_proj → L2 norm).
헤드 입력은 window=6 프레임을 flatten한 1560-dim, 출력은 8클래스 로짓.
학습되는 것은 MLP 헤드 0.866M뿐입니다 — OWL-v2는 zero-shot,
Kosmos-2 비전과 image_proj는 frozen. 언어 디코더는 호출되지 않습니다.
STOP: stop_mode=learned(헤드의 STOP 클래스)
+ 콜드스타트 가드 3프레임. 과거의 proximity 규칙(area≥0.25 & |cx−0.5|≤0.35)은 현재 미사용입니다.
추론 제어: threshold 0.20 · grounding_skip_n=3(→ 판단 주기 ~1.3Hz) ·
force_reground_on_miss · 회전 후 강제 재검출 · 회전 0.4s 제한 · 연속회전 차단.
학습 데이터에 has_bbox=False가 0건이라(0/16,599) 모델이 검출 실패 회복을
배운 적이 없어, 이를 제어 계층에서 대신 처리합니다.
상세: 모델 구조 & 학습 방식 · OWL-v2 그라운더 정리
현재 기준 자료입니다. 시뮬레이터 시대 및 구 세대 자료는 아래 이전 자료 모음에 정리해뒀습니다.
초고에서 근거가 약하거나 검증이 필요한 문장을 항목별로 추려 대응한 기록.
Read → Architecture파이프라인 · 260-dim 특징벡터 · 파라미터 실측(0.46B 연산 / 1.82B 로드) · 학습 설정 · 추론 제어 로직 · RoboVLMs와의 관계. 미팅 발표용.
Read → Grounder채택 이력(방향 추정 0%로 폐기 → 좌표 공급기로 재채택) · threshold/fp16/skip_n 계수별 반응 · 젯슨 gap 원인 배제 과정.
Read → Latest오프라인 감사에서 실기 89%까지. 100건 결과 · 요인 분해 · 젯슨 gap 정량화 · 자체 철회 2건(64-11, 64-19) 기록 포함.
View → Future"지시문에 따라 액션이 달라지는" VLA로 가는 단계 계획(L1~L4). 과거 지시문 실험이 라벨 누출이었음을 재해석하고, 라벨 누출을 원천 차단하는 과제 설계와 검정 프로토콜을 착수 전에 고정.
View → Next교수님 제안 Florence-2 백본 교체 검정. 오프라인은 전부 통과(cx MAE -24%, Stage1 val_acc +0.83%p, Stage2 val_acc +1.29%p). Jetson 실측(fp16 167.2ms vs Kosmos-2 53.7ms)은 확인됐으나, 실 배포 cadence(~1.3Hz, 그라운딩이 지연의 97% 지배)로 재계산하면 저하폭은 15~20% — 지연만으로는 기각 근거가 약해 소규모 실기 A/B로 재판정 예정.
View → Latestflip 대조로 4층위(데이터·그라운더·헤드·기구) 검정. 부호로 용의자를 가려 헤드 고정 편향을 원인으로 특정하고 미러 증강으로 제거. 기구 편향은 미검증.
View → Latest검출 난이도 ≠ 주행 난이도. 충분조건은 성립하나 필요조건은 아님(강우 반례) · 계측 인프라 · 검출기 Step 1~2 결과.
View → PlanOWL-v2 대체 계획. 오프라인 주석 파이프라인 증류 · 평가 프로토콜 사전 고정 · 중단 기준. Step 0~2 완료, has_bbox negative 대기.
Read plan → HistoryExp11(0%) → Exp14 → Exp54/66 → exp73 계열까지의 평가 기록. 시뮬레이션 지표 위주.
View →현재 논문(KCI 초안)에는 포함하지 않되, 근거가 아직 없어 검증이 필요한 항목입니다. 논문 Future Work 절의 3항목(양자화·증류 경량화 / Raspberry Pi·Edge 가속기 이식 / 언어 모달리티 zero-shot 확장)과는 별개인, 런타임·검증 축의 남은 과제입니다.
grounding_skip_n 민감도 — "왜 하필 3인가"0.2로 기록되어 있어 현 데이터로는 대조군을 만들 수 없습니다.
bbox·score·latency가 모두 남아 있어
추가 실기 없이 계산 가능하나, 해당 배치 H5에 세션별 성공/실패 라벨이 없어
(status가 전량 manual_stop) 라벨 대조가 선행되어야 합니다.
아래는 시뮬레이터 시대(V5 offline) 및 구 세대 자료입니다. 당시 결론과 수치(96.6% CL 등)는 현재 판정 기준인 100건 실기와 다른 척도이므로 그대로 인용하지 마세요. 진행 경위 추적용으로 남겨둡니다.
논문 부록 시각 자료 — 아키텍처 다이어그램, Zero-shot Probe, Masking flip, 5-Track 검증. 시뮬레이션 기준 수치 포함.
View figures → GroundingKosmos-2 · PaliGemma2 · LoRA 계열 그라운딩 비교. 현재 배포 그라운더는 OWL-v2이며 최신 정리는 상단 "OWL-v2 그라운더 정리"입니다.
Explore → DebugOWL-v2 첫 실기 배포 실패 — vis_feat 정규화 버그 발견 + VLA 언어조건화 재검증. OWL 채택 경위의 배경 문서.
Read → Robot초기 실로봇 세션 기록. 현재 기준 실기 결과는 CH64 64-18(100건)을 보세요.
View → Ablation바구니 마스킹 시 액션 flip — frozen 인코더가 바구니를 독립적으로 포착한다는 인과 증거.
View → AnalysisCH40 계열 hidden state 액션 헤드 분석. PM은 올랐으나 closed-loop 미개선으로 종결.
View → Snapshot2026-06-21 시점 스냅샷. 진행 경위 참고용.
View → ArchiveV4 이전 실험 및 초기 포트폴리오 페이지 모음.
Open → Relatedπ0 계열 Flow Matching VLA. closed-loop 45.8%로 "헤드 구조보다 데이터"라는 결론을 독립 재현(CH63 63-6).
Open →