Zephyr 위에서 동작하는 nRF54L15 센서 노드다. ICM-42688-P 하나를 1kHz로 읽고, 충격 구간의 모달 특징을 디바이스 안에서 추출한다.
펌웨어와 앱은 코드 기준으로는 끝났다. 현재 FLASH 253,464 B, RAM 159,589 B. 기준선에서 2%만 벗어나도 실패시키는 CI 게이트도 걸어뒀다.
8월 2일 첫 보드를 발주했지만 바로 취소했다. 베어보드를 받아 직접 납땜할 생각이었는데, U2를 다시 보니 0.5mm 피치 14패드 LGA에 단자가 전부 부품 바닥에 있었다. 내 작업대에서 붙일 수 있는 패키지가 아니다. 조립 서비스로 다시 주문했더니 이번에는 주문이 두 건으로 나뉘었다. 실장 보드는 3D 프린트 부품과 함께 배송할 수 없다고 한다.
보드는 총 5장. FR-4, 4층, 0.8mm, 지름 21mm, ENIG. 두 부품은 일부러 비워뒀고 도착 후 직접 붙인다. 결제는 끝났고 지금은 생산 중이다. 내가 더 할 수 있는 일은 없다.
이제 판단은 실제 물건이 한다. 조립 상태를 확인하고, 삽입 하중과 축 방향 리텐션을 보는 파괴 벤치를 돌린 다음이 첫 kill gate다. 실제 폼팩터에서 신호가 살아남지 못하면 거기서 끝낸다.
Zephyr, ESP-IDF, STM32, Yocto에 걸친 펌웨어 문제 267개를 다섯 단계로 평가한다. 마지막 단계는 실제 크로스 컴파일이다.
현재 결과는 Sonnet 5 pass@1 67.0%, Sonnet 4.6 pass@1 68.0%.
두 모델이 모두 수행한 232개 케이스만 비교하면 Sonnet 5가 0.9%p 낮다. 사실상 동률이다.
모델 세대가 한 번 바뀌었지만, 적어도 이 벤치마크에서 펌웨어 문제 해결 능력은 측정 가능한 수준으로 좋아지지 않았다.
현재 공개된 결과는 전부 Anthropic 모델이다. 이 상태에서는 리더보드라기보다 Anthropic 모델 리포트에 가깝다.
지금 오픈웨이트 모델과 GPT 계열을 같은 하네스에 태우고 있다. 실행이 끝나기 전에는 숫자를 올리지 않는다.
카테고리별 pass@1 · n=3 평균 · 세 모델 모두 거의 같은 구간에서 무너진다 리더보드 →
고민 중
LLM 기반 개선 루프가 펌웨어 코드베이스를 정말 더 정직하게 만들 수 있을까. 이번 달에만 세 번, 문제를 추적한 끝에 나온 결론은 코드가 아니라 검사가 틀렸다는 것이었다. 에이전트가 코드를 계속 고치게 만드는 것보다, 무엇을 고치면 안 되는지를 정확히 판단하게 만드는 쪽이 더 어려운 문제일지도 모르겠다.
이런 이야기 환영
AI 에이전트를 실제 임베디드 하드웨어에 적용하는 이야기. 데모가 아니라 제품으로 가져갈 때 생기는 문제들, 펌웨어 코드 감사, 신뢰성, 검증, 그리고 하드웨어 코드베이스에서 에이전트를 제대로 동작시키는 방법에 관심이 있다.