EdgeLog by Ecro
에세이 Now 소개
EN/ KO
← 모든 태그

#benchmark

글 2개

  • Embedded Dev AI 코드 리뷰는 몇 번 돌려야 할까

    같은 코드에 400회의 LLM 호출을 썼다. 리뷰 1회는 실제 결함의 34%만 본다. 그리고 가장 자주 지적된 항목 4개는 전부 오탐이었다.

    2026년 8월 22일 · 21 min read
  • Embedded Dev AI가 짠 펌웨어: 233개 테스트, Sonnet 68% vs Haiku 57%

    233개 임베디드 펌웨어 케이스에서 Sonnet 4.6은 68.0%, Haiku 4.5는 56.9%. 오픈소스 벤치마크 EmbedEval, 5단계 평가, n=3, Wilson 95% CI. Zephyr와 STM32 HAL 커버.

    2026년 4월 17일 · 4 min read
/SUBSCRIBE · EMAIL

작업 노트를 이메일로

혼자 LLM 하네스로 하드웨어를 만드는 기록. 그 판단을 뒷받침한 벤치마크와 실패까지. 격주 발송, 스팸 없음.

언제든 구독 취소 가능합니다.

또는RSS로 구독.
에세이소개Now
© 2026 EdgeLog
GitHub·Email·NeuroTerm·RSS