HAX 스피커v0.2 초안

06

용어 — 처음 읽는 사람을 위해

이 문서에서
  1. 이 프로젝트의 말
  2. 에이전트 쪽
  3. 집 쪽
  4. 하드웨어 쪽
  5. 소프트웨어 쪽
  6. 연구 쪽

본문에 나오는 약어와 고유명사를 한 줄씩 풀었다. 문서 순서가 아니라 주제별로 묶었다.

이 프로젝트의 말

  • HAX — Human–AI interaction/experience. 컴퓨터와 사람의 상호작용(HCI)에 빗대어, 사람과 AI 에이전트 사이의 상호작용을 부르는 우리 말.
  • 주변장치(peripheral) — 키보드·마우스·모니터처럼 컴퓨터 본체에 꽂아 쓰는 입출력 장치. 이 기기의 정체성.
  • 브리지(bridge) — 기기와 에이전트 사이에서 음성 인식, 턴 감지, 라우팅, 세션을 맡는 소프트웨어. 사용자의 홈서버나 PC에서 돈다.
  • 디바이스 프로토콜 — 기기와 브리지가 주고받는 규약(오디오·이벤트·상태·위임/보고·맥락 핸들). 우리가 정의해야 하는 유일한 인터페이스.
  • 맥락 핸들(context handle) — 회의 녹취나 방금 오간 대화 같은 맥락을 기기가 저장하지 않고 "참조"로 에이전트에 넘기는 방식.
  • 핸드오프(hand-off) — 음성으로 다 보여주기 어려운 결과(목록·비교·긴 글)를 근처 화면이나 폰으로 넘기는 것.

에이전트 쪽

  • 에이전트(agent) — 지시를 받아 스스로 도구를 쓰고 여러 단계를 처리하는 AI. 채팅봇과 달리 파일을 만지고 브라우저를 열고 메시지를 보낸다.
  • OpenClaw — 2025년 말 등장해 2026년 초 GitHub 스타 24만을 넘긴 오픈소스 개인 에이전트. 텔레그램·슬랙 등 스무 개 넘는 채널에 붙는다. 이전 이름 Clawd, Moltbot. 흔히 "claw bot"이라 부르는 것.
  • Hermes Agent — Nous Research가 만든 오픈소스 개인 에이전트. 홈서버에서 한 프로세스로 여러 메신저에 붙고, 음성 모드가 있다.
  • Claude Code — Anthropic의 터미널용 코딩 에이전트.
  • MCP (Model Context Protocol) — AI 에이전트가 외부 도구·데이터에 표준 방식으로 접근하게 하는 규약. "AI용 USB"에 비유된다. Home Assistant도 이 규약으로 집 안 기기를 노출한다.
  • A2A (Agent2Agent) — 에이전트끼리 서로 일을 주고받는 규약. Linux Foundation 소속.
  • OpenAI 호환 엔드포인트 — OpenAI API와 같은 모양의 주소. 대부분의 에이전트·도구가 이 모양을 지원해서 서로 붙이기 쉽다.
  • Realtime API / Gemini Live — 텍스트를 거치지 않고 음성을 직접 주고받는 OpenAI·Google의 음성 모델 API.
  • 캐스케이드 vs S2S — 캐스케이드는 음성→글(STT)→LLM→글→음성(TTS) 순서로 잇는 방식, S2S(speech-to-speech)는 음성에서 음성으로 바로 가는 방식.

집 쪽

  • HA (Home Assistant) — 집 안의 스마트 기기를 브랜드 상관없이 한데 묶어 제어하는 오픈소스 허브. 자기 컴퓨터에서 돌리고 클라우드가 필요 없다. Google Home + SmartThings가 하던 일을 내 소유로 하는 것.
  • Home Assistant Voice PE (Preview Edition) — HA 팀이 2024년 말 낸 $59짜리 오픈소스 음성 스피커. 회로도(KiCad)까지 공개되어 우리 하드웨어의 가장 좋은 참고 설계.
  • ESPHome — HA와 짝을 이루는 ESP32용 펌웨어 프레임워크. 설정 파일 몇 줄로 기기를 만든다.
  • Matter / Thread — 스마트홈 기기 표준(Matter)과 그 위에서 쓰는 저전력 무선망(Thread). 우리는 직접 구현하지 않고 HA에 맡긴다.
  • SmartThings — 삼성의 스마트홈 플랫폼.
  • 월패드 — 아파트 벽에 붙은 홈네트워크 단말. 한국은 법으로 망분리가 되어 있어 브릿지 제품으로만 연동된다.

하드웨어 쪽

  • ESP32-S3 — Espressif의 몇 천 원짜리 Wi-Fi·블루투스 마이크로컨트롤러. 스마트 기기의 표준 부품. 우리 LAN 버전의 두뇌.
  • XMOS / XVF3800 — 마이크 소리를 정리하는 전용 오디오 칩 회사와 그 4마이크용 칩. 에코 제거·빔포밍·방향 추정을 칩 안에서 해준다.
  • xiaozhi-esp32 (小智) — ESP32에 올려 "말 걸면 LLM이 답하는 작은 스피커"를 만드는 중국발 오픈소스 펌웨어. 스타 3만, 지원 보드 138종, MIT 라이선스. 우리와 가장 가까운 기존 프로젝트.
  • ReSpeaker — Seeed가 만드는 마이크 어레이 개발보드 시리즈. XVF3800 버전이 우리 첫 데브킷.
  • MEMS 마이크 — 반도체 공정으로 만든 초소형 마이크. SNR(신호 대 잡음비)과 AOP(포화되기 전 최대 음압)가 중요.
  • AEC (Acoustic Echo Cancellation) — 스피커가 내는 소리를 마이크 입력에서 빼내는 기술. 음악 재생 중 말을 알아듣는 barge-in의 전제.
  • 빔포밍 / DoA — 여러 마이크의 시간 차로 특정 방향 소리만 키우는 기술 / 소리가 온 방향을 추정하는 것(Direction of Arrival).
  • barge-in — 기기가 말하거나 음악을 트는 중에 사용자가 끼어들어 말하는 것.
  • 웨이크워드 — "헤이 구글"처럼 기기를 깨우는 말. 기기 안에서 로컬로 감지한다.
  • VAD (Voice Activity Detection) — 지금 사람이 말하고 있는지 판단하는 것. semantic VAD는 "말이 끝났는지"까지 판단한다.
  • STT / TTS — 음성→글(Speech-to-Text) / 글→음성(Text-to-Speech).
  • PCB / PCBA — 회로 기판 / 부품까지 실장된 기판. JLCPCB·PCBWay는 소량 제작 업체.
  • EVT / DVT / PVT — 하드웨어 개발 단계. 설계 검증 → 디자인(양산 금형) 검증 → 양산 검증.
  • KC 적합성평가 — 국내 전자기기 인증. 무선이 있으면 RF 시험이 붙고, 없으면 전자파(EMC)만.
  • BOM — 부품 원가표(Bill of Materials).

소프트웨어 쪽

  • Pipecat / LiveKit Agents — 음성 대화 파이프라인(STT·LLM·TTS·턴 감지)을 조립하는 오픈소스 프레임워크. 브리지의 뼈대.
  • Smart Turn — Pipecat의 턴 종료 판단 모델. 침묵이 아니라 말투로 "끝났는지"를 본다.
  • Whisper / Qwen3-ASR / 리턴제로 / 클로바 — 음성 인식 모델·서비스. 한국어는 리턴제로·클로바가 강하다.
  • Supertonic — 국내 Supertone이 공개한 기기 안에서 도는 한국어 TTS.
  • Porcupine / openWakeWord / microWakeWord — 웨이크워드 엔진. Porcupine만 한국어를 공식 지원한다(유료).
  • speaker embedding / diarization — 목소리 지문 벡터 / 누가 언제 말했는지 나누는 것. 화자 태깅의 기술.
  • STFT / 푸리에 변환 — 소리를 시간-주파수 평면으로 옮기는 수학. 거의 모든 음성 처리의 첫 단계.

연구 쪽

  • ESM (Experience Sampling Method) — 하루 중 짧은 질문을 반복해 실제 경험을 기록하는 연구 방법. 우리가 팀과 가족에게 쓸 방법.
  • Calm Technology — Weiser & Brown(1996). 주의의 주변에 머물다 필요할 때만 중심으로 오는 기술.
  • Mixed-Initiative — Horvitz(1999). 사람과 시스템이 번갈아 주도권을 갖는 상호작용. 언제 끼어들지의 수학.
  • HCAI — Shneiderman의 Human-Centered AI. 높은 자동화와 높은 인간 통제를 동시에.