06
용어 — 처음 읽는 사람을 위해
본문에 나오는 약어와 고유명사를 한 줄씩 풀었다. 문서 순서가 아니라 주제별로 묶었다.
이 프로젝트의 말
- HAX — Human–AI interaction/experience. 컴퓨터와 사람의 상호작용(HCI)에 빗대어, 사람과 AI 에이전트 사이의 상호작용을 부르는 우리 말.
- 주변장치(peripheral) — 키보드·마우스·모니터처럼 컴퓨터 본체에 꽂아 쓰는 입출력 장치. 이 기기의 정체성.
- 브리지(bridge) — 기기와 에이전트 사이에서 음성 인식, 턴 감지, 라우팅, 세션을 맡는 소프트웨어. 사용자의 홈서버나 PC에서 돈다.
- 디바이스 프로토콜 — 기기와 브리지가 주고받는 규약(오디오·이벤트·상태·위임/보고·맥락 핸들). 우리가 정의해야 하는 유일한 인터페이스.
- 맥락 핸들(context handle) — 회의 녹취나 방금 오간 대화 같은 맥락을 기기가 저장하지 않고 "참조"로 에이전트에 넘기는 방식.
- 핸드오프(hand-off) — 음성으로 다 보여주기 어려운 결과(목록·비교·긴 글)를 근처 화면이나 폰으로 넘기는 것.
에이전트 쪽
- 에이전트(agent) — 지시를 받아 스스로 도구를 쓰고 여러 단계를 처리하는 AI. 채팅봇과 달리 파일을 만지고 브라우저를 열고 메시지를 보낸다.
- OpenClaw — 2025년 말 등장해 2026년 초 GitHub 스타 24만을 넘긴 오픈소스 개인 에이전트. 텔레그램·슬랙 등 스무 개 넘는 채널에 붙는다. 이전 이름 Clawd, Moltbot. 흔히 "claw bot"이라 부르는 것.
- Hermes Agent — Nous Research가 만든 오픈소스 개인 에이전트. 홈서버에서 한 프로세스로 여러 메신저에 붙고, 음성 모드가 있다.
- Claude Code — Anthropic의 터미널용 코딩 에이전트.
- MCP (Model Context Protocol) — AI 에이전트가 외부 도구·데이터에 표준 방식으로 접근하게 하는 규약. "AI용 USB"에 비유된다. Home Assistant도 이 규약으로 집 안 기기를 노출한다.
- A2A (Agent2Agent) — 에이전트끼리 서로 일을 주고받는 규약. Linux Foundation 소속.
- OpenAI 호환 엔드포인트 — OpenAI API와 같은 모양의 주소. 대부분의 에이전트·도구가 이 모양을 지원해서 서로 붙이기 쉽다.
- Realtime API / Gemini Live — 텍스트를 거치지 않고 음성을 직접 주고받는 OpenAI·Google의 음성 모델 API.
- 캐스케이드 vs S2S — 캐스케이드는 음성→글(STT)→LLM→글→음성(TTS) 순서로 잇는 방식, S2S(speech-to-speech)는 음성에서 음성으로 바로 가는 방식.
집 쪽
- HA (Home Assistant) — 집 안의 스마트 기기를 브랜드 상관없이 한데 묶어 제어하는 오픈소스 허브. 자기 컴퓨터에서 돌리고 클라우드가 필요 없다. Google Home + SmartThings가 하던 일을 내 소유로 하는 것.
- Home Assistant Voice PE (Preview Edition) — HA 팀이 2024년 말 낸 $59짜리 오픈소스 음성 스피커. 회로도(KiCad)까지 공개되어 우리 하드웨어의 가장 좋은 참고 설계.
- ESPHome — HA와 짝을 이루는 ESP32용 펌웨어 프레임워크. 설정 파일 몇 줄로 기기를 만든다.
- Matter / Thread — 스마트홈 기기 표준(Matter)과 그 위에서 쓰는 저전력 무선망(Thread). 우리는 직접 구현하지 않고 HA에 맡긴다.
- SmartThings — 삼성의 스마트홈 플랫폼.
- 월패드 — 아파트 벽에 붙은 홈네트워크 단말. 한국은 법으로 망분리가 되어 있어 브릿지 제품으로만 연동된다.
하드웨어 쪽
- ESP32-S3 — Espressif의 몇 천 원짜리 Wi-Fi·블루투스 마이크로컨트롤러. 스마트 기기의 표준 부품. 우리 LAN 버전의 두뇌.
- XMOS / XVF3800 — 마이크 소리를 정리하는 전용 오디오 칩 회사와 그 4마이크용 칩. 에코 제거·빔포밍·방향 추정을 칩 안에서 해준다.
- xiaozhi-esp32 (小智) — ESP32에 올려 "말 걸면 LLM이 답하는 작은 스피커"를 만드는 중국발 오픈소스 펌웨어. 스타 3만, 지원 보드 138종, MIT 라이선스. 우리와 가장 가까운 기존 프로젝트.
- ReSpeaker — Seeed가 만드는 마이크 어레이 개발보드 시리즈. XVF3800 버전이 우리 첫 데브킷.
- MEMS 마이크 — 반도체 공정으로 만든 초소형 마이크. SNR(신호 대 잡음비)과 AOP(포화되기 전 최대 음압)가 중요.
- AEC (Acoustic Echo Cancellation) — 스피커가 내는 소리를 마이크 입력에서 빼내는 기술. 음악 재생 중 말을 알아듣는 barge-in의 전제.
- 빔포밍 / DoA — 여러 마이크의 시간 차로 특정 방향 소리만 키우는 기술 / 소리가 온 방향을 추정하는 것(Direction of Arrival).
- barge-in — 기기가 말하거나 음악을 트는 중에 사용자가 끼어들어 말하는 것.
- 웨이크워드 — "헤이 구글"처럼 기기를 깨우는 말. 기기 안에서 로컬로 감지한다.
- VAD (Voice Activity Detection) — 지금 사람이 말하고 있는지 판단하는 것. semantic VAD는 "말이 끝났는지"까지 판단한다.
- STT / TTS — 음성→글(Speech-to-Text) / 글→음성(Text-to-Speech).
- PCB / PCBA — 회로 기판 / 부품까지 실장된 기판. JLCPCB·PCBWay는 소량 제작 업체.
- EVT / DVT / PVT — 하드웨어 개발 단계. 설계 검증 → 디자인(양산 금형) 검증 → 양산 검증.
- KC 적합성평가 — 국내 전자기기 인증. 무선이 있으면 RF 시험이 붙고, 없으면 전자파(EMC)만.
- BOM — 부품 원가표(Bill of Materials).
소프트웨어 쪽
- Pipecat / LiveKit Agents — 음성 대화 파이프라인(STT·LLM·TTS·턴 감지)을 조립하는 오픈소스 프레임워크. 브리지의 뼈대.
- Smart Turn — Pipecat의 턴 종료 판단 모델. 침묵이 아니라 말투로 "끝났는지"를 본다.
- Whisper / Qwen3-ASR / 리턴제로 / 클로바 — 음성 인식 모델·서비스. 한국어는 리턴제로·클로바가 강하다.
- Supertonic — 국내 Supertone이 공개한 기기 안에서 도는 한국어 TTS.
- Porcupine / openWakeWord / microWakeWord — 웨이크워드 엔진. Porcupine만 한국어를 공식 지원한다(유료).
- speaker embedding / diarization — 목소리 지문 벡터 / 누가 언제 말했는지 나누는 것. 화자 태깅의 기술.
- STFT / 푸리에 변환 — 소리를 시간-주파수 평면으로 옮기는 수학. 거의 모든 음성 처리의 첫 단계.
연구 쪽
- ESM (Experience Sampling Method) — 하루 중 짧은 질문을 반복해 실제 경험을 기록하는 연구 방법. 우리가 팀과 가족에게 쓸 방법.
- Calm Technology — Weiser & Brown(1996). 주의의 주변에 머물다 필요할 때만 중심으로 오는 기술.
- Mixed-Initiative — Horvitz(1999). 사람과 시스템이 번갈아 주도권을 갖는 상호작용. 언제 끼어들지의 수학.
- HCAI — Shneiderman의 Human-Centered AI. 높은 자동화와 높은 인간 통제를 동시에.