Zeno + speak-mcp

16GB Mac에서 35B 로컬 AI를 돌리는 흥미로운 실험, 그러나 아직은 실험에 가깝다

최근 Icosa Computing이 공개한 Zeno라는 macOS용 로컬 AI를 설치해 보았다. 회사 설명에 따르면 전체 MoE expert를 메모리에 올리지 않고, 사용되지 않는 expert weight는 SSD에 두었다가 필요한 expert만 RAM으로 읽어들이는 방식을 사용한다. 따라서 inactive expert를 SSD에 보관하고 필요한 expert만 가져온다. Icosa 역시 Reddit에서 Zeno가 inactive MoE expert weights를 disk에 유지하고 active expert만 RAM으로 불러온다고 설명하고 있다.

뭐… 설명이 어떻든, 결국 내가 하고자 하는 일에는 쓸수가 없다. Qwen 모델의 문제인지, 아니면 하려는 일의 사이즈가 이 방식에 맞지 않는지 솔직히 잘 모르겠다.

더 흥미로운 것은 LMShop이다

LMShop은 현재 IBM Granite 4B, Google Gemma 12B, Qwen 3.6 35B 등을 기반으로 사용자가 올린 문서에서 training set을 만들고 LoRA tuning을 한 뒤 결과 모델을 GGUF로 다운로드하게 한다. 그리고 이 모델을 다시 Zeno에서 로컬로 사용하는 그림을 그리고 있다. Zeno/LMShop 이 오픈소스가 된다면 로컬 AI를 구동하는 방법에 획기적인 방향전환이 일어날 수 있겠다는 생각이 든다.


매 턴마다 영어/한국어를 macOS TTS로 출력하게 했다

이걸 위해 speak-mcp를 조금 뜯어고쳐 각 언어마다 다른 Voice를 쓰게 했는데, AGENTS.md 규정을 따를 때가 있는가 하면, 개무시하고 기본적으로 박혀있는 system prompt를 따라가곤 했다.

Runtime 에서 동작하는 콤포넌트는 너무 무겁고 희안하기까지 하다. 제품으로써가 아니라 테스트용으로 만든 앱으로 밖에 보이지 않는다.

사용할수록 Qwen 모델의 Weight를 변화시킨다는데… 글쎄; 그걸 확인할 방법도 UI도 없다.

가지고 노는 정도 외에, 제품으로서는 아직 추천하기 어렵다.

Leave a Reply

Your email address will not be published. Required fields are marked *