OpenClaw 메모리 검색에 쓰던 nomic-embed-text를 Kanana-Nano-2.1B-Embedding으로 바꾸고, 실제 업무 문서를 대상으로 검색 결과를 비교했습니다. 목표는 모델의 일반 순위를 정하는 것이 아니라 한국어 운영 규칙과 경로를 더 정확히 찾아오는지 확인하는 것이었습니다.
2026년 4월 당시 세 차례의 질의 묶음에서 Kanana는 6/6, 12/12, 20/20을 기록했고 nomic은 각각 6/6, 11/12, 18/20이었습니다. 이 수치는 제 문서와 정답 기준으로 계산한 top1 적중 기록입니다. 공개 벤치마크나 모든 환경에 적용되는 성능 수치가 아닙니다.
비교 전에 성공 기준부터 정했습니다
임베딩 모델이 실행된다는 사실만으로 메모리 검색이 좋아졌다고 판단할 수 없습니다. 이번 점검에서는 다음 세 가지를 분리했습니다.
| 평가 항목 | 확인한 질문 |
|---|---|
| top1 적중 | 기대 문서가 첫 번째 결과로 올라오는가 |
| 구조 구분 | 비슷한 규칙·경로 문서 중 정확한 대상을 고르는가 |
| 운영 지속성 | 모델 교체와 재시작 뒤에도 같은 검색 경로가 동작하는가 |
특히 실무 메모리에서는 완전히 엉뚱한 답보다 비슷하지만 다른 규칙이 더 위험했습니다. 사용자는 결과가 그럴듯하면 잘못된 경로나 오래된 절차를 그대로 따를 수 있기 때문입니다.
실제 업무 질의를 세 묶음으로 비교했습니다
질의는 한국어, 한국어·영어 혼합, 영어로 나눴습니다. 문서에는 OpenClaw 운영 규칙, Claude Code 메모리 규칙, 블로그 SEO 기준, 업무보고 형식, 프로젝트 보드 동기화 규칙, heartbeat 응답 규칙처럼 서로 비슷한 운영 정보가 포함되어 있었습니다.
| 질의 묶음 | Kanana | nomic | 관찰 |
|---|---|---|---|
| 1차 6개 | 6/6 | 6/6 | 차이 없음 |
| 2차 12개 | 12/12 | 11/12 | 비슷한 규칙 문서에서 차이 발생 |
| 3차 20개 | 20/20 | 18/20 | 한국어 구조 질의에서 차이 관찰 |
세 묶음이 서로 완전히 독립된 표본이었는지, 일부 질의가 확장 과정에서 반복됐는지는 공개 원문만으로 다시 확인하지 못했습니다. 따라서 합산 점수를 하나의 38개 표본처럼 해석하지 않습니다.
차이는 한국어 구조 기억에서 주로 보였습니다
차이가 난 질문은 키워드 하나를 찾는 유형보다 번호 체계, 저장 규칙, 비슷한 프로젝트의 경로를 구분하는 유형이었습니다. 예를 들면 “1번부터 5번까지 고정 구조가 무엇인가” 또는 “Claude 메모리의 저장 경로와 방식은 무엇인가”처럼 정답 후보가 여러 문서에 비슷하게 나타나는 질문입니다.
이번 자료에서는 Kanana가 기대 문서를 첫 번째 결과에 올리는 경우가 더 많았습니다. nomic이 실패한 경우도 관련 없는 문서가 아니라 가까운 다른 규칙을 선택한 형태였습니다. 이 관찰은 한국어 중심 문서 구조에 모델 선택이 영향을 줄 수 있다는 신호이지, 모델 자체의 일반적인 우열을 증명하지는 않습니다.
영어 질의는 별도로 봤습니다
3차 묶음의 영어 전용 질의에서는 두 모델 모두 6/6이었습니다. 일부 질의의 유사도 점수는 nomic이 더 높았지만, 이번 성공 기준은 점수 크기가 아니라 기대 문서의 top1 여부였습니다.
유사도 점수는 모델마다 분포가 다를 수 있어 숫자를 그대로 교차 비교하기 어렵습니다. 같은 임계값을 두 모델에 기계적으로 적용하기보다, 각 모델에서 정답·오답 분포를 다시 확인해야 합니다.
작은 내부 벤치의 한계
- 문서와 정답을 작성한 사람이 평가에도 관여했습니다.
- 질의 수가 작고 특정 업무 규칙에 치우쳐 있습니다.
- top1만 봤으며 top-k 재현율, 지연 시간, 메모리 사용량은 비교하지 않았습니다.
- 청킹 방식, 문서 전처리, 검색 후 재정렬이 결과에 미치는 영향을 분리하지 않았습니다.
- 2026년 4월 이후 모델·런타임·OpenClaw 구성이 달라졌는지 다시 측정하지 않았습니다.
따라서 “Kanana가 모든 한국어 검색에서 더 좋다”가 아니라 “이 문서 집합과 이 질의에서는 교체 근거가 있었다”가 정확한 결론입니다.
다시 비교할 때 남겨야 할 기록
| 항목 | 기록할 내용 |
|---|---|
| 문서 집합 | 문서 수, 언어, 중복·유사 문서의 비율 |
| 전처리 | 청크 크기, 겹침, 메타데이터 포함 여부 |
| 질의 | 원문 질의와 기대 문서, 허용 가능한 대안 |
| 검색 설정 | 모델 버전, top-k, 임계값, 재정렬 여부 |
| 결과 | 순위, 점수, 오답 유형, 실행 시간 |
| 운영 확인 | 재시작 후 인덱스와 검색 경로가 유지되는지 |
이 결과로 결정할 수 있는 것과 없는 것
1차 묶음은 동률이므로 그 결과만으로 교체할 근거는 없었습니다. 2·3차에서 보인 차이는 비슷한 운영 규칙을 구분하는 질문을 더 점검할 근거가 됩니다. 특히 3차의 20/20은 이 묶음의 관찰이지, 다음 질문에서도 오답이 없다는 보장은 아닙니다.
제 업무에서 잘못된 경로를 고르는 문제가 중요하다면 해당 오답 유형을 우선 비교하겠습니다. 반대로 속도나 상시 메모리 부담이 선택을 좌우한다면 이 표만으로는 결정할 수 없습니다. 이 실험은 그 항목을 비교하지 않았기 때문입니다. 서버 구성과 별도 시점의 메모리 관찰은 Kanana 어댑터 연동 기록에서 이어집니다.
교체는 되돌릴 수 있게 진행합니다
- 현재 인덱스와 설정을 백업합니다.
- 같은 문서와 같은 질의로 기준 결과를 저장합니다.
- 새 모델용 인덱스를 별도로 생성합니다.
- 오답이 업무에 미치는 위험을 직접 검토합니다.
- 재시작 뒤 검색을 다시 실행합니다.
- 문제가 생기면 기존 인덱스로 되돌릴 수 있게 유지합니다.
모델 교체 뒤에는 저장 일관성, 인덱스 재생성, 장애 복구까지 함께 봐야 합니다. 검색 결과가 한 번 좋아졌다는 것과 메모리 시스템이 안정적으로 운영된다는 것은 다른 주장입니다.
사례 기준일: 2026-04-10
재편집일: 2026-09-03
확인한 범위: 개인 OpenClaw 환경의 업무 문서와 세 차례 top1 질의 결과
미확인 범위: 공개 표준 벤치마크, 최신 모델 버전, 장기 운영 안정성, 다른 사용자의 재현 결과
편집 메모: 2026-09-10. 당시 경험과 수치를 보존하고 판단 기준과 관련 글 연결을 보완했습니다. 새 설치·성능 시험이나 현재 운영 상태의 재검증을 한 것은 아닙니다.