이 글은 이론이 아니라 설계도다. 우리 블로그는 하루 6개 글을 자동화로 뽑아낸다. 그 파이프라인에서 키워드 필터가 실제로 어떻게 도는지, 가감 없이 공개한다. 어제 발행된 '검색량 대신 의도' 편이 왜(why)라면, 이 글은 어떻게(how)다.
우리 파이프라인의 키워드 필터 (가동 중)
- 수집 — 헌터가 뉴스·트렌드에서 키워드 후보를 긁어온다. 하루 수십 개가 들어온다.
- 테마 캡 — 같은 주제는 3일에 2개까지. 지난주 '금리'가 3일 동안 4번 뽑히자 걸린 제한이다. 검색량 기준으로는 다 좋은 키워드였는데, 그대로 냈으면 블로그가 금리 전문지가 될 뻔했다.
- 7일 중복 차단 — 같은 시드 키워드는 7일간 재사용 금지. 어제 쓴 주제를 오늘 또 쓰는 일을 원천 차단한다.
- 의도 분류 — '비교·가격·순위·후기' 같은 행동 단어가 든 키워드를 우선 통과시킨다. 이 글의 주제인 '의도 비교'가 실제로 코드로 돌아가는 지점이다.
화려하지 않다. 하지만 이 네 단계가 없으면 공장은 같은 주제의 글을 찍어내는 복제기가 된다. 실제로 그랬고, 그래서 만들었다.
필터 실전 예시: 6개를 3개로
시드 '대출 금리'를 네이버 검색창에 치면 뜨는 자동완성을 의도별로 나눠보자. (아래는 재현용 예시다. 직접 치면 시점에 따라 조금씩 다르다.)
| 자동완성 결과 | 의도 분류 | 필터링 |
|---|---|---|
| 대출 금리 계산법 | 정보 탐색 | 제외 |
| 대출 금리 뜻 | 정보 탐색 | 제외 |
| 대출 금리 비교 | 비교/거래 | 채택 |
| 대출 금리 순위 | 비교/거래 | 채택 |
| 대출 금리 인하 뉴스 | 정보 탐색(시사성) | 제외 |
| 대출 금리 낮은 은행 | 비교/거래 | 채택 |
6개 중 3개(50%)만 남는다. 절반을 버리는 게 아까워 보이지만, 버린 절반은 '읽고 떠나는' 키워드다. 공장의 생산성은 '얼마나 많이 뽑느냐'가 아니라 '얼마나 잘 버리느냐'에서 나온다.
수집 방식 선택: 우리의 답은 '수동 + 스크립트'
방식은 세 가지다. 우리는 둘을 섞어 쓴다.
- 수동 — 자동완성을 직접 기록. 비용 0원, 확장성 낮음. 초기엔 이걸로 충분하다.
- 스크립트 — 자동완성 API를 호출해 CSV로 저장. 정기 모니터링용. 우리 파이프라인의 헌터가 이 방식이다.
- AI 에이전트 위임 — LLM에게 확장과 분류를 맡김. 우리는 아직 안 쓴다. 이유: 할루시네이션 검증 비용이 수동 확인보다 비싸서. AI가 지어낸 키워드로 글을 쓰면 공장 전체가 오염된다.
핵심은 수집 비용이 아니라 검증 비용이다. 수집은 쉬워도 검증이 비싸면 그 방식은 못 쓴다. 자동화의 병목은 언제나 검증이다.
리스크: 비공식 API는 약관 위반 소지
네이버 자동완성 API는 공식 문서가 빈약하다. 비공식 엔드포인트를 두드리면 데이터를 얻을 수 있지만, 이용약관 위반 소지가 있고 과도한 요청은 IP 차단으로 이어진다. 소규모 개인 프로젝트라면 저빈도로 쓰고, 상업적 용도라면 공식 루트(검색광고 API 등)를 타라. 공짜 데이터에도 값이 있다.
효과를 재는 법 (우리가 쓰는 프로토콜)
- 필터 적용 전: 후보 키워드 수와 글쓰기에 쓴 시간을 2주간 기록한다.
- 필터 적용 후: 같은 2주간 같은 지표를 기록한다.
- 비교는 '시간당 발행 글'이 아니라 '시간당 살아남은 글'로 한다. 버려진 초안이 줄었는가가 진짜 생산성이다.
우리도 재는 중이다. GSC 데이터가 쌓이는 대로 이 시리즈에서 숫자로 공개한다. 측정 없는 자동화는 그냥 빠른 헛수고다.
오늘 할 일
- 시드 키워드 3개를 정한다.
- 각각 자동완성 10개씩 복사해 '비교·가격·순위·후기' 필터를 적용한다.
- 남은 키워드만 다음 글감 후보에 올린다. 나머지는 버린다.
버리는 게 이 글의 본체다. 남긴 키워드로 쓴 글이 다음 달에 얼마를 버는지, 그때 다시 이야기하자.
댓글