LAXworkspace
알림 · 보고서
오프라인입력 0 (캐시 0%) · 출력 0
새 대화
세션 목록
⚠ 로컬 데몬이 오프라인입니다 — 메시지는 큐에 쌓였다가 데몬이 켜지면 처리됩니다.
리아의 요청: 리아야. 판례 데이터 수집 건 관련해서 LAX 브레인에 정본화해서 다 넣으려고 해. 지금 수집되고 있는 판례 데이터의 (1) 출처/경로(어디서 어떻게 수집 중인지, 파일/DB 위치), (2) 수집 방식(크롤링/재단 수령+가명처리 등), (3) 현재 진행 상태와 규모, (4) 내가 참고할 1차 자료 경로를 알려줘. 브레인 위키에 출처와 함께 기록할 거야.

확인 끝. 라이브 DB 기준으로 정리한다. 리아, 위키에 그대로 옮겨도 되도록 출처 경로까지 박아서 줄게.


판례 데이터 수집 — 정본 (2026-06-22, lax-db 라이브 기준)

(1) 출처 / 경로

  • 출처: 국가법령정보 OPEN API (DRF API), API 키 OC=lax. precedents.source 컬럼 기본값 '국가법령정보'.
  • 수집 채널: 판례 목록 API → 본문 API 2단계. 본문 링크는 detail_link 컬럼에 보관.
  • 저장 위치(DB): Cloudflare D1 lax-db → 테이블 precedents (스키마 정의: migrations/0048_precedents.sql).
  • 대표 주소: lax-dtb.pages.dev (production. 모든 deployment가 동일 lax-db 공유).

(2) 수집 방식

  • 방식: 공식 OPEN API 호출 수집(크롤링 아님). 국가법령정보 판결서는 사건관계인 비실명(가명) 처리 상태로 공개 → 별도 가명처리 불필요.
  • ⚠️ 구분 주의: 메모리에 있던 "재단 당사자 수령+가명처리" 경로는 판결문이 아니라 '판결문 데이터'의 별도 검토 경로(미확정, 검토 단계). 현재 precedents에 실제 적재된 1382건은 전부 국가법령정보 API 경로다. 위키에 둘을 섞지 마.
  • 데이터 성격: 판결문은 작성 대상 서류가 아님. 변우석 판정으로 입력자료 · 청구취지↔주문 정합성 참조 · 사실패턴 학습용. (근거: 0048_precedents.sql 주석 1~3행, legal-doc-dataset-plan/SKILL.md 3대 정답출처 中 3번)

(3) 현재 진행 상태 / 규모 (라이브 집계)

항목
총 인덱스 1,382건
본문(body) 적재 1,339건 (미수집 43건)
수집 키워드(query_tag) 1종 (구상금 단일)
수록 법원 수 45개
판결일자 범위 1962.02.15 ~ 2026.04.09
  • 파이프라인 가동 중. 다음 스텝 = 추출검증 / 키워드 확장(구상금 외 확장 → query_tag 다변화).

(4) 네가 참고할 1차 자료 경로

  • migrations/0048_precedents.sql — 테이블 스키마 + 출처·성격 주석(정본 근거)
  • daemon/agent-skills/bogum/.claude/skills/legal-doc-dataset-plan/SKILL.md — 데이터 수집·학습 계획 원칙(3대 정답출처 / 검증 파이프라인)
  • DB 직조회: npx wrangler d1 execute lax-db --remote --command "SELECT ... FROM precedents"

위키 기록 시 핵심 한 줄: "구상금 판례 1,382건(본문 1,339건)을 국가법령정보 OPEN API(OC=lax)로 수집해 lax-db precedents에 적재. 가명처리는 출처가 이미 비실명 공개. 용도는 학습·정합성 참조이며 작성대상 서류 아님."

다음 액션:

  • [리아][즉시] 위 정본을 브레인 위키에 기록 — '재단 수령+가명처리' 경로는 별도 검토 항목으로 분리 표기(혼동 방지).
  • [리아][기록 후] body 미수집 43건·query_tag 단일(구상금)은 "진행중" 플래그로 명시 — 완료로 적지 말 것.