Files
AI/ontology_platform/tests/fixtures/korean/blog_naver.html
LASTA_DEV01\lasta e260e5f218 docs
2026-05-19 20:31:52 +09:00

22 lines
1.3 KiB
HTML

<!doctype html>
<html lang="ko">
<head>
<meta charset="utf-8">
<title>온톨로지 구축 실험 기록</title>
<meta name="author" content="박지훈">
<meta name="description" content="작은 팀이 온톨로지 구축 과정을 점검한 기록">
<meta property="og:site_name" content="기술 블로그">
<link rel="canonical" href="https://example.test/blog/ontology-build-log">
</head>
<body>
<main>
<article>
<h1>온톨로지 구축 실험 기록</h1>
<p>지난주 팀은 여러 웹 페이지를 수집한 뒤 본문만 남기는 실험을 진행했다. HTML 안에는 메뉴, 광고, 댓글, 추천 글이 함께 있었지만 실제 분석에 필요한 부분은 제목과 본문, 작성자, 게시 시각이었다.</p>
<p>가장 중요한 교훈은 추출 결과를 바로 그래프에 넣지 않는다는 점이었다. 먼저 SourceDocument로 정리하고 EvidenceSpan으로 근거를 나누면, 이후 사람이 후보 엔티티와 관계를 검토할 때 훨씬 쉽게 판단할 수 있었다.</p>
<p>두 번째 실험에서는 같은 글을 다른 URL로 저장해 중복 수집을 확인했다. content hash와 fingerprint가 같으면 이미 처리한 문서로 판단하고, 비용이 큰 LLM 호출이나 후속 변환을 생략할 수 있었다.</p>
</article>
</main>
</body>
</html>