22 lines
1.3 KiB
HTML
22 lines
1.3 KiB
HTML
<!doctype html>
|
|
<html lang="ko">
|
|
<head>
|
|
<meta charset="utf-8">
|
|
<title>온톨로지 구축 실험 기록</title>
|
|
<meta name="author" content="박지훈">
|
|
<meta name="description" content="작은 팀이 온톨로지 구축 과정을 점검한 기록">
|
|
<meta property="og:site_name" content="기술 블로그">
|
|
<link rel="canonical" href="https://example.test/blog/ontology-build-log">
|
|
</head>
|
|
<body>
|
|
<main>
|
|
<article>
|
|
<h1>온톨로지 구축 실험 기록</h1>
|
|
<p>지난주 팀은 여러 웹 페이지를 수집한 뒤 본문만 남기는 실험을 진행했다. HTML 안에는 메뉴, 광고, 댓글, 추천 글이 함께 있었지만 실제 분석에 필요한 부분은 제목과 본문, 작성자, 게시 시각이었다.</p>
|
|
<p>가장 중요한 교훈은 추출 결과를 바로 그래프에 넣지 않는다는 점이었다. 먼저 SourceDocument로 정리하고 EvidenceSpan으로 근거를 나누면, 이후 사람이 후보 엔티티와 관계를 검토할 때 훨씬 쉽게 판단할 수 있었다.</p>
|
|
<p>두 번째 실험에서는 같은 글을 다른 URL로 저장해 중복 수집을 확인했다. content hash와 fingerprint가 같으면 이미 처리한 문서로 판단하고, 비용이 큰 LLM 호출이나 후속 변환을 생략할 수 있었다.</p>
|
|
</article>
|
|
</main>
|
|
</body>
|
|
</html>
|