처리 중입니다…
공급기업 정액제

K2R복합명사DB-한국어편

K2R 복합명사-한국어편은 단순명사와 복합명사를 대조하여 어떤 단순명사에 대해 어떤 복합명사가 있는지 조회할 수 있는 데이터입니다. 설명이 없는 순수 어휘 데이터셋(Dataset) 입니다.이 데이터는 약500만건의 학술논문 저자 키워드를 기반으로 제작되었습니다.40만건의 단순명사에 대해 150만건의 복합명사를 조회할 수 있습니다.단순명사와 복합명사의 매핑 수는 250 만입니다.이 복합명사의 90%는 실제 논문에서 출현된 단어들이며 출현 빈도수에 따른 가중치값을 갖고 있습니다.가중치가 높을 수록 그만큼 많이 사용되는 어휘라고 할 수 있습니다.데이터는 단순명사 컬럼, 복합명사 컬럼, 가중치로 구성되어 있습니다.가중치는 논문에서의 출현빈도 통계를 기반으로 100번 이상 등장하는 복합명사를 10으로(최대값) 정하고 상대적 빈도수를 표시합니다.따라서 가중치는 0.1 ~ 10.0 사이의 값입니다.실제로 출현된 표기를 기준으로 했기 때문에 사전적 의미에서는 복합명사와는 다릅니다.예컨대 "감정노동"과 같은 경우 "감정노동 영향요인, 감정노동 프로세스, 감정노동 수행시간, 감정노 동 전략, 감정노동 선행요인"도 있지만 대체로 "간호사의 감정노동"와 같은 형태로 많이 사용되고 있음을 알 수 있습니다.현재 학술정보 통합검색 서비스(http://b.kdiscovery.kr)에서 확장검색에 사용되고 있습니다."K2R 복합명사" 상품은 실제 문헌에 출현한 그대로의 표현을 그대로 따르고 있습니다.만약 띄어쓰기를 무시하고 normalized 된 데이터를 원하면 별도 제공 가능합니다.

카테고리
통신
제공기관
이지메타주식회사
상품유형
파일
형식
CSV
유·무료 여부
정액제
등록일
2026-02-12

공식 원문 확인

관심목록에서 제거됨