EmilStenstrom/conllu

A CoNLL-U parser that takes a CoNLL-U formatted string and turns it into a nested python dictionary.

해결하는 문제

CoNLL-U Parser는 자연어 처리(NLP) 작업의 출력으로 자주 사용되는 CoNLL-U 형식의 문자열을 처리하기 위한 가벼운 Python 라이브러리입니다. 이 라이브러리는 이러한 형식화된 문자열을 프로그래밍적으로 조작하기 쉬운 구조화된 Python 데이터 유형(사전과 리스트)으로 변환합니다.

작동 방식

이 라이브러리는 두 가지 주요 파싱 메서드를 제공합니다:

  • parse(): CoNLL-U 데이터를 각 문장이 순서가 지정된 사전으로 표현된 TokenList를 포함하는 평탄한 문장 리스트로 변환합니다.
  • parse_tree(): 데이터를 중첩된 TokenTree 구조로 변환하여 CoNLL-U 파일의 head 열을 기반으로 문장의 의존성 트리를 표현합니다.

대용량 파일의 경우 전체 데이터셋을 메모리에 로드하지 않기 위해 인크리멘탈 파싱 메서드(parse_incrparse_tree_incr)를 제공합니다.

대상 사용자

CoNLL-U 형식의 NLP 데이터셋을 다루는 개발자 및 연구자로, 데이터를 파싱하고, 필터링하고, 수정하고, 다시 CoNLL-U 형식으로 직렬화해야 하는 경우에 적합합니다.

주요 특징

  • 의존성 없음: 라이브러리는 약 300줄의 코드로 구성되어 있으며 외부 의존성이 없습니다.
  • 유연한 파싱: 사용자 정의 필드 이름, 사용자 정의 필드 파서, 사용자 정의 메타데이터 파서를 지원하여 비표준 CoNLL-U 형식에도 대응할 수 있습니다.
  • TokenList 유틸리티: 람다 기반 필터링을 포함한 내장된 필터링 기능과 데이터를 텍스트로 다시 직렬화할 수 있는 기능을 제공합니다.
  • 의존성 트리 지원: 평탄한 토큰 리스트를 계층적인 의존성 트리로 변환하여 탐색이 용이하게 합니다.
  • 강력한 테스트: 100% 테스트 브랜치 커버리지와 멀티레이션 테스트를 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트