Ettin Reranker 패밀리 v1 릴리즈 노트

Ettin Reranker 패밀리 v1 릴리즈 노트

TL;DR

Hugging Face는 Ettin ModernBERT 인코더를 기반으로 하고 mixedbread-ai/mxbai-rerank-large-v2 로부터 포인트와이즈 MSE 디스틸레이션을 통해 학습된 여섯 개의 새로운 Sentence Transformers CrossEncoder 재랭커(ettin-reranker-17m-v1 부터 ettin-reranker-1b-v1까지)를 공개했습니다. 각 모델은 해당 규모에서 최첨단(state‑of‑the‑art) 성능을 보이며, retrieve‑then‑rerank 파이프라인의 정확도와 속도를 모두 향상시킵니다.

Model Family and Release

Ettin Reranker 패밀리는 1,700만에서 10억 파라미터까지 아우르는 여섯 개의 CrossEncoder 모델로 구성되며, 모두 Apache 2.0 라이선스로 제공됩니다. 각 모델은 Johns Hopkins University의 Ettin 스위트에 포함된 해당 Ettin 인코더를 기반으로 하며, 약 1억 4,300만 개의 (쿼리, 문서, 점수) 쌍으로 구성된 데이터셋에서 단일 에포크 포인트와이즈 MSE 손실을 사용해 teacher인 mxbai-rerank-large-v2 로부터 디스틸링되었습니다.

Architecture Details

여섯 모델 모두 동일한 모듈식 아키텍처를 공유하며, 차이는 Ettin 인코더 백본 크기뿐입니다. 아키텍처는 Transformer(패딩 없는 입력을 지원하기 위해 AutoModel 로 로드), CLS 풀링, dense‑GELU 블록, LayerNorm, 그리고 단일 관련 점수를 출력하는 최종 dense 레이어로 구성됩니다. 숨김 차원, 레이어 수, 전체 파라미터 수(헤드 포함)는 다음과 같습니다:

  • 17M: hidden 256, layers 7, 17.6M params
  • 32M: hidden 384, layers 10, 32.8M params
  • 68M: hidden 512, layers 19, 68.6M params
  • 150M: hidden 768, layers 22, 150.9M params
  • 400M: hidden 1024, layers 28, 401.6M params
  • 1B: hidden 1792, layers 28, 1.00B params 모든 모델은 ModernBERT‑style 사전학습 덕분에 최대 8192 토큰까지 컨텍스트를 지원합니다.

Usage

릴리즈된 모델은 표준 Sentence Transformers CrossEncoder이며, 세 줄의 코드로 로드할 수 있습니다. 최대 처리량을 위해 bfloat16과 Flash Attention 2 를 model_kwargs 로 활성화하세요.

from sentence_transformers import CrossEncoder

model = CrossEncoder(
    "cross-encoder/ettin-reranker-32m-v1",
    model_kwargs={"dtype": "bfloat16", "attn_implementation": "flash_attention_2"},
)

rank 메서드는 쿼리와 후보 문서 리스트에 대해 정렬된 인덱스와 점수를 반환합니다. 엔드‑투‑엔드 retrieve‑then‑rerank 파이프라인은 빠른 임베더(예: sentence-transformers/static-retrieval-mrl-en-v1)를 사용해 상위 K 후보를 추출한 뒤, 재랭커로 재정렬합니다.

Retrieval Results (MTEB)

MTEB(eng, v2) Retrieval 벤치마크(NDCG@10, 6가지 임베더 조합 평균)에서 Ettin 재랭커는 다음과 같은 점수를 기록했습니다:

  • ettin-reranker-1b-v1: 0.6114
  • ettin-reranker-400m-v1: 0.6091
  • ettin-reranker-150m-v1: 0.5994
  • ettin-reranker-68m-v1: 0.5915
  • ettin-reranker-32m-v1: 0.5779
  • ettin-reranker-17m-v1: 0.5576 비교를 위해 teacher인 mxbai-rerank-large-v2는 0.6115 점수를 보이며, 1B Ettin 모델은 0.0001 차이로 이를 매치합니다. 가장 작은 17M 모델은 33M ms-marco-MiniLM-L12-v2(0.5066)보다 NDCG@10 기준 +0.051 높은 성능을 보입니다.

Speed Benchmarks

처리량은 bfloat16과 최적의 attention 구현을 사용한 단일 NVIDIA H100 80GB에서 측정되었습니다(초당 쌍 수). 결과는 다음과 같습니다:

  • ettin-reranker-17m-v1: 7517
  • ettin-reranker-32m-v1: 6602
  • ettin-reranker-68m-v1: 4913
  • ettin-reranker-150m-v1: 3237
  • ettin-reranker-400m-v1: 1738
  • ettin-reranker-1b-v1: 928 teacher인 mxbai-rerank-large-v2는 387 쌍/초를 달성하므로, 1B Ettin 모델은 품질을 유지하면서 2.4배 빠른 처리량을 제공합니다. CPU(Intel Core i7-13700K)에서는 17M 모델이 267.4 쌍/초를 기록해 ms-marco-MiniLM-L6-v2(143.9 쌍/초)보다 크게 앞섭니다.

Training Recipe

모델은 단일 에포크 포인트와이즈 MSE 디스틸레이션 레시피로 학습되었습니다. teacher는 mixedbread-ai/mxbai-rerank-large-v2이며, 손실은 원시 teacher 로짓(대략 [−12, 22] 범위) 위에 적용된 MSELoss입니다. 학습 데이터는 공개된 데이터셋 cross-encoder/ettin-reranker-v1-data 로, lightonai/embeddings-pre-training에서 추출한 약 1억 4,300만 개의 (쿼리, 문서, 점수) 삼중항과 lightonai/embeddings-fine-tuning의 재점수화된 서브셋을 포함합니다. 크기에 따라 변하는 하이퍼파라미터는 학습률과 전역 배치 크기이며, 나머지는 모두 동일합니다(num_train_epochs=1, warmup_ratio=0.03, bf16=True, NanoBEIR 평균 NDCG@10을 사용해 5% 단계마다 평가).

  • 17M: lr 2.4e-4, global batch 1024
  • 32M: lr 1.2e-4, global batch 512
  • 68M: lr 3e-5, global batch 256
  • 150M: lr 1.5e-5, global batch 192
  • 400M: lr 7e-6, global batch 256
  • 1B: lr 3e-6, global batch 512 학습 스크립트는 Flash Attention 2 를 위한 패딩 없는 입력을 지원하도록 모듈식 Transformer 를 사용하며, 이는 관찰된 속도 향상의 주요 원인입니다.

Conclusion

Ettin Reranker 패밀리는 기존 MiniLM 재랭커를 대체할 수 있는 강력하고 효율적인 솔루션을 제공하며, 전체 규모에 걸쳐 더 높은 정확도와 속도를 제공합니다. 17M와 32M 모델은 지연 시간에 민감한 애플리케이션에 특히 매력적이며, 1B 모델은 1.5B teacher와 동일한 품질을 파라미터 ¼ 수준으로 유지하면서 2.4배 빠른 처리량을 달성합니다.

Sources