아카이브 · 연구소 11곳 · 디스패치 450건

연구소

매일 아침 십여 개의 공식 블로그를 돌아볼 필요가 없습니다. OpenAI, Anthropic, DeepMind 등의 일차 발표를 핵심만 뽑아서.

401

집단적 헌법형 AI: 공공의 참여로 언어 모델을 정렬하기

Anthropic와 Collective Intelligence Project는 약 1,000명의 미국 시민이 참여한 공공 헌법을 기반으로 언어 모델을 정렬하는 방법을 개발하여, 기업 내부 헌법에 맞춰 정렬된 모델보다 사회적 편향이 낮은 모델을 만들었다.

402

Anthropic 연구: 사전 학습을 통한 언어 모델 분해

Anthropic 연구진은 사전 학습을 활용해 언어 모델 층을 단일 의미적 특징으로 분해하는 방법을 개발하여, 개별 뉴런 수준에서는 보이지 않는 복잡한 신경망 활성화를 해석할 수 있게 했다.

403

Anthropic 언어 모델을 이해 가능한 구성 요소로 분해하기

Anthropic 연구원들은 사전 학습(dictionary learning)을 사용하여 신경망 활성화를 해석 가능한 특징(features)으로 분해하는 방법을 개발하여, 해석 불가능한 개별 뉴런의 한계를 넘어섰습니다.

404

앤트로픽: 인공지능 시스템 평가의 도전 과제

앤트로픽은 견고한 인공지능 평가를 구축하는 데 있어 기술적 및 운영적 어려움을 설명하며, 효과적인 인공지능 거버넌스는 이러한 측정 과제를 극복하는 데 달려 있다고 주장한다.

405

Anthropic, 아마존으로부터 40억 달러 투자 유치 및 AWS Bedrock를 통한 클로드 2 확장 접근 발표

Anthropic는 아마존으로부터 최대 40억 달러의 투자를 발표하며, AWS를 모델의 주요 클라우드로 지정하고 Amazon Bedrock를 통해 클로드 2의 접근성을 확장하여 기업에 더 안전하고 고성능의 AI를 제공합니다.

406

Anthropic Claude의 100k 토큰 컨텍스트 창을 위한 프롬프트 엔지니어링 가이드

Anthropic는 70–95k 토큰 문서에서 Claude의 기억력을 크게 향상시키기 위해 참조 인용문 추출과 다수의 인컨텍스트 예시 제공이 효과적임을 정량적으로 입증한 연구를 발표했다.

407

앤트로픽 책임 있는 규모 확장 정책

앤트로픽은 AI 안전 수준(ASL)을 활용해 AI 모델의 능력과 치명적 위험 증가에 따라 더 엄격한 안전성 및 보안 절차를 의무화하는 책임 있는 규모 확장 정책(RSP)을 도입했다.

408

Anthropic과 BCG의 기업용 AI 배포를 위한 파트너십

Anthropic은 Claude AI를 기업용 전략적 서비스에 통합하기 위해 Boston Consulting Group (BCG)과 파트너십을 맺었으며, 안전하고 책임감 있는 생성형 AI 솔루션의 배포에 집중하고 있습니다.

409

Claude Pro 출시 노트

Anthropic은 Claude.ai를 위한 유료 구독 플랜인 Claude Pro를 출시했으며, 이는 월 $20(미국) 또는 £18(영국)로 Claude 2 모델의 5배 더 많은 사용량, 우선 접속 권한 및 새로운 기능 조기 도입 혜택을 제공합니다.

410

Anthropic과 SK Telecom 파트너십 발표

Anthropic과 SK Telecom (SKT)은 통신 산업을 위한 맞춤형 LLM을 개발하기 위해 상업적 파트너십 및 전략적 투자를 체결했습니다.

411

Claude Instant 1.2 릴리스 노트

Anthropic는 수학, 코딩, 추론 및 안전성 측면에서 1.1 버전보다 향상된 더 빠르고 저렴한 모델인 Claude Instant 1.2를 출시했습니다.

412

영향 함수를 통한 대규모 언어 모델 일반화 연구

Anthropic 연구원들은 EK-FAC 근사법을 사용하여 영향 함수를 최대 520억 개의 파라미터를 가진 LLM으로 확장하여, 모델 동작을 유도하는 특정 훈련 예제를 식별할 수 있게 합니다.

413

Anthropic 연구: 영향 함수를 사용한 모델 출력에서 훈련 데이터 추적하기

Anthropic 연구진은 최대 520억 파라미터의 LLM에 영향 함수를 확장하여, 모델 규모가 커질수록 일반화가 더 추상적이고 개념 중심으로 전환됨을 발견했습니다.

414

Anthropic의 AI 안전을 위한 전면 위협 적군 훈련

Anthropic는 국가안보 위험을 식별하고 완화하기 위해 전면 위협 적군 훈련 프레임워크를 구축했다. 특히 제한되지 않은 LLM이 다음 2~3년 내에 생물무기 개발을 가속화할 수 있다고 밝혔다.

415

Anthropic Frontier Model Security Framework

Anthropic은 도난 및 오용을 방지하기 위해 양자 제어와 보안 소프트웨어 개발 표준에 기반한 프론티어 AI 모델을 위한 보안 프레임워크를 제안합니다.

416

Anthropic, 모델 생성 추론의 신뢰성 향상에 있어 질문 분해의 효과를 입증

Anthropic는 표준 사고의 흐름 프롬프트에 비해 질문을 하위 질문으로 분해하는 방식이 대규모 언어 모델의 추론 신뢰성에 크게 기여함을 발표했다.

417

Anthropic의 Chain-of-Thought 추론의 충실도에 관한 연구

Anthropic은 대규모 언어 모델이 종종 충실하지 않은 chain-of-thought 설명을 생성하며, 충실도는 작업과 모델 크기에 따라 크게 달라진다는 것을 발견했습니다.

418

Claude 2 출시 노트

Anthropic은 100K 토큰 컨텍스트 창, 코딩 및 추론 성능 향상, 그리고 Claude 1.3 대비 강화된 안전성을 특징으로 하는 Claude 2를 출시했습니다.

419

Anthropic, LLM 내 주관적 글로벌 의견 표현을 측정하기 위한 GlobalOpinionQA 프레임워크 도입

Anthropic은 LLM이 미국 및 특정 유럽의 의견을 반영하는 경우가 많다는 것을 밝히는 데이터셋이자 정량적 프레임워크인 GlobalOpinionQA를 출시했습니다. 또한 프롬프팅이나 번역이 이러한 편향을 전환할 수는 있지만 완전히 수정할 수는 없음을 보여줍니다.

420

NTIA에 대한 Anthropic AI 책임성 권고안

Anthropic은 NTIA에 대규모 학습 실행 사전 등록, 위험 대응형 평가, 표준화된 평가를 중심으로 한 포괄적인 AI 책임성 프레임워크를 제안했습니다.

421

Anthropic 해석 가능성 꿈의 연구 비전

Anthropic은 거대 신경망 분석을 가능하게 하기 위해 중첩 문제를 해결하는 데 중점을 둔 기계론적 해석 가능성에 대한 장기적 비전을 제시합니다.

422

Anthropic Circuits 5월 2023 업데이트

Anthropic의 2023년 5월 해석 가능성 업데이트는 다중 에이전트 시스템 실패, 근로자 재교육 프로그램의 증거, 그리고 리만 제타 함수에 대한 Claude의 연구 버전의 진전을 다룹니다.

423

Anthropic, 신뢰할 수 있는 AI 제품 확장을 위해 4억 5천만 달러 규모의 Series C 투자 유치

Anthropic은 Claude 어시스턴트 개발을 가속화하고, 제품군을 확장하며, AI 안전 연구 자금을 지원하기 위해 Spark Capital이 주도하는 4억 5천만 달러 규모의 Series C 라운드를 발표했습니다.

424

Anthropic과 Zoom의 파트너십 및 투자

Anthropic과 Zoom은 Claude AI를 Zoom의 기업용 협업 제품에 통합하기 위해 파트너십을 맺었으며, Zoom Ventures는 Anthropic에 투자했습니다.

425

Anthropic, Claude를 위한 100K 토큰 컨텍스트 창 발표

Anthropic은 Claude의 컨텍스트 창을 9K에서 100K 토큰으로 확장하여, 모델이 수백 페이지의 텍스트를 1분 미만으로 흡수하고 분석할 수 있도록 했습니다.

426

클로드의 헌법: 모델 정렬을 위한 헌법적 인공지능 구현

애너트릭은 인간의 암묵적 피드백에만 의존하지 않고, 명시적인 서면 원칙을 사용하여 클로드를 유용하고 정직하며 해로움이 적은 모델로 훈련하는 방법인 헌법적 인공지능을 소개한다.

427

Anthropic 연구: 분산 표현, 구성, 그리고 중첩

Anthropic은 분산 표현에서 구성과 중첩의 차이를 명확히 하며, 이 두 메커니즘이 신경망의 일반화와 선형 계산 가능성에 미치는 영향을 설명합니다.

428

Anthropic과 Scale의 기업용 생성형 AI 파트너십

Anthropic은 Scale의 플랫폼에 Claude AI 어시스턴트를 통합하기 위해 Scale과 파트너십을 맺었으며, 기업에 배포 도구, 프롬프트 엔지니어링 및 보안 데이터 통합을 제공합니다.

429

인텔리전트 제안: AI 측정을 위한 NIST 예산 증대

Anthropic는 효과적인 AI 규제를 위한 전제 조건으로, 국립 표준 기술 연구소(NIST)가 표준화된 AI 측정 도구와 안전 기준을 개발할 수 있도록 적극적인 예산 증대를 제안한다.

430

Anthropic, 트랜스포머 잔차 스트림에서의 특권적 기저를 밝혀내다

Anthropic은 트랜스포머 잔차 스트림의 차원이 임의적인 것이 아니라 Adam의 차원별 정규화 인자로 인해 특권적 기저와 정렬된다는 것을 발견했으며, 이는 기존의 이론적 가정을 정면으로 반박합니다.

431

Claude 소개

Anthropic은 유익하고, 정직하며, 해롭지 않은 AI 어시스턴트인 차세대 AI 어시스턴트 Claude를 출시했으며, 고성능 버전과 빠르고 가벼운 버전으로 제공됩니다.

432

Anthropic의 AI 안전성에 대한 핵심 관점

Anthropic는 전환적 AI 시스템의 급속한 확장과 관련된 치명적 위험을 완화하기 위해 경험 기반의 포트폴리오 기반 접근법을 제시합니다.

433

Anthropic 연구: LLM의 도덕적 자기 교정 능력

Anthropic 연구는 RLHF로 학습된 대규모 언어 모델(LLM)이 지침을 받았을 때 유해한 출력을 피하기 위해 도덕적으로 자기 교정을 할 수 있음을 보여주며, 이는 22B 파라미터에서 나타나는 능력입니다.

434

Anthropic, AI 인프라를 위해 Google Cloud와 파트너십 체결

Anthropic은 Claude 어시스턴트를 포함한 자사의 AI 시스템을 훈련, 확장 및 배포하기 위해 GPU 및 TPU 클러스터를 활용할 수 있는 클라우드 제공업체로 Google Cloud를 선정했습니다.

435

Anthropic 연구: 중첩(Superposition), 암기(Memorization), 그리고 이중 하강(Double Descent)

Anthropic 연구원들은 단순한 신경망에서 중첩, 암기, 그리고 과적합 사이의 관계를 조사하며, 중첩이 모델이 암기하는 동안 뉴런 수보다 더 많은 특징을 저장할 수 있게 해준다는 점을 시사합니다.

436

Anthropic Research: 언어 모델 행동을 모델이 작성한 평가로 탐지하기

Anthropic 연구진은 언어 모델을 사용하여 고품질의 평가를 자동으로 생성하는 방법을 개발하여, 더 큰 모델에서의 역방향 스케일링과 사치성과 같은 새로운 행동을 탐지했습니다.

437

Constitutional AI: Harmlessness from AI Feedback

Anthropic은 유해한 출력을 줄이기 위해 인간의 라벨링 대신 규칙 세트(constitution)와 AI 피드백을 사용하여 해롭지 않은 AI 어시스턴트를 훈련하는 방법인 Constitutional AI를 소개합니다.

438

대규모 언어 모델의 확장 가능한 감독(Scalable Oversight)에 대한 진척도 측정

Anthropic 연구원들은 인간이 결국 복잡한 작업에서 자신을 능가할 수 있는 AI 시스템을 감독할 수 있도록 보장하기 위해, 확장 가능한 감독을 경험적으로 연구하기 위한 프레임워크를 제안합니다.

439

Anthropic의 중첩(Superposition) 토이 모델 연구

Anthropic 연구원들은 작은 ReLU 네트워크를 사용하여 특징이 희소하다면 모델이 중첩(superposition)이라는 현상을 통해 차원보다 더 많은 특징을 표현할 수 있음을 보여줍니다.

440

Anthropic 언어 모델 레드팀 보고서 – 방법론, 스케일링 동작 및 교훈

Anthropic은 RLHF 모델이 규모가 커질수록 레드팀 공격이 더 어려워진다는 상세한 연구를 발표했으며, 다른 모델 유형은 레드팀 가능성이 일정하게 유지되는 반면, 그들은 커뮤니티의 안전성 향상을 돕기 위해 38,961개의 공격 데이터셋을 공개했습니다.

441

Anthropic 연구: 언어 모델은 (대부분) 자신이 무엇을 아는지 알고 있다

Anthropic 연구는 대규모 언어 모델이 자신의 주장의 타당성을 효과적으로 평가하고 답변을 알고 있을 가능성을 예측할 수 있음을 보여주며, 더 정직한 AI를 향한 경로를 제공합니다.

442

Anthropic Softmax Linear Units (SoLU) 연구

Anthropic은 모델 성능을 희생하지 않으면서 해석 가능한 뉴런의 비율을 높이는 MLP 활성화 함수의 구조적 변화인 Softmax Linear Units (SoLU)를 도입합니다.

443

Anthropic 연구: 반복 데이터 학습의 스케일링 법칙 및 해석 가능성

Anthropic 연구원들은 학습 데이터의 아주 적은 일부를 반복하는 것이 모델의 용량을 암기에 사용하게 만들고 유도 헤드(induction heads)와 같은 일반화 구조를 손상시켜 LLM 성능을 심각하게 저하시킬 수 있다는 것을 발견했습니다.

444

Anthropic AI 안전 및 연구를 위한 시리즈 B 투자 유치

Anthropic은 계산 집약적인 AI 모델의 조종 가능성, 해석 가능성 및 견고성을 개선하기 위한 대규모 실험 인프라를 구축하기 위해 시리즈 B 펀딩에서 5억 8,000만 달러를 유치했습니다.

445

Anthropic: RLHF를 통한 유익하고 해롭지 않은 어시스턴트 학습

Anthropic은 인간 피드백 기반 강화 학습(RLHF)이 어시스턴트가 유익하고 해롭지 않음을 보장하면서 대부분의 NLP 평가에서 언어 모델의 성능을 향상시킨다는 것을 보여줍니다.

446

Anthropic In-context Learning and Induction Heads

Anthropic은 2022년 3월 8일에 “In-context Learning and Induction Heads”라는 제목의 연구 포스트를 발표했지만, 해당 페이지에는 관련 링크만 포함되어 있으며 실질적인 기술적 세부 사항은 포함되어 있지 않습니다.

447

Anthropic 연구: 대규모 생성 모델의 예측 가능성과 놀라움

Anthropic은 대규모 생성 모델의 예측 가능한 손실 스케일링과 예측 불가능한 특정 능력 및 출력의 창발 사이의 긴장 관계를 식별하며, 이는 AI 안전 및 정책에 과제를 제기합니다.

448

Anthropic, Transformer 회로에 대한 수학적 프레임워크 발표

Anthropic는 Transformer 회로에 대한 새로운 수학적 프레임워크를 간략히 발표하며, 모델 행동에 대한 깊이 있는 이해를 가능하게 할 잠재력을 강조했지만, 게시물에서는 기술적 세부 사항을 제공하지 않았다.

449

Anthropic 연구: 정렬을 위한 실험실로서의 범용 언어 어시스턴트

Anthropic은 유익하고, 정직하며, 해롭지 않은 범용 언어 어시스턴트를 만들기 위한 방법을 탐구하며, 순위 기반 선호도 모델링이 모방 학습이나 이진 판별보다 더 효과적으로 확장된다는 것을 발견했습니다.

450

Anthropic의 신뢰할 수 있는 범용 AI 시스템을 위한 Series A 투자 유치

Anthropic은 조종 가능하고, 해석 가능하며, 견고한 대규모 AI 시스템을 개발하기 위해 Series A 펀딩에서 1억 2,400만 달러를 유치했습니다.