Stanford CS547 HCI Seminar Spring 2026: Text, Visualization, and Their Combination

Marti Hearst는 텍스트가 부수적인 추가 요소가 아니라 정보 시각화의 핵심 구성 요소이며, 적절한 양과 유형의 텍스트는 이해도를 높일 수 있지만, 예측과 편향 인식은 서로 다른 패턴을 따른다고 주장합니다.

정보 시각화의 정의와 언어의 역할

정보 시각화는 단순한 통계로는 보이지 않는 공간적 관계를 통해 통찰력을 제공하며, 언어(특히 제목과 레이블)는 관찰자가 무엇을 주목하고 기억하는지에 결정적인 역할을 합니다. 시각화는 표현하고자 하는 정보와 체계적으로 공간적 관계를 맺는 외부 시각적 표현입니다. 이는 동일한 충분 통계량이 근본적으로 다른 그래프를 생성하는 Anscombe’s quartet에서 잘 나타납니다. 역사적으로 시각화 커뮤니티는 텍스트에 거의 주의를 기울이지 않았습니다. 예를 들어, Apple의 차트 디자인 가이드라인에는 제목과 눈금 주석이 생략되어 있었습니다. 그러나 아이트래킹 연구에 따르면, 인코딩 과정에서 제목이 가장 긴 고정(fixation) 시간을 기록했으며, 회상 시 언급될 가능성이 가장 높았고, 그 다음이 레이블과 단락이었습니다. 이는 언어가 시각화의 핵심 구성 요소임을 나타냅니다.

텍스트와 시각화 중 무엇을 표현할지 결정하기

디자이너는 먼저 텍스트를 어디에 배치할지, 어떤 의미 수준을 담을지, 그리고 얼마나 상세하게 포함할지를 선택해야 합니다. 이러한 선택이 관찰자의 이해도를 결정하기 때문입니다. 시각적으로 두드러진 영역(빨강, 초록, 蓝)을 계산한 연구에 따르면, 캡션이 가장 두드러진 특징과 일치할 때 참가자의 이해도는 시각적 강조점과 일치했습니다. 반면 캡션이 덜 두드러진 특징을 강조하면 캡션의 내용이 이해도를 지배했고, 일치하는 것이 없을 때는 시각적 특징이 우세했습니다. 이러한 상호작용은 텍스트가 두 양상 중 하나를 압도할 수 있음을 보여주며, 관찰자의 초점과 더 잘 일치하는 쪽이 승리하는 경향이 있습니다.

텍스트의 유형과 다양한 대상에 미치는 영향

외부 맥락을 가져오는 고수준(high-level) 텍스트 설명은 시각 장애가 없는 독자들이 선호하는 반면, 시각 장애인 및 저시력 사용자는 구체적인 수치를 언급하는 저수준(low-level) 설명을 선호합니다. 이는 텍스트가 시각적 요소와 동등하게 취급되어야 함을 시사합니다. 한 접근성 연구에서 참가자들은 캡션을 네 가지 범주로 분류했습니다: 고수준(외부 정보, 예: "가격의 급격한 하락은 2008년 금융 위지로 인해 발생했습니다"), 추세 수준(예: "가격이 변동하지만 그럼에도 불구하고 시간이 지남에 따라 증가합니다"), 저수준(단일 지점의 수치 언급), 그리고 기타 지정되지 않은 수준. 시각 장애인 및 저시력 참가자들은 고수준 설명을 반대하고 저수준 설명을 선호한 반면, 시각 장애가 없는 참가자들은 반대의 패턴을 보였습니다. 저자들은 설계 시 자연어를 시각화와 동등한 요소로 보아야 한다고 결론지었습니다.

차트에 얼마나 많은 텍스트가 나타나야 하는가

텍스트가 없는 상태부터 제목-주석-부제목이 많은 레이아웃에 이르는 실험에서, 참가자들은 압도적으로 관련성 있는 텍스트가 많은 것을 선호했습니다. 다만 상당수의 소수는 차트 자체를 거부했고, 아주 적은 그룹은 텍스트가 전혀 없는 것을 원했습니다. 텍스트 양을 '없음'에서 '제목만'으로, 그리고 '제목+주석+부제목+많은 텍스트'로 변화시켰을 때, 결과는 더 많은 텍스트를 선호하는 것으로 나타났습니다. 원래 논문 제목은 "under and over texting"이었으나, 과도한 텍스트(over-texting)가 나타나는 경우는 없었기에 "striking a balance"로 변경되었습니다. 상당수의 참가자가 차트를 원하지 않았고, 소수는 제목이나 텍스트가 없는 것을 원했으며, 일부는 적당한 양을 선호했습니다. 이러한 결과는 Tufte의 미니멀리즘에 도전하며, 관련 있는 주석이 이해도를 향상시킨다는 점을 시사합니다.

텍스트 주석, 예측 및 인지된 편향

모호한 차트에 텍스트 주석을 추가하는 것이 관찰자의 예측을 바꾸지는 않았지만, 동일한 주석이 강조된 개체에 대한 저자의 예상 편향을 강력하게 암시했습니다. 두 기술 기업의 시장 점유율과 향후 이벤트를 보여주는 차트를 이용한 예측 과제에서, "green market share increased steadily"와 같은 텍스트 주석은 파란색 또는 초록색 중 무엇이 더 높을지 생각하는 참가자의 비율을 바꾸지 않았습니다. 그러나 동일한 레이블이 있을 때, 참가자들은 해당 차트를 초록색에 우호적인 저자의 것으로 간주할 가능성이 더 높았습니다. 이는 텍스트가 시각적 판단을 바꾸지 않더라도 인지된 편향의 강력한 신호 역할을 함을 나타냅니다.

언어 기반 비교와 시각 기반 비교의 비교

언어는 자연스럽게 몇 개의 항목(통상 2~5개)만 비교할 수 있는 반면, 시각적 인코딩은 많은 데이터 지점의 동시 비교를 가능하게 하며, 시각적 맥락이 제공될 때 두 가지를 결합하는 것이 가장 효과적입니다. 언어적 비교는 "respectively"와 같은 단어를 사용하지 않는 한 작은 세트에 국한되지만, 시각화는 많은 지점을 병치, 중첩 또는 명시적으로 인코딩할 수 있습니다. Tableau Research와의 협업에서 "가장 높은 건물을 보여줘"라는 쿼리는 인지 언어학에서 유래한 임계값을 사용하여 어떤 막대를 강조할지 결정했습니다. 역도와 태권도의 이벤트 횟수를 비교하는 채팅 인터페이스 연구에서, 참가자의 41%는 시각화를 보고 싶어 하지 않았습니다. 시각화를 원하는 사람들 중에는 맥락을 제공하는 더 많은 막대를 선호한 반면, 텍스트 전용 응답은 정밀함과 단순함 덕분에 찬사를 받았습니다. 일부 참가자는 시각적 맥락이 텍스트 전용 버전에서 부족했던 정보를 제공한다는 것을 깨달았을 때 선호도를 바꾸기도 했습니다.

텍스트만 선호되는 경우

여러 연구에 걸쳐 상당수의 참가자가 텍스트 전용 프레젠테이션을 선택했습니다(대화형 봇 시나리오에서 41%, 풍부한 데이터 시각화에서 14%). 이는 텍스트만으로도 정보 전달의 실행 가능한 옵션임을 나타냅니다. 의사들을 대상으로 한 베이지안 추론 과제에서 Ottley et al.은 텍스트와 시각화 조건 사이의 정확도에 유의미한 차이가 없음을 발견했지만, 두 가지가 함께 제시될 때 참가자들은 한 가지 양상에 집중하고 다른 하나를 무시하는 경향이 있었습니다. New York Times의 "You Draw It" 연구에서 텍스트 프레젠테이션은 특정 수치 값을 기억하는 데 도움을 주었고, 시각화는 추세를 기억하는 데 도움을 주었습니다. 자신의 예측을 관찰된 데이터와 대조해 보는 것은 시각화가 있을 때만 유용했습니다. 이러한 결과는 텍스트 전용 대안을 제공하는 것이 언어적 정보를 선호하거나 그로부터 이득을 얻는 사용자들을 수용할 수 있음을 시사합니다.

텍스트-시각적 상호작용의 인지 모델

기존의 인지 프레임워크인 이중 부호화(dual coding), 이중 채널(dual channel), 인지 부하(cognitive load), 그리고 이중 프로세스(dual-process, System 1/System 2) 이론은 왜 텍스트와 시각화가 때로는 협력하고 때로는 경쟁하는지에 대해 부분적인 설명을 제공하지만, 단일 모델이 관찰된 복잡성을 완전히 설명하지는 못합니다. 이중 부호화 이론은 기억력을 향상시키기 위해 결합되는 독립적인 시각 및 언어 하위 시스템을 가정합니다. 이중 채널 모델은 채널당 제한된 용량과 채널 간 연결 구축의 필요성을 추가합니다. 인지 부하 이론은 시각적 및 언어적 입력이 동시에 들어오면 작업 기억에 과부하를 주고 이해도를 낮출 수 있다고 주장합니다. 이중 프로세스 관점(System 1 자동적, System 2 노력 필요)이 시각화에 적용되었습니다: A와 B의 평균이 2에 가까운지 2.2에 가까운지 묻는 과제에서, System 1은 잘못된 답인 2로 유도하는 반면, System 2는 2.2에 도달하기 위해 노력이 필요한 계산을 요구합니다. 이는 왜 텍스트 주석이 모호한 시장 점유율 차트에서 예측을 바꾸는 데 실패했는지를 설명할 수 있습니다. 즉, System 1 시각 처리가 직관적 판단을 지배했기 때문입니다. 또한, 아이콘이나 하이퍼링크와 같은 비알파벳-숫자 시각 요소를 단락에 삽입하면 눈을 끌고 단어 인식을 지원하는 parafoveal preview를 방해하여 유창한 읽기를 저해할 수 있는데, 이는 읽기 유창성에 관한 연구(예: Proust and the Squid)에 근거합니다.

멀티모달 언어 모델에 대한 시사점

현재의 멀티모달 대규모 언어 모델은 통합 임베딩 결합(unified embedding concatenation) 또는 교차 주의(cross-attention) 레이어를 통해 시각과 언어를 처리하며, 이는 인간의 이중 채널 처리의 일부 측면을 반영하지만, 이러한 메커니즘이 인간 중심의 텍스트-시각화 결합 설계에 어떻게 정보를 주는지는 불분명합니다. 통합 임베딩 아키텍처에서는 시각 및 텍스트 토큰이 각각 임베딩된 후 표준 트랜스포머 디코더로 전달되기 전에 결합됩니다. 교차 모달리티 임베딩 아키텍처에서는 시각 정보가 먼저 처리된 다음, 교차 주의 레이어를 통해 언어 모델이 사전 학습된 언어 가중치를 유지하면서 시각 토큰에 주의를 기울일 수 있게 합니다. Flamingo 모델은 마스크드 교차 주의(masked cross-attention)를 사용하여 각 텍스트 토큰이 해당 이미지에만 주의를 기울이게 함으로써 이전 이미지가 나중 텍스트에 영향을 미치는 것을 방지합니다. Lava 모델에 관한 연구는 하위 레이어가 일반적인 시각 정보를 언어적 표현으로 전파하고, 중간 레이어가 작업 관련 시각 특징을 전달하며, 상위 레이어가 최종 답변을 생성함을 보여줍니다. 이러한 모델들은 강력한 시각-언어 추론 능력을 보여주지만, 이러한 내부 메커니즘이 텍스트-시각화 과제에 대해 인간의 인지와 어떻게 매핑되는지는 불확실하다고 강연자는 언급했습니다.

향후 연구 방향

텍스트와 시각화가 깊이 얽혀 있으면서도 맥락 의존적이라는 발견을 바탕으로, 향후 연구는 구어(spoken language), 접근성 연결, 문서-시각화 통합, 오정보(misinformation), 다국어 측면, 그리고 텍스트 자체의 시각화를 탐구해야 합니다. 발표자는 시각화를 텍스트 내 참조와 연결하는 것, 텍스트가 시각화 신뢰도에 미치는 영향을 연구하는 것, 다양한 영역에서 서로 다른 양상이 추론에 미치는 영향을 조사하는 것 등의 추가적인 경로를 언급했지만, 시간 제약으로 인해 자세히 설명하지는 않았습니다.

Sources