hahababy 設計方法論與原創性爭議

本研究以 NLP 與 BERTopic 分析 hahababy YouTube 頻道的 2.3 萬份逐字稿與觀眾留言,發現內容話語與留言話語幾乎是兩個宇宙,品牌以家庭 IP 與直播電商為核心,缺乏設計師方法論與原創性論述,且存在日本趨勢參考與 SOU・SOU 抄襲指控。

1. 目的

本報告以自然語言處理(Natural Language Processing, NLP)方法,分析 hahababy YouTube 頻道的影片逐字稿(transcript)與觀眾留言(comment),試圖回答以下問題:

  1. hahababy 的語料由哪些主題構成?內容主題與觀眾討論主題是否一致?
  2. 短影片、一般影片、直播三種子集的主題與對齊度有何差異?
  3. 品牌是否具備可識別的設計理念、視覺風格與設計方法論?
  4. 觀眾對 hahababy 原創性與 SOU・SOU 相似性的質疑,是否在語料中有跡象?
  5. hahababy 的設計話語與日本 / 法國 ready-to-wear(RTW)品牌有何結構性差異?

本報告僅基於文字語料進行分析,不做圖像、產品照片或法律層面的比對。所有數字均來自 output/data/ 中的實際輸出檔案。


2. 資料來源

檔案 內容 用途
data/videos.parquet 341 部影片的 metadata(upload_dateview_countlike_countcomment_countdurationlive_status 等) 影片分類、互動分析、對齊子集
data/comments.parquet 觀眾留言原始資料 觀眾話語
data/transcripts.parquet / data/transcripts_clean.parquet 自動語音辨識(ASR)逐字稿 主持人內容話語
data/unified_meta.parquet 23,236 份文件的統一後設資料(含 doc_idvideo_idsourcetextsegmented_text 統一語料
data/unified_embeddings.npy qwen3-embedding-8b 產生的 4096 維向量,已 L2 正規化 語意表徵與對齊
data/chinese_stopwords.txt 中文停用詞表 傳統 NLP 特徵過濾
output/reports/02_topic_gap.md 主題落差分析 內容 vs 留言主題分離
output/reports/13_subset_alignment.md 三子集對齊度報告 子集對齊比較
output/reports/20_traditional_nlp_features.md 傳統 NLP 特徵摘要 詞頻 / n-gram / LDA
output/reports/15_design_clothing_guigui_report.md 服飾 design topic 與貴貴設計師 服飾設計話語
output/reports/17_comprehensive_guigui_designer_report.md 貴貴設計師綜合分析 貴貴產品與互動
output/reports/19_design_philosophy.md 創作理念與設計想法 功能性設計論述
output/reports/21_aesthetic_design_philosophy.md 產品美學設計理念 視覺風格與外部影響
output/reports/22_hahababy_design_originality_assessment.md 設計方法論與原創性總評 原創性 / SOU・SOU / RTW 比較
output/reports/14_sou_sou_event.md SOU・SOU 爭議事件分析 事件驅動話語

3. 資料範圍

3.1 影片與文件規模

指標 數值
影片總數 341
統一後文件總數 23,236
其中 transcript(逐字稿 chunk) 9,479
其中 comment(留言 / 直播聊天) 13,757
有文件覆蓋的 unique video_id 338
分析期間(依 upload_date 2023-03-27 至 2026-07-07(41 個活躍月份)

3.2 子集分類

live_statusduration 分為三類:

子集 影片數 文件數 transcript comment 備註
short(< 90s) 170 1,271 110 1,161 人格 IP / 演算法曝光
regular video(>= 90s 且非直播) 67 12,289 308 11,981 內容核心、高留言
livestream(was_live 104 9,676 9,061 615 帶貨現場、長時直播

註:short 170 支、livestream 104 支、regular video 67 支為實際分類結果,文件數為 data/unified_meta.parquet 中與該子集影片對應的文件總數。

3.3 語意向量

項目 數值
模型 qwen3-embedding-8b(透過 OpenRouter API)
向量維度 4096-d
儲存路徑 data/unified_embeddings.npy
正規化 已 L2 正規化,因此 Euclidean distance 與 cosine distance 一對一對應

3.4 傳統 NLP 特徵

已為以下 6 個子集建立 unigram / bigram / trigram / TF-IDF / BM25 / LDA 特徵,輸出於 output/nlp/{subset}/

  • all:23,236 docs
  • transcript:9,479 docs
  • comment:13,757 docs
  • short:1,271 docs
  • regular:12,289 docs
  • livestream:9,676 docs
參數 設定
停用詞 data/chinese_stopwords.txt
MAX_FEATURES 5,000
MIN_DF 2
n-gram unigram、bigram、trigram
特徵表示 count、TF-IDF、BM25
LDA 主題數 20,max_iter = 5

LDA 結果位於 output/nlp/lda/lda_{all|transcript|comment}_topics.csvlda_*_doc_topics.csv

詞頻 / n-gram 示例

unigram 前 5(count)

子集 top unigrams
all 應該(7,492)、大(7,180)、裡面(7,107)、一樣(6,924)、剛剛(6,058)
transcript 應該(7,313)、裡面(7,069)、大(6,990)、一樣(6,824)、剛剛(6,028)
comment 安全帽(2,152)、辛苦(1,340)、新品(1,125)、聯名(1,122)、珍煮丹(1,095)
short 讚(112)、可愛(92)、二伯(59)、大(43)、生日快樂(39)
regular 安全帽(2,201)、辛苦(1,292)、聯名(1,146)、新品(1,115)、珍煮丹(1,087)
livestream 應該(7,158)、裡面(6,888)、大(6,802)、一樣(6,696)、剛剛(5,893)

bigram / trigram 示例(transcript)

  • bigram:大 姐姐(569)、一樣 一樣(549)、擁抱 點點(541)、大 大(482)、愛心 餅乾(432)
  • trigram:一樣 一樣 一樣(110)、大 大 大(81)、禮拜 禮拜 禮拜(74)、補 補 補(72)、抽 抽 抽(66)

TF-IDF 示例(all):安全帽(0.0265)、辛苦(0.0196)、可愛(0.0174)、新品(0.0160)、聯名(0.0152)。


4. 計算方法

4.1 資料流程

  1. download.sh 下載影片 metadata 與音檔。
  2. consolidate.py 產生 data/videos.parquetdata/comments.parquetdata/transcripts.parquet
  3. clean_hallucinations.py 清理 ASR 幻覺,build_transcripts_ckip_ready.py 產生分段語料。
  4. run_ckip_mlx.py / run_comments_ckip_mlx.py 進行 CKIP 斷詞,產生 segmented_text
  5. run_embeddings.py / run_comments_embeddings.pyqwen3-embedding-8b 產生 4096-d 向量。
  6. build_unified.py 合併為 data/unified_meta.parquetdata/unified_embeddings.npy,並以 CKIP 詞性過濾「1 字非動詞中文字」。

4.2 MLX BERTopic 主題建模

本研究使用本地修補版 MLX BERTopic(位於 mlx-bertopic/,源於 https://github.com/mlx-bertopic/mlx-bertopic)作為 canonical topic model 後端,核心組件均針對 Apple Silicon 以 MLX 重新實作:

模組 實作 參數
降維 MlxUMAP n_neighbors=15n_components=5min_dist=0.0
聚類 MlxHDBSCAN min_cluster_size=30min_samples=5metric=euclidean
詞頻 CountVectorizer 輸入 segmented_text
主題表示 MlxCTFIDF bm25_weighting=Truereduce_frequent_words=True

建模結果:

  • 初始 BERTopic 產出 148 個 active topics + -1 outlier,共 149 列。
  • 以 OpenRouter gpt-4o-mini 為 132 個主題產生可讀的 llm_label(見 output/topic_info_clean.csv)。
  • 離群值再分配:透過 mlx_bertopic.reduce_outliers_embeddings,以 cosine threshold 0.68 對 outlier 文件做 embedding-based 重新指派,將 canonical -1 文件數從 7,723 降至 887output/topic_info_clean.csv)。

4.3 主題相似度與對齊度

主題相似度(Topic Gap)

  • 對每個主題計算 comment_share = comment_docs / (comment_docs + transcript_docs)

  • 對每支同時具有兩種來源的影片(n=269),將 transcript 與 comment 的主題計數正規化為機率分布 P、Q,在主題聯集詞彙表上計算對稱 Jensen-Shannon divergence

    JS(P||Q) = 1/2 KL(P||M) + 1/2 KL(Q||M),  M = 1/2(P+Q)
    
  • JS 範圍為 [0, ln2≈0.693],值越大代表內容主題與留言主題差異越大。

對齊度(Alignment)

  • 對每支影片,計算該影片下所有 transcript chunk 嵌入的平均向量與所有 comment 嵌入的平均向量之 cosine similarity
  • 輸出至 output/alignment_scores.parquet
  • 根據影片長度與 chunk 數進行 multi-chunk / single-chunk 分層,避免 single-chunk 的退化估計。

4.4 主要輸出檔案

檔案 內容
output/topic_info.csv BERTopic 原始主題資訊
output/topic_info_clean.csv 離群值再分配後 + LLM 標籤的主題資訊
output/topics_assigned.parquet 每份文件的主題指派
output/topics_per_class.csv 依 source(transcript / comment)彙整的 top words
output/alignment_scores.parquet 每支影片的 cosine alignment
output/viz/ 互動圖表(topic_source_scatter.htmljs_divergence_hist.html 等)

5. 大主題發現

5.1 主題總覽

指標 數值
總文件數 23,236
有效主題數(不含 -1) 148
LLM 標籤主題數 132
離群值 -1 文件數(再分配後) 887
Top-10 主題佔有效文件比 24.2%
HHI 0.0141(等效主題數 ≈ 71)

5.2 Top 15 主題(依 total_docs

topic llm_label total_docs comment_share 簡述
0 高雄觀光 1,104 0.985 觀眾對「尋找 hahababy」系列的地標反應與社群互動
-1 離群值(未分類) 887 0.645 離群值再分配後的剩餘雜訊 / 跨主題閒聊
2 安全帽製作 767 0.995 觀眾對 MIT 安全帽、手作工廠的驕傲與情緒回饋
12 兒童洋裝 752 0.007 直播帶貨中的童裝尺寸、花色、價格規格
1 Hahababy故事 684 0.923 品牌故事、活動、社群認同與觀眾應援
23 內衣搭配 559 0.002 直播中的 bra-top、內衣尺寸與穿搭
3 酵素產品 505 0.014 食品 / 保健商品的成分、優惠與試吃
13 牛仔外套 496 0.004 牛仔系列商品的版型、顏色、價格
4 背帶包設計 492 0.035 包包 / 平板套等配件的規格與贈品
5 搞笑互動 449 0.989 觀眾情緒互動、幽默回饋、節目效果
6 乳液優惠 411 0.012 保養品的功效、優惠與贈品
24 手機配件 405 0.020 手機周邊、行動電源、保護殼規格
48 幽默反應 400 0.998 觀眾表情符號與社群玩笑
7 直播測試 359 0.942 開播測試、閒聊與觀眾等待互動
25 假日活動 337 0.985 節慶活動、路跑、線下見面的觀眾回饋

來源:output/topic_info_clean.csv,以 total_docs 取前 15 名。

5.3 主題落差:內容 vs 留言幾乎是兩個宇宙

整體 comment_share 基線為 0.592,但主題分布呈現明顯雙峰:

指標 數值
純留言主題(comment_share > 0.85 且 n > 50) 59 個,涵蓋 10,468 份 comment 文件(佔留言量 76.1%
純內容主題(comment_share < 0.15 且 n > 50) 45 個,涵蓋 8,530 份 transcript 文件(佔逐字稿量 90.0%
全體平均 JS divergence(n=269) 0.627
中位數 JS divergence 0.693(接近理論最大值 ln2)
主題集合完全不相交的影片占比 61.0%

代表性分離主題

  • 觀眾主導:T0(高雄觀光 / 觀眾情緒互動,1,087 comment / 17 transcript,comment_share=0.985)、T2(安全帽製作,763 / 4,comment_share=0.995)。
  • 內容主導:T12(兒童洋裝,747 / 5,comment_share=0.007)、T23(內衣搭配,558 / 1,comment_share=0.002)、T3(酵素產品,498 / 7,comment_share=0.014)。

這顯示 BERTopic 幾乎將「逐字稿話語」(帶貨規格、商品價格、ASR 雜訊)與「留言話語」(情緒反應、MIT 應援、品牌驕傲)切為兩個近乎不重疊的主題空間。


6. 子集主題發現

6.1 對齊度比較(依影片子集)

對於同時有 transcript 與 comment 的影片(n=269),依 durationlive_status 分組後的對齊度如下:

子集 n(有對齊分數的影片) mean alignment median alignment 解讀
short 104 0.509 0.521 單 chunk 為主,ASR 雜訊多,對齊度最低
regular video 67 0.765 0.778 內容經過剪輯,主題集中,對齊度最高
livestream 98 0.674 0.693 直播話題集中但隨時間飄移,對齊度居中

來源:output/reports/13_subset_alignment.mdoutput/alignment_scores.parquet 實際計算。

6.2 三子集的角色

子集 影片數 文件數 主題特徵 內容 vs 留言重疊
short 170 1,271 人格 IP(嘎嫂二伯)、表情符號、生日祝賀、短促情緒 transcript 過少,難以計算有意義的主題重疊
regular video 67 12,289 出任務、尋找 hahababy、安全帽、哈姆咖啡、日常 vlog、MIT 應援 向量對齊高(0.765),但離散 topic 重疊仍低(Jaccard ≈ 0.063)
livestream 104 9,676 尺寸 / 身高 / 體重、價格、訂單、bra-top、促銷 幾乎完全分離:host 講商品,觀眾聊社交,0/20 主題重疊

6.3 子集主題示例

  • shorts 熱門主題:人格 IP、節慶生日、表情互動、可愛與讚;97% 僅 1 個 transcript chunk,導致 alignment 結構性失效。
  • regular video 熱門主題:安全帽製作、MIT 工廠、尋找 hahababy、哈姆咖啡開幕、日常系列;這些影片貢獻頻道 57% 觀看、85% 常規留言
  • livestream 熱門主題:尺寸與顏色選擇、bratop、價格規格、補貨通知、路跑活動;逐字稿幾乎全為帶貨語言,留言卻以社交閒聊為主。

7. 特殊主題與概念再分析

7.1 服飾 design topic 是設計話語主力

output/reports/15_design_clothing_guigui_report.mdoutput/reports/17_comprehensive_guigui_designer_report.md 顯示:

  • 前 10 大 design topics 中有 9 個與服飾相關,合計 matched docs 2,017
  • 全部服飾 design topics 共 9 個,主題包括:兒童洋裝、內衣搭配、牛仔外套、尺寸與顏色選擇、布拉托內衣、服裝尺寸建議、睡衣搭配、服裝搭配、服裝設計細節。
  • 服飾圖案語言高度重疊:點點、新花開、愛心餅乾、迷藏兔、擁抱點點、皇冠點點、條紋、滿版、小怪獸。

7.2 貴貴設計師:首席設計師,但主要「畫圖 → 印成產品」

指標 數值
以正則 `貴貴 菜頭貴
HDBSCAN 聚類數 4 個 cluster(0、1、2、3),另含 -1 離群值
貴貴產品相關影片數 14 支
貴貴產品影片總觀看 240,343
貴貴產品影片平均觀看 17,167(約為全頻道平均的 46%
觀眾留言情緒 可愛(6 則)、帥(5 則)、設計(1 則)、畫(1 則)、喜歡(2 則)

直接證據顯示直播主多次稱貴貴為「首席設計師」「貴貴設計師」,並將其畫作印在 T 恤上銷售(貴貴T貴貴設計師T)。然而貴貴的角色更接近「畫圖 → 印花應用」,而非系統性的服裝設計論述。

7.3 功能性設計理念 vs 視覺風格標籤

output/reports/19_design_philosophy.mdoutput/reports/21_aesthetic_design_philosophy.md

層級 內容 數量
功能性 / 規格理念 MIT、純棉、舒適、親子、環保、媽媽代工、在地廠商 最多(19_design_philosophy.md 收錄 303 條帶設計意圖的語句)
視覺風格標籤 可愛、繽紛、撞色、點點、新花開、貴貴圖畫、日系清爽 中等(21_aesthetic_design_philosophy.md 共 1,960 則,其中圖案與印花 661 則、品牌視覺風格 472 則、顏色與配色 382 則)
設計方法論 / 概念敘事 設計過程、季節主題、版型研究、材質實驗、樣衣 幾乎沒有

搜尋設計方法論相關詞彙的結果:

  • 研究方法|設計研究|靈感|mood board|概念板|主題|collection|系列主題:100 筆
  • 打版|版型研究|剪裁|silhouette|輪廓:54 筆
  • 面料開發|材質實驗|布料研究|sample|樣衣:39 筆
  • 設計師訪談|創作過程|設計理念|設計概念|設計方法:9 筆

相較之下,顏色版型尺寸材質舒服可愛點點 等銷售導向詞彙出現數千次。

7.4 SOU・SOU 爭議與日本趨勢參考

output/reports/22_hahababy_design_originality_assessment.mdoutput/reports/21_aesthetic_design_philosophy.mdoutput/reports/14_sou_sou_event.md 顯示:

  • 日系參考:直播主多次提及「日本現在很流行這個款式」「日式版型」「羽織」「風呂夫」「日本一個都上千塊,台灣生產所以便宜」等。
  • 抄襲指控:觀眾留言中至少出現 12 則明確提及 SOU・SOU 或高度相似指控。
  • 標的事件:video_id UP7gGlPEldI(《出任務#30》台灣製手工包包)在 2026-07 爆發爭議,上架後 30–60 天留言量達 208 則,為同齡影片中位數 26 則的 8.2 倍
  • 品牌回應:在 corpus 範圍內,未見 hahababy 對 SOU・SOU 相似爭議的官方回應逐字內容;僅見強調「台灣製造」「貴貴設計師」「自己畫的圖案」。

7.5 與日本 / 法國 ready-to-wear 的比較

維度 hahababy 日本 / 法國 RTW
設計主體 家庭 IP / 直播主 / 貴貴畫圖 設計師 / 創意總監 / 工作室
概念敘事 無系統性季節主題 每季有明確主題與靈感來源
方法論揭露 無:沒有設計過程、研究、樣衣說明 有:設計師訪談、工作室紀錄、秀場 / lookbook
版型 / 剪裁 基本款為主,強調寬鬆、舒適 常有輪廓實驗、結構設計
視覺語言 印花 + 配色 + 可愛形容詞 材質、色彩、輪廓、概念整合
與外部風格關係 跟隨日系 / 日本流行,觀眾質疑與 SOU・SOU 相似 會明確標示參考 / 致敬 / 聯名關係

8. 結論

8.1 總結

hahababy 擁有明確的產品主題市場識別,但在設計方法論原創性論述上明顯薄弱。資料顯示:

  • 它更像是一個以家庭 IP 與直播電商為核心的產品策展品牌,而非由設計師主導、以概念敘事推動的時裝品牌。
  • 主題模型清楚區分出「帶貨規格話語」(transcript 主導)與「情緒應援話語」(comment 主導),兩者在多數影片中幾乎不重疊。
  • 設計話語集中在功能性與規格性論述(MIT、純棉、舒適、親子),視覺風格以可愛、撞色、點點、貴貴圖畫等風格標籤為主,缺乏設計過程、季節主題、版型研究等方法論敘事
  • 貴貴被賦予「首席設計師」稱號,但實際角色更接近「畫圖 → 印花商品化」。
  • 日系 / 日本趨勢在直播中被頻繁引用,觀眾留言中亦存在明確的 SOU・SOU / 抄襲指控;corpus 中未見品牌方對爭議的正面回應。
  • NLP 無法驗證視覺抄襲:本分析只能指出語料中的指控與風格參考,不能證明或否定圖像層級的複製。

8.2 限制

  • 未做圖像比對:未包含產品照片、花色 / 圖案的視覺相似度比對。
  • 未納入外部官方資料:官網、公關稿、媒體採訪、設計師專訪等不在 corpus 內。
  • 無銷售數據:無訂單、轉換率、營收資料,無法評估商業表現。
  • upload_date 異常:部分影片標示 2026 年等未來日期,時間趨勢僅供參考,需以內容進一步校驗。
  • ASR 品質與多語言雜訊:部分 transcript 含有英文 / 韓文歌詞或 ASR 幻覺,可能影響主題純度。

本報告數字已根據 output/topic_info_clean.csvoutput/alignment_scores.parquetdata/unified_meta.parquetdata/videos.parquetoutput/reports/ 相關檔案核實。