龐大的 TikTok 影片中繼資料集引發存取、研究與隱私疑慮
目錄
你可能想知道
- 這個大型 TikTok 資料集包含哪些資訊?為什麼 AI 研究人員可能會覺得它有用?
- 據稱這些資料是如何蒐集的?這又引發哪些關於平台規則與負責任使用的疑問?
主題
一位以 hashfunction 為名的開發者,已在 Hugging Face 上提供大量 TikTok 影片中繼資料。Hugging Face 是常用來分享機器學習資料集與程式碼的儲存庫。這份資料集透過 DataSocial 帳號發布,涵蓋 2014 年 7 月至 2026 年 10 月的公開影片。據稱,資料集包含約 5.6 billion 部影片的中繼資料,並以非商業授權免費提供下載。
這項資源的涵蓋範圍與儲存需求都相當可觀。檔案總計 460 GB,並以 Parquet 檔案整理,每個月份各有一個檔案。Parquet 是一種以欄為導向的格式,適合分析大型資料集,因為工具可以只處理選定欄位,不一定要一次載入所有欄位。來源資料提到,當時 Hugging Face 頁面顯示有 1,181 次下載。這份資料集也可透過 datasocial.ai 取得。
重要的是,這份資料集包含的是中繼資料,而非影片副本。個別記錄可能包含說明文字、標籤、音效 ID、畫面上的文字、TikTok Shop 商品與賣家 ID,以及互動數據。互動數據包括觀看、按讚、留言、分享、收藏和下載次數。記錄也包含所使用的音樂,以及影片中提及的人物等資訊。雖然資料集沒有創作者帳號名稱欄位,來源文章表示可透過 DataSocial 取得使用者 ID。
部分欄位反映 TikTok 自身的分類方式。例如,記錄可能標示影片是否被判定為 AI 生成,或是否遭平台排除於「為你推薦」頁面之外。較舊影片的 AI 生成標籤通常為空白,文章將此歸因於這些影片來自封存資料。與任何大型資料集一樣,不應自動將空白欄位解讀為影片具備或不具備某種特徵的證據;它可能只表示該資訊無法取得。
這份資料集的重要性不只在於規模,更在於它整合了內容描述、平台標籤與互動數據。研究人員可利用這些欄位,研究語言、音效、商品及其他特徵與影片傳播方式之間的關聯。如此廣泛的資料,也使得謹慎看待允許用途、隱私和資料來源格外重要。
AI 開發者可能重視這項資料集,因為大量且結構化的短影音活動範例並不容易取得。說明文字和標籤提供貼文相關文字;音效 ID 可將貼文連結至音訊;互動數據則提供觀眾反應的衡量指標。這些資料合在一起,或許能支援對廣泛分享內容相關模式、短影音使用語言,或 TikTok Shop 商品探索的研究。在開發能更妥善理解非正式、簡短網路文字的語言模型時,也可能會參考這些資料。
這些可能性應視為潛在應用,而非證明這份資料集適用於所有研究或商業用途。互動統計本身無法解釋貼文為何受到歡迎,而說明文字或音效與高觀看次數之間的相關性,也不能證明因果關係。資料品質、缺漏欄位、平台功能隨時間的變化,以及資料集的整理方式,都可能影響研究結果。負責任的分析應記錄這些限制,而不應將資料集視為 TikTok 的完整或中立全貌。
透過官方管道存取 TikTok 資料的限制較多。符合資格的學術機構研究人員可使用 TikTok Research Tools,適用地區包括美國、EEA、UK、Canada 和 Switzerland,此外,EU 的部分非營利組織也可使用。申請者必須提出申請並獲得核准。這個流程與下載公開資料集不同:它透過 TikTok 自身的研究資料存取架構及資格要求運作。
來源資料也指出,這種做法可能與平台規則相牴觸。TikTok 美國服務條款第 3.4 節禁止使用自動化軟體擷取資料,除非事先取得 TikTok 書面核准。據稱,資料集開發者自己的說明提到,他們在未登入的情況下透過 TikTok 私有行動 API 蒐集資料。根據該說明,所用方法包括產生看似 Android 手機的裝置身分、逆向工程還原請求簽章,以及偽造 TLS 交握。
同一篇文章稱,該系統在三週內蒐集了 3.23 billion 個創作者個人檔案、5.94 billion 部影片,以及 2.8 billion 則留言,過程中沒有登入或使用帳號。這些數字描述的是文章所宣稱的蒐集成果,不應與已發布資料集所稱約 5.6 billion 部公開影片的涵蓋範圍混為一談。它們涉及據稱蒐集作業中不同的類別與階段。這項技術描述也引發授權與平台保護措施方面的疑問,但單憑這些資訊,無法判定該行為的法律地位。
資料集的授權與商業模式增添了另一層考量。Hugging Face 資料集頁面標示授權為 CC BY-NC 4.0,並說明資料集可免費用於研究及個人用途。非商業條款十分重要:免費下載不代表所有用途都獲准。資料集頁面指引有商業用途需求、需要創作者個人檔案或每日更新的使用者前往 datasocial.ai。據稱,爬蟲原始碼另行以 $1,699 出售。
這種安排意味著,使用者在運用資料前,務必檢視授權條款,以及相關服務所附帶的條款。研究人員可能需要考量機構政策、研究倫理審查要求,以及成果的預定用途。考慮開發產品或商業模型的公司,則應特別留意非商業限制並尋求適當建議。在公開儲存庫上可以取得資料,不應被誤認為使用不受限制。
資料爬取也是涉及線上平台與 AI 開發的更廣泛法律爭議之一。2025 年 10 月,Reddit 起訴 Perplexity 和三家資料爬取公司,指控對方以「工業規模」的方式擷取其內容來訓練 AI。根據 Law360,7 月時,一名聯邦法官大致上拒絕駁回此案。獲准繼續審理的主張包括:指控 SerpApi 違反 DMCA,規避 Google 的反機器人保護措施。
這場訴訟提供了背景脈絡,但並非針對 TikTok 資料集的裁決。TikTok 並非 Reddit 案的當事方,而且該案被指控的蒐集方式是透過 Google 搜尋結果進行爬取,而非存取私有行動 API。這項差異很重要:不同案件可能涉及不同技術、條款、當事方與法律問題。因此,一宗訴訟的存在,不能確立另一項資料蒐集作業的結果或合法性。
來源資料還提到,TikTok 封存資料並非唯一的大型同類資料集。Hugging Face 上也有一份 4.5-billion 部影片資料集的副本,據稱同樣透過 TikTok 行動 API 蒐集。多份資料集的存在或許能促成比較研究,但也凸顯了確認資料集是否重疊、記錄如何蒐集,以及文件是否準確描述其內容的必要性。
對潛在使用者而言,實務上的檢視應從資料集頁面及其標示的授權開始。接著,使用者可以評估有哪些欄位、哪些值缺漏,以及記錄是否含有可能將內容連結至個人的識別資訊。他們也應考量如何安全儲存資料、是否只保留必要欄位,以及如何避免在發布分析結果時揭露個人身分。即使資料集包含的是中繼資料而非影片檔,這些步驟仍然重要,因為說明文字、使用者 ID 和其他欄位仍可能具有敏感性或可供連結辨識。
重點摘要表
| 面向 | 說明 |
|---|---|
| 資料集規模與涵蓋範圍 | Hugging Face 上的資料集據稱包含約 5.6 billion 部公開 TikTok 影片的中繼資料,涵蓋 2014 年 7 月至 2026 年 10 月。 |
| 資料格式與大小 | 資料集總計 460 GB,並整理為每月一份的 Parquet 檔案。 |
| 資訊類型 | 記錄可能包含說明文字、標籤、音效 ID、畫面文字、TikTok Shop 識別碼、互動數據,以及部分平台標籤。 |
| 存取與授權 | 資料集採用 CC BY-NC 4.0 授權,供非商業用途使用;商業用途、創作者個人檔案和每日更新則指引至 datasocial.ai。 |
| 據稱的蒐集方式 | 開發者的說明提到使用 TikTok 私有行動 API,並稱蒐集過程未登入。TikTok 美國服務條款禁止未經書面核准而自動擷取資料。 |
| 相關法律背景 | 另一宗 Reddit 訴訟涉及被指控為 AI 訓練而進行的資料爬取,但與 TikTok 或相同的蒐集方式無關。 |
後續……
大型公開資料集的出現,將持續考驗研究、平台治理與 AI 開發如何共存。新工具或許讓分析數十億筆記錄變得更容易,但規模本身並不代表資料集具有代表性、符合倫理,或已獲准用於所有目的。研究人員與開發者需要更完善的方法來記錄資料來源、說明限制,並評估資料集是否符合其來源所適用的規則。
值得進一步投入的方向包括保護隱私的分析方式、可靠的資料集稽核,以及衡量缺漏或過時欄位如何影響結論的方法。能降低個人識別資訊曝光的技術方法,可協助研究人員在不保留超出必要範圍的細部資料下研究整體趨勢。更完善的文件也能釐清資料集如何整理、哪些欄位是平台原始標籤,以及資料多久更新一次。
平台研究計畫也是值得發展的領域。更明確的資格標準、一致的審查流程,以及妥善治理的有用資料存取機制,有助於符合資格的研究人員在尊重平台政策與個人權益的同時,研究線上交流。與此同時,資料來源追蹤工具與稽核方法的進步,或許能協助使用者區分官方研究存取、獨立整理的資料集,以及商業資料服務。
核心挑戰在於,讓研究得以進行,同時不把公開可取得視為取代許可、問責或隱私保護措施的理由。隨著 AI 系統日益仰賴線上內容進行學習,最有價值的進展或許不只是取得更大型的資料集,而是建立透明且負責任的使用方式。
最後編輯時間:2026/10/7
