跳至主要內容

資料治理、AI 發展與我們的選擇

星期五早上,部門內部辦了一場腦力激盪。我們談了很多題目,其中一個,是「AI治理需要哪些基礎建設」;同日下午參與另一場演講,講者剛好分享台灣 TAIDE 模型的發展過程—談到資料和算力取得的困難,也談到工程師在面對法遵時的抗拒心理—畢竟在工程師的世界裡,「Code is Law」。

兩場活動的現場討論,因為受限於時間,都沒有深入到制度本身的限制。但在活動結束後,讓我重新思考一個核心問題:如果AI真的是下一波技術革命,身在台灣的我們真的已經有能力參與這場革命嗎?

資料治理,不只是開放資料而已

在多次公開場合中,台灣經濟研究院的林副院長經常強調資料治理的重要性,更牽涉到以下面向:

  • 可取得性:是否能跨部會、跨單位、跨領域取得?
  • 品質:是否具備標準、結構與說明?
  • 授權與責任:是否清楚哪些資料能用、怎麼用、誰負責?
  • 維運與資源:是否有穩定預算與長期支持?
台灣的 MyData 與政府開放資料雖然在形式上有推進,但在實際應用上卻處處受限,不同主管機關不一致的安全性標準使執行人員在充滿風險與缺乏信任的環境下工作,也讓人民、企業在取得資料上處處受到限制。

回顧韓國資料治理的制度發展,他們之所以能在 2020 年推動 Data Dam 計畫、大量釋出公共與民間資料,讓銀行、 FinTech 業者介接 MyData 資料建立服務及收費 ,不只是靠政府號召,而是有一整套法令支撐著「再利用」、「匿名化後的合法使用」,以及「免責條款」。

韓國的《資料三法》(個人資料保護法資訊通信網路法信用資訊法)在整合修正後,不只清楚界定資料的再利用情境,也建立了資料去識別化的技術與法律標準,同時提供了「在遵法前提下使用資料者可免責」的條文。這讓企業、政府機關與開發者都可以在明確的框架下進行資料流通,而不用時時擔心法律風險。

台灣在法律層面卻缺乏資料可攜權及對再利用資料的明確界定與免責機制,使民間開發者在使用資料時,始終心存顧慮,不知道會不會踩到模糊地帶;也讓政府內部對資料開放裹足不前,擔心「一開放就出事」。

因此,如果台灣真心想讓 AI 成為下一階段的產業基礎,就不能忽視資料治理的法制建設—這不只是「能不能開放」,而是「開放之後,誰來保護願意開放的那一方」的信任機制。

我們缺的不是資料,而是讓資料變得「能用」的治理機制

我曾經在智慧城市展與一位國外業者談論關於台灣的政府開放資料是否好用?該位業者回應,台灣的政府開放資料似乎「數量豐富、分類完整」,但若問本地的 AI 開發者,他們往往只苦笑:「資料雖在那裡,卻不是真的可用」,隨著民間逐漸將注意力轉往AI或其他新興科技的發展與治理議題,政府開放資料的品質與量,也日漸變差,甚至不再維運。

昨天下午的講者也分享一個實例:他們團隊試圖使用「數位典藏」資料進行訓練,結果下載回來的卻只有圖檔,沒有 OCR 處理過的文字檔,甚至也無法確定是否具備商業用途授權。這樣的資料「可見但不可用」,反而讓開發寸步難行。

這些現象背後反應的其實是:台灣缺乏一個清楚的資料治理主體與責任歸屬,缺乏一套能有效整合資料提供者、使用者與治理者的制度機制,資料治理不只是開放,當初各部會都成立開放資料平台,但當資料品質不一、授權模糊、缺乏跨部整合,就很難讓這些資源成為 AI 發展的燃料。

這不只是技術問題,而是治理邏輯的反應。資料開放成為「儀式性透明」,但實質上仍保留著權力的不對等。在現行的制度設計下,資料仍被視為各部會「手中的資產與優勢」,而不是公共治理的基礎設施。於是:

  • 開放成了形式,
  • 共享變成選擇性地授權,
  • 民間開發者能用的,永遠比政府內部人員能取用的少一截。
  • 這樣的資料不對等,直接影響了 AI 的發展環境,也削弱了整體創新體系的潛力。

我不認為每筆資料都必須無條件開放,但我們應該有一套清楚的資料分級與授權制度,讓開發者知道哪些資料可以申請、哪些資料必須加值付費、哪些資料基於隱私或法規限制無法提供—而不是處在一種資訊灰區,總是「不確定能不能用」或「不知道怎麼申請」。

  • 從治理角度來說,問題不在於技術不夠,而在於:
  • 誰負責確保資料具備可用性?
  • 誰訂定跨部會的一致授權框架?
  • 誰建立資料品質與標準的審查機制?
  • 開放資料背後的營運與維護成本,是否有長期的支持機制?

這些問題若無人主責,就會落入一種無解的輪迴:每個部會都開資料,但沒有人真正「用」資料;資料看似很多,卻沒有成為有用的基礎建設。

制度設計的關鍵,是建立正向的誘因循環

資料治理的推動,不只是技術問題,也不是單靠法規命令就能完成的事。對於公務體系而言,資料代表著部會的權責與專業價值。要求他們無條件開放或放棄資料掌控,本身就會引發組織防衛心理。如果我們無視這一點,只是一味要求「開放」、「共享」,結果只會是形式化的開放、低品質的資料釋出,最終兩敗俱傷。因此,制度設計上必須同時考量:

  • 對公務單位的正向誘因:
    • 讓提供高品質資料的部會能獲得評比加分、資源獎勵個人或提升外部能見度。
    • 在資料共享成果中,清楚標示來源與貢獻單位,讓資料治理成為部門績效的一部分,而非隱形勞務。
  • 對企業與民間的誘因:
    • 提供標準化、可驗證的資料授權與應用條件,降低法律與法遵風險。
    • 建立資料流通市場,允許企業基於開放資料開發商業產品,同時設計回饋機制,讓收益部分反哺資料維護與更新。
    • 提供資料可攜權,讓人民可以自由選擇使用平台。
  • 對公共利益的保障機制:
    • 資料治理必須納入倫理審查、隱私保護與安全性標準,防止資料濫用或侵犯基本權利。

只有當制度設計能讓「資料提供者、資料使用者與社會整體」三方都能看到實際好處,資料治理才可能從口號變成真正的行動。

資料治理是基礎,但 AI 治理才是未來社會信任的核心

這篇文章談到資料治理制度的重要性,即缺穩定、合法、可信任的資料基礎,AI 就無從發展。但我們不能忽視,當 AI 系統日漸普及,治理的重點已不只是資料來源,而是 AI 本身如何被使用、濫用與修正。

舉例來說,生成對抗網路(GAN)已被廣泛應用在影音合成、照片仿真、人聲模擬等領域。當它被濫用於製作偽造新聞、假冒身份,甚至用於性暴力與騷擾時,傷害是真實的,但責任卻常常模糊不清:

  • 誰該為傷害負責?是平台、模型開發者,還是散播者?
  • 如果原始資料未經當事人授權被納入訓練,是否構成侵權?
  • 被害人如何申訴、修復名譽、下架內容?
  • 模型開發方是否有義務建立偵測機制、防止濫用?

這些問題都屬於AI 治理的範疇,卻在多數政策對話中仍被擱置,或簡化為「產業自律」或「技術補丁」。這些問題牽涉的,是公民信任、身分主權與社會公平,不能只是靠技術人員良心或平台條款來維持。

真正的 AI 治理,應當包含以下三層機制:

  1. 前端:制度性的風險預防與開發準則 (如高風險模型須經透明審查)
  2. 中段:平台與開發者的監督義務與即時回應機制(例如違規內容自動下架、來源溯源)
  3. 後端:被害人的補救、申訴與修復機制(包含法律、技術與心理支持)

這樣的治理結構,需要跨部門、跨領域、甚至跨國合作來實現。否則我們只能一再重複「科技跑太快,制度永遠跟不上」的老劇本。

治理,不是立即定規則,而是持續發現問題的過程

我們常常對「治理」有一種誤解,以為它應該立刻建立明確機制、設定邊界、完成法律文本。但事實上,真正有效的治理往往始於開放對話、跨域理解與多元參與。

這也是為什麼我認為類似國際「網路治理論壇(Internet Governance Forum, IGF)」的平台格外重要。雖然它不制定法律、不做政策裁決,但它提供一個難得的空間,讓政府、企業、技術社群、公民社會與使用者都能發聲,彼此聆聽彼此未曾考慮的角度。

正因為 AI 治理涉及的不只是技術與法律,更牽涉價值選擇與權力分配,我們更需要類似的公共討論場域,來發現政策制定者、業者、使用者沒注到的風險、沒傾聽到的聲音、沒思考過的後果。

AI 治理的未來,不會靠單一法規完成,也不會靠單一角色決定,而需要我們共同建立一種願意對話、敢於調整、且持續前行的治理文化。


附註:

這篇文章是我在聽完演講後,在咖啡廳裡與 ChatGPT4o 共同「討論」出來的文章內容,結合我與「它」的想法,包括AI治理、我在開放政府資料活動裡的經驗,及近幾年觀察政府部門對開放政府資料的態度。

昨天晚上在社群平台也看到一些人在說 ChatGPT 只會倒出不正確的資訊。我回顧與它合作的經驗,它的確會產生幻覺與不正確的資訊,它是演算法,如同使用者在社群平台上點了什麼廣告,演算法就會推給使用者什麼資訊,使用者自己也要有判斷資訊是否正確的能力,所以追根究柢,還是要視使用者的行為來決定,而非工具。


Image by Gerd Altmann from Pixabay

留言

此網誌的熱門文章

食品溯源與營養成分分析程式的困難

我之前寫過自己在做一個 分析營養成分的Bot ,用最簡單的方式追蹤每日、每週、每月的營養攝取狀況。做著做著,我發現一個問題:如果這個 Bot 要進一步給予建議,會踩到 誰該給建議的界線 。剛好最近食安新聞不斷,我想起自己多年前放棄的食品溯源專案,於是把原本分析營養成分的 Bot,延伸成一個自己動手做的食品溯源程式。這篇文章想分享的是這個延伸過程裡遇到的三個矛盾:營養分析的黑盒子問題、自己做溯源程式時撞到的資料難題,以及消費者實際採購行為與溯源理想之間的落差。 營養分析的黑盒子 目前市面上以AI分析營養成分的應用,有一塊我一直覺得模糊的區域:使用者無從得知分析依據為何。另外還有一個更根本的問題,使用者吃東西為什麼要先拍照才能吃?拍照分析一餐,本身就是打斷用餐過程,也不符合大部分人吃飯的日常邏輯。唯一真正說得通的應用場景,是把這個功能放進眼鏡裡,讓使用者所見即可分析,不需要額外動作。 即使先不談拍照這件事,營養分析Bot本身也有精準度的問題。脂肪與鈉含量是最難估算的兩項,AI會給出數字,但使用者不知道這個數字的計算依據,實際使用中也會遇到辨識失敗的案例,還需要「教會 AI 學習與記憶」歷次辨識的結果。 動手做自己的食品溯源程式 做到現在,大概能理解當初這類食品溯源計畫為什麼沒有做出大家都想用的成品。核心困難是各方資料庫格式不一致,在沒有 AI 協助的年代,清洗資料、做正規化本身就是一個工程量很大的任務。現在有AI協助,清洗與統一格式的速度快很多,但還是存有資料流失的風險。 台灣食藥署有提供開放資料下載,實際使用後我發現幾個資料本身的漏洞,而這些漏洞不是食藥署一個單位能單獨解決的: 進口商紀錄無延續管制:曾有食安風險新聞的進口商,依然可以繼續進口食品; 廠商自主登錄無強制力:部分食品不會主動登錄食藥署平台,登錄與否全靠廠商自願,沒有強制規範; 品牌名稱相近造成混淆:統一生機、統一生醫、義美生醫、義美生技等大廠的名稱相近,AI在判斷資料時,很難判斷該合併還是分開處理,還需要去工商登記查詢。 相對地,國內較大品牌像聯華、光泉、義美,通常會自建食品溯源網站,並在自家包裝上印刷條碼,消費者掃描條碼就能連結到來源與檢驗結果。這類大品牌的資料完整度高,我做溯源程式時,對於大品牌並建有溯源平台的資料則以品牌自建平台的資料為主,不會再抓下來。 使用行為的矛盾 整個使用流程是拍照或掃描、上...

停不下來的更新

一直更新Blog的版型,我必須承認是一件很無聊的事,不過這次除了版型的更動外,連分類和文章內文也做了變動。 先說分類吧!在Blogger叫做Label,不過,Blogger在分類上有一些bugs,只能使用英文,以前這裡的分類大多都是中文分類,結果在link上就是一堆亂七八糟的亂碼,所以我把它改成英文,同時細分一些項目,把出版的文章和一些教學的文章分開來,雖然已經很久沒寫新的,不過既然放上來就做個分類。然而就在新舊label移轉之後,發現中文的label還會存在,而且還會出現莫名奇妙的幽靈數字,Blogger知道這是個bug,不過似乎一直沒有修復的跡象。所以在分類上就出現了如右圖一般的情況,在英文標籤裡會有文章,但是在中文標籤裡是沒有文章出現的,但奇怪的是,有些中文標籤已經不見了,然而在Beauty-Beta這個部落格裡,我也做了分類上的變動,由於以前用英文開頭的Label,所以在label的變動上倒是不用擔心會有這樣的情況。 再來是文章的內容,把以前的文章重新分類,標題前面的一些全形符號或是分類刪掉,除了一些比較特殊的,我會留著,例如壹陸壹,因為在label裡為了統一,我留著原本的E61,但人家的店名是壹陸壹,所以留下文章標題前面的中文分類,另外像是Entertainment項目裡,可能有音樂,可能有電影,就會在前面留下中文分類。 前簡單的CSS和HTML改成現在的XML,這無疑是讓我們再多學些東西,能有時間鑽研當然是好事,可是轉換後,我一直沒有時間去改,當然多半也是因為懶,到現在也是拿別人做好的版型去改配色而已,所以像裡面的設定、安裝的widget和analytics的javascript都要一個一個重新裝,上個星期幾乎每天都弄到天亮才睡,只為了整理這個blog。也因為之前在blog裡放了technorati的分類,所以還要修改以前的文章,把它們加入technorati,還有裡面的語法要更改,所以這個星期甚至下個星期都會一直收到這裡的更新訊息,對於不斷收到訊息干擾的朋友們,在這裡說聲抱歉。 在版面上因為blogger系統在feed接受上的更新,所以還有四個東西沒加進去,分別是最近的文章(Recent Post)、Comments(目前是用別人寫的widget)還有GVO的feed訂閱顯示、Beauty-Beta的訂閱顯示也都還沒放上去。 在Feed訂閱上,以前bl...

為什麼我支持《數位中介服務法》草案

在經歷許多次反抗台灣政府所立的網路相關法案後,我其實沒想過除了《數位通傳法》草案外,我還會再支持另一部法律草案,雖然 《數位通傳法》草案還壓在某處,但如果有人讀過《數位通傳法》的草案,再讀這部《數位中介服務法》草案,就會知道這部草案的重要性,而且也可以顯示台灣網路使用者的成熟度,更重要的,這是我第一次看到引入國際網路治理多方利害關係人機制的法律草案,而且是用在正確的地方。 有興趣想知道我在讀法條時的筆記和當下的感想,可以看我這則  Tweet 。這篇不使用逐條讀法條的方式來寫,因為那會讓人昏昏欲睡,我也不去比對歐盟《數位服務法》,因為我在讀《數位服務法》草案時,該草案特別強調是加強歐盟 E-Commerce Directive  ,而不是取代它,而且更多著重在預防盜版、仿冒,保護消費者的法案。所以當有輿論提到參考自《數位服務法》的《數位中介服務法》草案限縮言論自由時,我其實是一頭問號的,但一直到今天我才有時間讀《數位中介服務法》草案,這篇文章出自於我的個人經驗和閱讀法案的心得,與擔任的職務無關。 如果最近注意一下網路的資訊,有幾件事該注意一下: 有許多人在社群平台,如Facebook或是其他網路看到一些廣告,而這些廣告可能是要你支持台灣農產品、台灣製的產品,結果你收到時,上面還寫著簡體字,通常這是所謂的一頁式廣告詐騙,而行政院的消費者保護會在 2019 年時就有新聞稿在警告「 一頁式廣告詐騙多 小心查證保障多 」,之後像公視或是其他單位都有相關的活動在提醒大家小心這類廣告。但目前這些廣告其實多數不易處理,因為不容易取證、保留證據,等到追查到時已經找不到對方了。 有不少親密照片與影片在情侶分手後,被報復性的上傳到情色網站或透過即時通訊傳到親友的帳號裡,或是被洩露個資,遭到公開的霸凌。 之前有一個專題:「 青春煉獄:網路獵騙性私密影像事件簿 」,光是讀完這個專題報導我就覺得受傷。 有人使用 Deep Fake 把台灣名人的臉部照片合成至色情影片再上傳至色情影片平台,今年 7 月才被判刑。 還有許多創作者藉由網路分享作品時,被人盜用,甚至有國外的使用者修改台灣人的作品去參與比賽還獲獎。 有一次打電話問某個部會,如果消費者在國外電子商務平台買東西,但資料被外洩怎麼辦?雖然政府願意協助,但衡量至國外打官司的時間和成本,就會讓人卻步。 有些行為在現實世界裡有法...