管理資訊系統(MIS)/研究所
將人工智慧整合進組織中各層級員工的日常工作流程—從高階管理者到第一線工作人員,可以提升多種任務的生產力,例如撰寫備忘錄、開發軟體以及製作行銷活動,不過其實企業對於與第三方AI服務共享資料所帶來的風險始終抱持著非常合理的疑慮,從2023年著名的「Samsung ChatGPT 洩密事件」中我們也可以略見一二其中的緣由。
三星工程師使用ChatGPT導致機密資料外洩事件 三星電子半導體部門(Device Solutions Division, 簡稱DS)一直是公司最重要的單位:因為他們手裡的是良率配方、製程參數、晶圓測試演算法,如果這些機密資訊外洩等於把幾十億美金研發成本送給競爭對手,由於部門存在如此高價值的資訊,三星很久以前就把ChatGPT等AI工具列入「禁用清單」,但是到了2023年3月底,三星DS部門做了一個以結果來看非常大膽的決定:決定放寬使用AI工具的限制,三星DS部門的解釋是因為高層主管認為若員工能善用AI工具,將能大幅提升工程師生產力,因此經過評估後選擇開放使用,但在開放的同時也訂出明確的使用指引:「不要把公司機密直接貼進AI中尋找答案」。
結果也非常地令人不意外,就在三星導入ChatGPT應用後短短不到20天的時間,在2023年4月初便接連爆出三件工程師因不當使用ChatGPT協助程式除錯等因素,而不慎將公司機密資訊外洩的事件。
第一位是某位負責撰寫Facility Measurement Database download program的人員,因為原始碼出現錯誤,該員工便複製出有問題的原始碼到ChatGPT,並向ChatGPT請教解決方法,但這個操作反而讓三星設備測量資料庫的schema結構的原始碼、API名稱以及權限設計模型成為ChatGPT學習資料。
第二個案件則是一位握有識別瑕疵設備的程式碼的員工,他為了要瞭解設備良率等資訊,將製作的程式碼輸入進ChatGPT中,並要求ChatGPT優化其程式碼並同樣把整段程式碼貼進對話框中,結果此事件造成外洩的不只是程式碼本身,甚至連半導體製造中極為重要的know-how:yield management,也就是三星如何從製程資料判斷機器的損壞、晶圓的瑕疵的演算法邏輯直接洩漏出去,這些資訊對於如像SK 海力士、台積電來說更是價值連城的重要資訊。
第三位洩密事件則與技術較無關聯,是一位員工在內部會議裡使用手機錄音,會議結束後他希望使用語音轉文字服務把錄音檔轉成逐字稿,因此把整份逐字稿貼進 ChatGPT,請它幫忙整理成會議紀錄。然而公司的內部會議中自然包含像是近期技術決策內容、會議中的職稱、職位也會顯示公司內部組織結構、會議的代號也包含了一些當時尚未公開的產品線與設備。這些資訊雖然乍看之下與技術本身沒什麼關聯,然而也因為這些會議資訊多是以文字直接展現企業判斷思維,因此與前面兩件洩密事件不同,前兩件洩漏的資訊為程式碼,競爭者即便拿到相關資訊也要花一段時間才能解讀出裡面所隱含的重要訊息,會議記錄任何人只要獲得都能立刻看懂,因此第三件洩密案例反而可能擁有最大的損害風險。
這個案例除了迫使三星緊急祭出防護措施,例如限制提問字數,隨後全面禁止員工使用外部AI工具,並加速內部開發專屬的安全AI系統外,其實也凸顯了企業面對生成式AI時的資安隱憂,不禁讓人想起當初雲端運算早期的情況,當時使用者也曾擔心傳送到遠端伺服器的資料在安全性與所有權方面的問題。然而,事到如今管理者已能放心使用成熟的雲端運算服務,因為目前這些服務早已符合眾多與資料安全、隱私及所有權有關的法規與商業要求。
與雲端相較之下的AI服務,特別是生成式AI部分,現在則在這些方面仍遠不成熟,部分原因除了是這個領域仍處於較早期階段外,另一個原因則是這些大型語言模型對訓練資料有近乎無窮無盡的需求,例如OpenAI的ChatGPT是透過在網際網路取得的大量書面內容語料上進行訓練,OpenAI基本上也時常毫不顧慮這些資料的所有權,也創造出許多資料所有權的爭議訴訟,例如知名社群網站的Reddit訴OpenAI案、馬斯克的X.com對OpenAI的訴訟;如今更因為未經授權使用原創性文學創作者受著作權保護的作品,使模型得以生成仿作內容,而面臨一些暢銷知名作家包括George R.R. Martin等人所提出的訴訟。除此之外,為了主動保護自身資料,傳統媒體機構開始與AI開發商展開協商;然而OpenAI與《紐約時報》之間的談判則在該年夏季期間破裂。
因此對於正在嘗試生成式AI導入可行性的企業而言,除了AI工具本身可以帶來的效益之外,更迫切的問題可能在於:任何上傳至商用 LLM 服務的內容都可能被擷取作為訓練資料的情況下,企業該如何安全地探索那些需要運用內部資料的LLM 新應用場景?管理者又該如何更妥善地保護自身的專有資料資產,並改善企業AI開發實務中的資料治理,以贏得並維持客戶信任?
其實解決這個問題有一個很明顯的方法,那就是在由企業自行建置生成式AI工具,而不把資料傳送給第三方模型使用,例如在三星事件中的例子,三星意識到單純「禁用」AI工具並不能解決問題,反而只會把員工逼到用個人裝置、個人帳號繼續偷用AI,因此在事件爆發的同年11月便推出自己訓練、部署的LLM「Samsung Gauss」,將所有對話內容完全留在三星內網。
但這種作法顯然不是隨便一間企業都有能力可以從零開始打造這些基礎模型,考量到Microsoft光是為了讓OpenAI訓練ChatGPT就投入了數億美元打造的硬體基礎設施,更不用說實際的開發成本,三星的Samsung Gauss顯然也是所費不貲,那麼這種做法要如何才具可行性?也許存在一個比較符合成本效益的解方,那就是「開源語言模型」,開源語言模型得以讓企業更安全地嘗試生成式AI效能,就如同當年圍繞Linux興起的熱潮,當時一套任何人都能閱讀與編輯原始碼的免費作業系統問世,催生出一個個開發者社群;他們在彼此成果的基礎上持續精進,逐步打造出一整套成熟的軟體工具,而這些工具也持續支撐著今日網際網路的運作。
如今,AI也迎來了這樣的「Linux時刻」,在眾多開源模型之中,例如Bloom、Vicuna與Stable Diffusion等,都提供了可針對特定任務進一步微調的基礎模型。對高效率訓練流程,如LoRA與BitFit的研究也發現,這些模型可以使用一般商用硬體進行微調,進而催生出一個快速成長的模型生態系,其表現已逐漸逼近ChatGPT等專有模型的能力,也讓部分研究人員感嘆「we have no moat」,顯示有些人認為開源創新的爆發,正威脅著科技巨頭對大型語言模型的掌控。
然而,若要安全且負責任地掌握這些新興開源工具的快速發展,仍需要在人才與流程方面投入新的資源。
雖然使用開源模型並在本地端部署AI解決方案可以避免將敏感數據傳送給第三方,但管理層仍須採取以下行動來確保其安全性、有效性與負責任的使用:
- 釐清模型與資料授權:所謂「開源」一詞,在許多情況下其實具有誤導性,不同模型的授權限制各異,例如僅限學術或非營利使用,有些模型可能採用「Responsible AI Licenses(負責任AI)」,禁止將其用於特定的有害用途,例如:Bloom與Stable Diffusion即是以負責任AI釋出,使得他們法律上可能禁止其用於某些刑事司法與醫療相關應用。除此之外也必須審視模型訓練所使用的資料類型,雖然在某些情境下,將受著作權保護的內容納入訓練AI模型的資料集可以被視為合理使用,但法律界至今仍未有定論,完整掌握每個模型所使用的訓練資料來源,將有助於組織更妥善地因應這些問題,協助使用者更清楚理解其內容與風險。
- 防止資料外洩:即使不把資料提交給第三方AI服務,企業仍可能透過聊天機器人這類開放式介面外洩漏資料,例如:惡意使用者可能利用提示詞注入攻擊(prompt injection attacks)來誘騙系統揭露其原本被禁止提供的私密或專有資訊,研究顯示特別是在醫療照護等敏感議題上,資料保護往往更加困難。
- 適應資料變動:使用開源模型的另一項複雜之處在於必須確保模型能夠使用最新資料,一個知名的例子,ChatGPT最初版本(GPT-3)便無法回答2021年之後發生的事件;但較新的模型已能結合即時資料,以及以歷史資料預先訓練的模型。企業在更新模型以包含最新資訊時,必須在資料更新與維持使用者體驗的穩定性及一致性之間取得平衡。
- 減輕系統性偏見:AI系統很容易延續並放大訓練資料中所隱含的社會與經濟不平等,大型語言模型容易依據性別、種族與族裔產生刻板印象,例如假設護士是女性、醫師是男性,這個問題無法僅靠技術方式解決,組織應持續稽核AI系統,衡量其表現與產出結果,以確保不同群體都能受到公平對待。
- 建立客戶信任:企業應對客戶清楚說明如何將其資料用於AI訓練的意圖,並採取「選擇性加入(opt-in)」的機制,單純更新服務條款並通知使用者,往往會讓顧客感到自身被利用,並損害消費者信任,例如Zoom就曾宣稱擁有使用客戶資料的相關權利而引發強烈的反彈,迫使Zoom不僅撤回相關政策,還在其服務條款中明確表示絕不會使用資料來訓練AI模型。
在AI模型不斷蓬勃發展的時代,資料所有權疑慮的不僅只是科技巨頭企業的問題,凡是想要使用這些模型的公司,不論是內部協作工具亦或是聊天機器人,都將面臨AI系統在資料蒐集與使用方式上所衍生的相關問題。全球性的電腦從業員專業組織—電腦協會(ACM)也發布了一套關於生成式AI系統設計與部署的指引,內容包括AI部署的限制、資料與輸出內容的所有權,以及個人資料控制等,這些逐漸完善的規範,或許可以提供希望利用開源AI的組織一個妥善的指引與框架,使企業在蒐集與使用訓練資料時符合責任與倫理原則,並建立嚴謹的稽核與監測流程,確保企業在享受AI工具帶來便利性的同時,也兼顧資料安全與社會信任。
- 題測
-
- 試從資料治理(Data Governance)與法律合規(Legal Compliance)兩個角度,分析企業在導入開源大型語言模型時所面臨的策略性風險,針對負責任AI授權(RAILs)的行為限制、訓練資料可能涉及的版權爭議與合理使用(Fair Use)的法律不確定性,企業應如何建構一套動態的資料管理評核機制,以在追求技術自主性的同時確保企業的法規韌性與社會信任?
- 應先指出開源AI並非絕對的法律避風港,企業將模型部署於本地端雖能阻絕第三方資料外洩風險,卻也將外部授權與合規的複雜度全數「內部化」,因此法律合規應為技術部署的前置核心要素。
- 分別論述 RAILs 的「行為限制條款」對特定業務,例如:醫療、金融的法律約束力,以及當前LLM因侵犯版權作品而面臨的訴訟風險。
- 可提出一套包含資料來源追蹤、模型授權檢查、以及持續性法規合規監測的動態機制。
- Evaluate the inherent tension between the creative flexibility of open-source generative AI and the corporate imperative of data security and ethical stewardship. Focusing on the technical and adversarial vulnerabilities of conversational interfaces—specifically prompt injection attacks and localized data leakage —as well as the systemic biases embedded within pretrained historical datasets. Propose a framework for organization to technically and organizationally mitigate these socio-technical risks to cultivate sustainable customer trust without compromising the operational agility provided by on-premise model hosting.
- 論述重點:LLMs之所以強大,是因為它們具備行為上的高度彈性以及廣泛的能力,說明這些強大的特性也正是企業引入過程中重大安全漏洞與倫理責任風險的根源,使用開源模型隨然優點很多,但卻不能從根本上消除系統性偏見。
- 解決方法重點:主動透明的資訊揭露、選擇性加入機制,以及將利害關係人納入決策過程。
