AI 代理被發現嘗試將惡意程式碼植入一個開源項目中,且為了讓程式碼獲得審查通過,它還建立虛假線上身分,並利用這些身分施壓該項目的維護。好在最終審查人員(是人類沒錯)發揮了作用,沒有聽信 AI 代理發起的 PR,成功防護供應鏈攻擊。
看到這類新聞第一件事就是查證所謂的「AI 代理要作惡」是否只是在尊循人類給的某個目標,還是自發行為。好在截至目前為止,沒有任何攻擊真的是由 AI 心血來潮主動發起,本次事件也沒有例外。看來 AGI 還沒到,人類還有時間(?)
事件的起因是英國人工智慧安全研究所在 2026 年 7 月 28 日 的 AI 代理資安實驗中,監測到研究系統出現異常的資料外傳。該次實驗中記錄 19 起未授權攻擊行為,17 起來自 Anthropic 的 Mythos 5;另外 2 起來自的 OpenAI GPT-5.6-Sol。
所以 AI 只是聽話地在執行資安解題目標,但在其擁有極高權限、不受控管且任務難度極高的情況下,AI 自主衍生出了欺騙與攻擊真實人類的手段來達成目的,而這其實是 AI 最擅長的行為。
實驗內容有三個有趣的的地方
- 代理為了繞過 GitHub 的限制,使用存取暗網常用的洋蔥路由(Tor)來規避
- 代理嘗試過直接聯繫真實人類,傳送訊息和檔案以說服人類(或人類自己的 AI 代理)執行惡意程式碼
- 當面對艱難的目標,代理可能選擇欺騙人類以達成目的
報告中將 AI 代理的欺騙行為稱作「目標導向型欺騙」,此概念在 AI 代理很大程度上還停留在理論階段,這方面人類比 AI 強多了(誤),只能說好的不學學壞的 😅
雖然本次事件最終沒有造成任何負面影響,但也為人類敲響了一次警鐘。下次在使用代理工作的時候別忘了留個心眼,也許它正在未來達成目的不擇手段的「欺騙」你。
目前監管機構對醫師進行評估時,並不會試圖預測醫師在職涯中會遇到的每一種狀況,而是測試其基礎知識、觀察其在臨床環境中的表現。仔細想想,完全可以將針對醫師進行的評估套用在 AI 上,
AI 雖然是電腦軟體,卻與以往的軟體有顯著不同。它無法提供確定性的結果,不可能將所有狀況都進行測試,只能設計一系列方式來驗證其效能。既然如此,不如就用評估醫師的方式進行測驗。
雖然 FDA 強調目前僅在討論階段,但這感覺像是監管思維開始發生轉變,不在將 AI 單純看成傳統軟體去要求確定性的結果,而是開始探索用管理人類的方式去管理 AI 的可能性。
我認為這項概念可以應用在各行各業的 AI 代理工具上,不該將 AI 再視作為傳統的軟體,而是去評估其是否具備足夠的產業知識、專業技能、安全行為與溝通能力,像是面試人類一樣對其進行全面評估。
麻省理工研究團隊的一項最新研究表明「AI 生成的圖片無法追溯其訓練資料」,白話文就是當你使用 AI 產圖時,AI 真的像在進行創作,而不是從現有的海量資料中複製某個片段然後貼上,產生新圖。
我很困惑,如果 AI 真的完全沒看過周杰倫、沒看過《蒙娜麗莎》,怎麼可能憑空產出一模一樣的圖?沒看過的東西就是產不出來才對。
原來這項研究的重點是在討論創作者的困境,當資料庫龐大到一定程度時,你從幾百萬張圖片裡抽出「某一位創作者的圖片」,AI 依然能生成出相似的結果,這在科學上叫做「歸因衰減」。
舉例來說,假設訓練資料集內有 10,000 張周杰倫的照片,這時某攝影師提告說:「AI 可以生成周杰倫照片,就是因為使用了我拍攝的照片。」但模型商可以把該攝影師的照片徹底抽離,結果 AI 依然能靠剩下的 9,999 張畫出完全一樣的周杰倫,也就是證明無法歸因是使用了原創作品才造將了 AI 生成相似結果。
所以雖然沒看過 AI 就是產不出來,但在擁有全世界網際網路資料的巨型模型下,還有什麼東西是他「完全」沒看過的?
目前著作權相關訴訟也認知告 AI 抄襲極難成立,轉而主打 AI 訓練時使用未經同意的內容,近期報導 Anthropic 與作家們達成 15 億美元的版權集體訴訟和解就是著名案例之一。
Google 大腦創始人 Andrew Ng 近日發布文章「The AI Engineering Skills Map」,說明他認為現在 AI 工程師需要具備的四個技能:
- 建構與部署 AI 應用程式(Building and deploying AI applications)
- 軟體工程基礎(Software engineering fundamentals)
- 使用程式碼代理(Using coding agents)
- 主導開發方向(Shaping the build)
完全符合目前我的開發經驗,這樣的人才的確也是我們正在尋覓的對象。
如果能夠具備全部四大類能力當然最佳,但如果是新鮮人或是想要進修,依照我的經驗會使用以下順序學習,不僅能成為公司即戰力、同時也能穩步提升自己的實力
首先一定要會用 Agent,網路上有很多使用教學,甚至你只要下載 Claude Code 開始跟他對話,他就會教你怎麼使用(這其實也是我常用的方式,我通常會問他最近你更新了什麼功能,哪些可以用來優化我手上的 project)
接著是軟體工程基礎,無論是何種工程師最終都是要跟電腦打交道,所以從 CPU 到作業系統、路由器到網路七層,演算法到 ML,機器語言到 LLM 等,越能完整了解整個電腦科學技術,在開發時就越能掌握 Codine Agent 可能出錯的地方,彼此截長補短
第三是建構與部署 AI 應用程式,這個技能結合了上述兩種能力,除了要理解電腦運作的底層架構外,也要能熟練使用對應的開發工具。此外由於 AI 本身的機率特性,也需要具備線性代數、統計學等數學知識
最後才是主導開發方向,畢竟只有在擁有足夠的知識時,才能將需求轉化成功能,提出客戶沒想到的東西進而設計出一套完整實用的系統。這部分最需要經驗,因此年輕工程師較難掌握這項技能
科技日新月異,以前用年為單位在進步,現在的單位已經是月、甚至是週。三不五時就有大廠發布全新技術,因此只有持續學習才是進步的不二法門。祝每位工程師在這動盪的 AI 時代持續進步、發現機會、然後保住自己的頭髮 🤣
據《彭博社》報導:Stripe 將以逾 70 億美元收購 OpenRouter,而 OpenRouter 於今年 5 月才宣布完成 1.13 億美元的 B 輪融資,當時估值為 13 億美元。短短三個月的時間估值成長五倍以上,不禁令人好奇這兩家公司的結合能創造出怎樣的綜效
商業角度:
OpenRouter 的金流使用 Stripe 的服務,被收購後應可降低金流成本。Stripe 則可將其「抽流水」的 know-how 更全面的整合進目前 OpenRouter 的 token router 商業模式
產品角度:
支付公司買模型調用路由公司聽起來八竿子打不著,但 OpenRouter 執行長曾將該公司比喻為「AI 界的 Stripe」,也就是說在他眼中,消費者使用 token 跟現金的目的本質相同。我認為硬要類比的話,現金的用途是購買商品,而 token 的用途是購買電腦幫你完成事情的能力
一間 2023 年上線的公司,三年創造出 70 億美元的價值,AI 時代的創業藍海,持續顛覆傳統商業世界對時間與估值的想像