對齊AI Alignment
讓 AI 的行為符合人類意圖與價值觀,而不只是把任務字面上做完。
與「AI 安全」有關的所有內容,包含教學文章、工具評測與相關新聞,共 7 篇。
讓 AI 的行為符合人類意圖與價值觀,而不只是把任務字面上做完。
在 AI 系統輸入與輸出兩端加上的限制機制,用來擋下不該發生的內容或行為。
用 AI 處理工作時,最容易被忽略的不是技術問題,而是「這段資料傳出去之後去了哪裡」。這篇整理五個具體該注意的地方,不用懂技術也能照做。
用 AI 生成或修改的假影音內容,讓畫面中的人說出、做出實際上沒發生過的話或動作。
用特定的提示詞技巧,誘導模型繞過原本設定的安全限制,說出或做出不該做的事。
把惡意指令藏在 AI 會讀取的外部內容裡(網頁、文件、email),誘導它執行使用者沒有要求的動作。
Anthropic 開始在 Claude 產出的文字與圖片中嵌入不可見浮水印與 C2PA 來源中繼資料,回應歐盟 AI 法案的透明度要求,目前涵蓋 Claude 全系列產品。
資料來源:Claude 支援中心 — How Claude marks AI-generated content