跳到主要內容

[標題]最新消息

美國NIST發布人工智慧技術評估計畫

美國國家標準與技術研究院(NIST)於2026年7月27日宣布推動「人工智慧技術評估(AITE)」計畫,AITE建立一套標準化且隔離的測試環境,對橫跨不同資料集、模態與專業領域的模型效能,進行嚴謹且具可信度的獨立評估。

AITE採用盲測機制與隔離環境,讓模型在完全未接觸過相關資料的前提下進行測試,確保評估結果反映的是模型真實的泛化能力與效能,而非僅是記憶訓練資料的能力。NIST將提供數據、指標和評分體系,幫助開發人員了解其模型的性能,並定期對外公開具體的排行榜與相關報告。

在運作架構上,AITE計畫採用雙軌並行機制吸引產學研界加入。資料提供者可提交未公開的專業資料集與特定任務,藉此獲得頂尖模型在該領域的真實表現數據。模型提供者則可在保護自身智慧財產權並避免資料洩露的原則下,將模型送入測試,獲取相較於同行競爭者的精確定位評估。藉由雙向互動的機制,促進高品質資料與先進模型之間良性進步。

目前計畫在啟動初期,聚焦於大型視覺語言模型(VLM)在專業影像分析上的表現,首波涵蓋量子科學、基因體學以及公共安全三大領域。未來將擴充任務類型、模態、領域及相應的評估技術,增加測試任務與模型數量,規模化評估技。未來預計涵蓋數百個任務與領域,納入受控非機密資訊(CUI)的安全防護,實現全自動化評測,並採用創新的計量學方法。最終建立長期運作、能動態調整並持續回應新興技術需求的評估生態系。

相關連結:
宣布NIST人工智慧技術評估 (另開視窗)