Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation
以環境 state diff 而不是表面操作軌跡判定 agent 是否完成任務,適合用來教「過程看起來合理」與「實際副作用正確」的差別。
主題:llm、agents、evaluation、tools
最後複核:2026-07-20
獨立補充
這一頁把基礎教材與外部更新分開。清單優先連到原始論文頁。年份較新不代表證據較強,閱讀時仍需檢查資料、基線、消融與可重現性。
10筆 2026 研究
6篇已接受會議論文
3篇 preprint
2026-07-20最後人工複核
研究雷達
會議論文、工作坊立場論文與 arXiv preprint 分開標示;「2026」只代表複核範圍,不代表品質排序。
以環境 state diff 而不是表面操作軌跡判定 agent 是否完成任務,適合用來教「過程看起來合理」與「實際副作用正確」的差別。
主題:llm、agents、evaluation、tools
最後複核:2026-07-20
從 reward-weighted distribution 統一比較 diffusion 與 flow matching 的引導。這是把「生成」和「偏好對齊」連起來的 2026 案例,但仍需分開計算成本與泛化主張。
主題:diffusion、generative、flow-matching、alignment
最後複核:2026-07-20
ICLR 2026 Poster。把語音推理的準確率與回應延遲放在同一個可量測的取捨中,適合連結多模態模型與即時系統。
主題:llm、reasoning、audio、multimodal、systems
最後複核:2026-07-20
ICLR 2026 Poster。展示剪枝可能啟動未剪枝模型中被抵銷的惡意行為,提醒部署前需重新評估壓縮後模型,不能沿用原模型結論。
主題:compression、pruning、llm、evaluation、security
最後複核:2026-07-20
ICLR 2026 Poster。以查詢、檢索、回饋的迭代記憶路徑討論持續微調,並要求同時檢查舊任務保留、新任務學習與訓練成本。
主題:finetuning、continual、transformer、memory
最後複核:2026-07-20
ICLR 2026 Poster。用 test-time inverse scaling 提醒學生:推理步驟變長不一定變準,還需檢查過程一致性與模型的 reasoning sweet spot。
主題:llm、reasoning、reinforcement、audio、evaluation
最後複核:2026-07-20
ICML 2026 機制可解釋工作坊立場論文。主張不只問解釋是否漂亮,還要驗證它能否支持具體決策與介入。
主題:evaluation、explainability、llm、responsible-ai
最後複核:2026-07-20
將 agent 預測的下一狀態與環境實際回傳狀態對齊。閱讀時要區分世界模型誤差、任務成功獎勵與 LLM 裁判的不同失敗模式。
主題:llm、agents、world-model、reinforcement、evaluation
最後複核:2026-07-20
ICLR 2026 Poster。以不同層對量化的敏感度差異,說明低比特量化不應把每層當成完全相同的對象。
主題:compression、quantization、llm、systems
最後複核:2026-07-20
ICLR 2026 Poster。不把未來回報壓成單一平均值,而是以 flow matching 建模回報分布,用來討論不確定性與探索。
主題:reinforcement、flow-matching、uncertainty、exploration
最後複核:2026-07-20
演化路徑
先讀建立問題與方法的核心來源,再把 2026 更新放回它們所延伸的脈絡。
提供多語言、稠密與混合專家模型,以及思考模式切換的近期案例。
主題:llm、multilingual、reasoning、post-training
ICLR 2025 Oral。可用來練習拆解世界模型、長短期想像、探索獎勵與公平實驗比較。
主題:reinforcement、vision、world-model、exploration、paper-reading
將強化學習章節連結到大型語言模型推理訓練。教學需區分可觀察輸出與不可直接驗證的內部機制。
主題:llm、reinforcement、reasoning、post-training
用結構化狀態空間對偶性連結注意力與狀態空間模型。
主題:sequence、transformer、ssm、mamba
可用於討論現代大型語言模型的資料、縮放、後訓練與評估管線。
主題:llm、nlp、data、post-training
以可重現過濾與消融實驗說明網頁預訓練資料的品質控制。
主題:data、llm、pretraining
將繁體中文與臺灣知識納入評估,避免只用英文或簡體中文基準推論在地能力。
主題:evaluation、traditional-chinese、llm、multilingual
說明雙向編碼器仍有明確的效率與表徵學習用途,不宜把 NLP 教學縮減成生成模型。
主題:encoder、nlp、transformer、modernbert
可用來說明現代文字生圖系統中的流匹配、Transformer 與多模態條件。
主題:generative、diffusion、multimodal、flow-matching
適合用於多解析度視覺輸入與視覺語言模型的案例研討。
主題:vision、multimodal、llm
提供開放語料、資料工具與資料治理討論的案例。
主題:data、llm、pretraining、open-science
可用於介紹群組相對策略最佳化與可驗證獎勵。
主題:reinforcement、reasoning、llm、grpo
適合補充混合專家模型、負載平衡、低精度訓練與訓練成本報告方式。
主題:llm、moe、optimization、systems
將資料選擇視為可比較的實驗變因,而不是不可見的前處理細節。
主題:data、llm、evaluation、pretraining
在斷詞與詞元化章節中,補充以位元組與動態 patch 取代固定詞彙表的方向。
主題:tokenization、nlp、llm
提醒學生區分表面模仿、任務覆蓋率與真正能力轉移。
主題:data、distillation、evaluation、llm
補充不依賴像素級重建的聯合嵌入預測學習。
主題:vision、self-supervised、representation
將是否檢索、生成與批判訊號納入同一學習架構。
主題:retrieval、rag、llm、evaluation
把量化、記憶體預算與參數高效率微調放入同一個實作案例。
主題:finetuning、llm、quantization、compression
提供注意力以外的長序列建模視角。重點是輸入相依的選擇機制。
主題:sequence、transformer、ssm
適合在教授注意力公式後補充 GPU 工作切分與實際吞吐量。
主題:attention、transformer、systems
以封閉形式偏好目標對照傳統 RLHF 管線。
主題:alignment、post-training、llm、reinforcement
用大規模資料整理與自監督目標討論可轉移的視覺表徵。
主題:vision、self-supervised、representation
以多情境、多指標與透明報告補足單一準確率。
主題:evaluation、llm、responsible-ai
將生成模型更新到連續正規化流與流匹配觀點。
主題:generative、diffusion、flow-matching
把注意力的瓶頸從 FLOPs 擴展到記憶體階層與 IO 複雜度。
主題:attention、transformer、systems
以遮罩重建連結自動編碼器與視覺自監督學習。
主題:vision、self-supervised、autoencoder
用低秩參數更新說明參數高效率微調。
主題:finetuning、llm、compression
用對比學習建立圖像與文字共同表徵。
主題:vision、multimodal、contrastive
建立檢索器、生成器與可追溯外部知識的基本架構。
主題:retrieval、rag、nlp、llm
擴散模型的核心基線。可與 GAN 的訓練目標與取樣程序比較。
主題:generative、diffusion
用原始 Transformer 建立查詢、鍵、值與多頭注意力的基準概念。
主題:attention、transformer、nlp