Tuần này có ba kết quả độc lập, đến từ ba nhóm khác nhau, cùng chỉ vào một chỗ: thư viện skill và file hướng dẫn — thứ mà ai chạy agent nghiêm túc cũng đang xây — hiện chưa có cơ chế bảo vệ nào tương xứng.
Một, nó lây. EvoMal cho thấy skill độc lan theo con đường không ai canh: agent không thực thi skill độc, nó chỉ đọc skill đó như một mẫu viết khi cần tạo skill mới, rồi vô tình chép lại payload. Bản chép lại quay vào thư viện và tiếp tục được bắt chước. Vì vậy xoá hết bản gốc cũng không sạch — mầm bệnh đã nằm trong các bản con. Tỉ lệ tự nhiễm 20,3–41,8% trên sáu model. Điều an ủi: một câu nhắc chống chép nguyên xi kiểu "banner" kéo tỉ lệ xuống 6,7% — rẻ và nên làm ngay.
Hai, nó bị bào mòn. Nghiên cứu về compaction đo trên 20 cấu hình agent sản xuất: khi context đầy, luật an toàn và nhật ký thao tác bị nén cùng một tốc độ, vì không có gì trong đường ống biết rằng chỉ luật mới cần giữ nguyên văn mới còn hiệu lực. Con số: giữ 53% sau một vòng compact, còn 10% sau năm vòng. Cách chữa họ đề xuất — Knowledge Triage — phân loại từng dòng theo kiểu rồi cho mỗi kiểu một chính sách giữ riêng, bảo toàn nhiều hơn 2–4× ở mọi mức nén, recall 96% qua năm vòng.
Ba, cổng kiểm tra hiện tại không đo cái cần đo. NVIDIA chạy 145 skill thật qua bộ quét cấu trúc/style/bảo mật rồi đối chiếu với chất lượng do LLM chấm: tương quan rho = 0,14, tức gần như không liên quan. Đề xuất thay thế của họ là Skill Lift: chạy đúng một task hai lần trong cùng model, cùng sandbox, cùng workspace, cùng bộ chấm — một lần có nạp skill, một lần không — rồi đo chênh lệch. 947 cặp chạy từ 58 skill sản xuất, chuẩn hoá qua một định dạng quỹ đạo chung nên so được lift của cùng một skill giữa Claude Code và Cursor.
Ghép lại thì thành một lời khuyên rất cụ thể: đừng đánh giá skill bằng cách đọc nó, hãy đo nó bằng cặp chạy có/không; đừng để luật an toàn nằm chung chính sách nén với phần kể chuyện; và hãy giả định rằng mọi skill trong thư viện dùng chung đều có thể bị bắt chước, kể cả khi không bao giờ được gọi.
Nguồn: EvoMal · Knowledge Triage · NVIDIA ACES / Skill Lift — (qua AI Agents Weekly, số 30/08)
Chọn từ 30 paper HF Daily Papers trong cửa sổ 27–31/08; số cạnh tiêu đề là upvote. Không paper nào trùng với các digest trước. Mỗi paper 3 lớp: BLUF → 30 giây → Đọc sâu (bấm mở).
BLUF: Thay vì viết sẵn một harness rồi đóng băng, JIT-Agent sinh ra harness riêng cho từng task ngay lúc chạy — cùng một model, DeepSeek-V4-Flash vượt GPT-5.6 trên DeepSearchQA +9,1 điểm và rẻ hơn 36% so với harness cố định rẻ nhất.
Điểm số của một agent không chỉ là điểm của model. Nó là điểm của model cộng lớp vỏ bọc quanh model: cách nén lịch sử, cách chia nhỏ mục tiêu, cách chọn tool. Lớp vỏ đó hiện nay do người viết tay, và viết xong là đứng yên. Hệ quả: một thiết kế duy nhất phải gánh mọi loại việc, nên nó luôn là thoả hiệp — không tối ưu cho việc nào cả.
Tác giả ép mọi harness về một giao thức 4 phần, chạy theo thứ tự phụ thuộc M→P→F→A. Memory (M) nén và quản lý lịch sử thực thi. Planning (P) đẻ ra chỉ thị và mục tiêu con. Capability Orchestration (F) chọn và xếp thứ tự tool/skill. Action (A) cập nhật state của controller rồi phát hành động. Hệ thống giữ song song hai thứ: lịch sử sự kiện bất biến, và state của controller thay đổi được.
Huấn luyện qua 3 chặng. Chặng I (Customization): fine-tune có giám sát trên harness do teacher sinh, cộng preference learning để nghiêng về thiết kế vừa điểm cao vừa rẻ. Chặng II (Repair): biến các lần sinh hỏng thành quỹ đạo sửa lỗi có giới hạn, dạy model gượng dậy từ lỗi biên dịch và lỗi runtime. Chặng III (Evolution): Evo-GDPO chuẩn hoá riêng ba tín hiệu reward, độ trễ và chi phí, và chỉ giữ ứng viên nào đẩy được biên giới của kho lưu trữ đi lên.
| Tổng quát (9 benchmark) | GLM-5.2: 74,1 → 81,8 (+7,7); DeepSeek-V4-Flash: 66,7 → 75,5 (+8,8) |
| Thắng nổi bật | DeepSearchQA +9,1 so với GPT-5.6; PinchBench +8,7; OdysseyBench +4,3 |
| Chi phí | DeepSearchQA 85,1 điểm / 400K token / $0,066 — rẻ hơn 36% so với harness cố định rẻ nhất |
| Tổng quát hoá | 24/24 cặp backbone–benchmark đều tăng; DeepSeek V4 +10,2 · Mimo 2.5 +8,6 · Qwen 3.6 +4,0 |
Tác giả nói thẳng rằng harness sản xuất thật — Codex, Claude Code, DeepSeek Harness — giàu cơ chế hơn nhiều so với thiết kế 4 module này. Họ coi khoảng cách đó là cố ý: dựng một nền đơn giản để nghiên cứu, không phải tái tạo hệ thống sản xuất. Họ gọi không gian thiết kế hiện tại là "điểm khởi đầu", và bổ trợ cho việc kỹ sư viết harness chứ không thay thế.
BLUF: Khi bạn để model yếu làm trước rồi chuyển sang model mạnh giữa chừng, model mạnh chỉ lấy lại được 36–47% phần lợi thế của nó — mà lại đắt hơn cả việc cho model mạnh làm lại từ đầu ($1,61 so với $0,72).
Rất nhiều hệ thống thật đang làm cùng một việc để tiết kiệm: cho model rẻ chạy trước, khi nó bí thì chuyển hồ sơ sang model đắt. Trực giác là model đắt sẽ tiếp quản phần dở dang và đi tiếp. Paper này đo xem trực giác đó đúng bao nhiêu, và câu trả lời là không nhiều. Khoản hụt đó tác giả gọi là handoff tax — thuế phải trả khi một model phải tiếp tục quỹ đạo mà không phải do chính nó tạo ra.
Hai cặp model, mỗi cặp một nhà: Claude Haiku 4.5 (yếu) ↔ Opus 4.7 (mạnh), và GPT 5.6 Luna (yếu) ↔ 5.6 Sol (mạnh). Bốn kiểu bàn giao: Raw đưa nguyên quỹ đạo; Compactpre/Compactsuf đưa bản tóm tắt; Traj-drop không đưa quỹ đạo gì cả, chỉ để lại các chỉnh sửa trong cây làm việc. Thang đo là Quality Recovery: model nhận ca lấy lại được bao nhiêu phần trăm khoảng cách chất lượng giữa yếu và mạnh.
| Leo thang (yếu→mạnh) | hồi phục chất lượng 47% (Claude) · 36% (GPT) |
| Chi phí leo thang | Raw $1,61 so với chạy thẳng model mạnh $0,72 (Claude) — đắt hơn 2,2× mà vẫn kém hơn |
| Hạ cấp (mạnh→yếu) | hồi phục 50% (Claude) · 79% (GPT); giữ lại phần tiết kiệm 80% (Claude) nhưng chỉ 14% (GPT) |
| Chữa bằng cách bỏ bớt | nén quỹ đạo → 60–84%; bỏ hẳn quỹ đạo → 64–84% |
Hai chiều giao ca không giống nhau. Đi xuống (mạnh → yếu) khá ổn: model yếu nhận một quỹ đạo sạch sẽ, chất lượng cao và chỉ cần đi nốt, nên đây là đánh đổi chi phí–chất lượng có lợi, rẻ hơn dùng model mạnh suốt. Đi lên thì ngược lại: model mạnh thừa hưởng những giả định sai, những nhánh đã đi lạc, và những đoạn suy luận nó sẽ không bao giờ tự viết ra — rồi phải tiêu token để hiểu và gỡ chúng. Đó là lý do xoá bớt lại tốt hơn giữ lại: bớt quỹ đạo là bớt thứ phải gỡ.
Chỉ hai cặp model mỗi họ; nghiên cứu chính chỉ trên một benchmark; tập con task khó sau khi ghép cặp rất nhỏ (N̄≈24–27); mỗi task chỉ chạy một lần nên không đo được dao động giữa các lần; điểm chuyển giao cố định chứ chưa phải chính sách thích ứng; và mọi kết luận về tiền đều phụ thuộc bảng giá hiện hành của nhà cung cấp.
BLUF: Tách nơi lưu kinh nghiệm khỏi nơi chứa chỉ dẫn cho agent: một "wiki" tích luỹ mọi lần chạy, rồi mới chưng cất thành skill có cổng kiểm duyệt — Qwen-3.6-27B tăng trung bình +23,9 điểm, SpreadSheet nhảy từ 40,8% lên 81,7%.
Hầu hết hệ thống "agent tự học" đều ghi thẳng bài học vào file skill. Vấn đề: file skill là thứ được nhét vào prompt, nên nó phải ngắn. Mà bài học thì đến liên tục. Kết quả là mỗi lần học được gì đó, hệ thống phải ghi đè hoặc cắt bớt cái cũ — và thông tin dùng để quyết định ghi đè cái nào đã bị vứt mất từ vòng trước. WikiSkill tách hai vai này ra: wiki cứ phình thoải mái vì nó không vào prompt, còn skill giữ gọn vì nó có vào.
Inference Agent chạy task và để lại vết thô. Wiki Maintainer đọc vết đó rồi gộp vào wiki dưới dạng mẫu hình có cấu trúc, kèm nhật ký tiến hoá và lịch sử các đề xuất trước — kể cả đề xuất đã bị từ chối. Skill Proposer đọc wiki (chứ không đọc vết thô) để đề nghị sửa skill; nhờ có lịch sử, nó biết cái gì đã thử và trượt. Gating chỉ nhận thay đổi nào chứng minh được là cải thiện.
| Mức tăng trung bình (5 benchmark) | Qwen-3.5-4B +12,3 · Qwen-3.5-9B +17,5 · Qwen-3.6-27B +23,9 |
| Nhảy vọt cụ thể | Gemini-3.5-Flash trên LiveMath 33,0% → 72,6%; Qwen-3.6-27B trên SpreadSheet 40,8% → 81,7%; ALFWorld 52,8% → 77,6% |
| Chuyển giao giữa model | Qwen-3.5-9B đạt 70,2% ALFWorld bằng skill của bản 27B, so với 63,4% khi tự tiến hoá |
| Đối chứng | vượt Trace2Skill, EvoSkill, SkillOpt và mốc không-skill |
Bốn điểm, và đều thật thà. Một, cách nhét skill vào prompt chưa đánh giá được việc truy xuất và kích hoạt ở quy mô lớn — nghĩa là khi thư viện phình to thì chưa biết chọn đúng skill kiểu gì (đúng chỗ paper CaSKG bên dưới nhảy vào). Hai, cổng kiểm duyệt chặt quá nên loại luôn các đề xuất trung tính mà biết đâu về sau lại hữu ích. Ba, không có cơ chế tỉa wiki tự động khi tri thức chất đống. Bốn, benchmark chưa có task cực dài (hàng trăm hành động hay nhiều giờ liền).
BLUF: Chọn skill bằng độ giống nhau về ngữ nghĩa là sai cách; CaSKG thử xoá, thử thay, thử đảo thứ tự từng skill để biết cái nào thật sự cần — thắng ở cả 12/12 cặp model×benchmark, ALFWorld 80,0% → 86,8%.
Khi thư viện chỉ có mươi skill, bạn nạp hết vào prompt cũng được. Khi nó có hàng trăm, bạn buộc phải chọn. Cách chọn mặc định hiện nay là nhúng vector rồi lấy cái gần nhất với đề bài. Cách đó bắt được sự giống nhau về chủ đề, nhưng cái agent cần lại là chuỗi thao tác đúng thứ tự. Hai skill có thể chẳng giống nhau chữ nào mà vẫn bắt buộc phải đi liền nhau; hai skill khác nghe rất giống nhau nhưng dùng cái nào cũng được.
(1) Candidate Induction — dựng một đồ thị có hướng ưu tiên độ phủ cao, ghép cặp skill dựa trên tín hiệu ngữ nghĩa, từ vựng, kiểu input/output và cấu trúc. Chặng này cố ý "vơ nhiều", lọc để sau. (2) Counterfactual Edge Probing — với mỗi cạnh được chọn, chạy ba phép thử bằng văn bản có điều kiện theo chiều: removal hỏi tính cần thiết, substitution hỏi tính đặc thù, reordering hỏi tính có hướng. Đây là phần "nhân quả" thật sự: không suy ra quan hệ từ bề mặt chữ, mà can thiệp rồi xem có hỏng không. (3) Bayesian Calibration — gộp bằng chứng từ các phép thử bằng làm trơn Beta để ra điểm tin cậy, rồi xếp mỗi cạnh vào bốn trạng thái: đã xác nhận, chưa chắc, bị bác bỏ, chưa kiểm. (4) Task-Conditioned Retrieval — chạy personalized PageRank trên đồ thị đã công bố; chỉ cạnh đã được xác nhận mới truyền độ liên quan đi tiếp, còn liên kết yếu bị hạ trọng số.
| ScienceWorld U211 (tb 6 model) | CaSKG 80,50 điểm / 15,29 bước — GoS 72,62 / 16,39 |
| ALFWorld ID-140 (tb 6 model) | CaSKG 86,79% / 14,05 bước — GoS 80,01% / 15,96 |
| Độ nhất quán | điểm cao nhất ở cả 12/12 cặp model–benchmark |
| Đối chứng | Vanilla Skills (nạp hết) · Vector Skills (giống ngữ nghĩa) · GoS (đồ thị phụ thuộc) |
Tác giả nói rõ CaSKG chỉ đáng dùng khi thành công phụ thuộc vào việc giữ đúng một chuỗi thao tác, chứ không phải khi chỉ cần lôi ra một skill có tên hiển nhiên. Mức cải thiện thu hẹp lại với model mạnh hơn — model càng giỏi thì càng tự suy ra được thứ tự. Và với loại task chỉ cần khớp ngữ nghĩa trực tiếp thì gần như không lợi gì.
select.py trả về 0 paper (HF Daily Papers không đăng cuối tuần). Nới về 27/08 cho 98 mục → 30 paper + 25 blog.FAILED_SOURCES=none trên cả 44 nguồn.subject:DEEPDIVE newer_than:2d trả về 0 kết quả.