把遊戲交給 AI,
把修改決定
交回創作者。
從遊戲程式碼產生遊玩策略,實際操作遊戲、留下證據,再用可重現的測試驗證每一次改進。
今天先以 Last Beacon 與 THUNDERFALL 驗證流程。
我們在做一位會讀程式、會實際遊玩的測試助手。它先改進自己的測試能力,再針對有證據的問題提出遊戲修改,讓創作者看得懂、試得到、能決定。
一次只改一邊,才知道為什麼變好。
先讓 bot 把遊戲測好。
固定遊戲版本與驗收標準,改進策略或探索腳本。
- 01
讀程式,產生策略
從遊戲機制和 adapter,生成有理由、可審查的規則。
- 02
跑一輪,留下紀錄
實際操作遊戲,記錄看到了什麼、做了什麼、是否生效。
- 03
分析失敗,改進 bot
找出卡點與替代解釋,提出一個可被否定的改進假設。
- 04
固定測試,比較結果
在未用來調整策略的 seed 上驗證,允許退步或證據不足。
看進步:測到更多目標機制、操作確實生效、穩定抓到已知問題;不能只看分數。
再讓修改經得起相同測試。
固定 bot 與測試案例,在隔離版本中修改遊戲。
- 01
確認可重現問題
對照實際與預期行為,先排除 bot 和操作介面的不足。
- 02
建立隔離修改版
固定遊戲來源版本,以單一目的 patch 修改遊戲程式。
- 03
原版與修改版對測
使用相同策略、seed 與預算,檢查問題修復及其他退步。
- 04
交由創作者審查
提供程式差異、測試證據與兩個試玩版本,由創作者決定。
Bot 打不過,不足以證明遊戲有 bug;平衡調整也需要創作者確認設計意圖。
讓人看得見變化,也查得到原因。
GIF/逐幀回放呈現目標:定位關鍵動作,對照當時狀態。實際影片、GIF 與數據請看測試對照頁。
一個結論,附上三種證據。
- 看畫面 — bot 在哪裡卡住?候選策略的行為有何變化?
- 看紀錄 — 當時的狀態、動作理由與執行效果能否對得上?
- 看比較 — 同版本、同 seed 與同預算,多次執行是否仍成立?
畫面幫助理解;固定評測決定結論。單段精彩片段無法代表整體改善。
今天的兩個試驗場。
塔防:建造、供電、資源分配與波次覆蓋。
彈幕:移動避彈、技能時機與 Boss 曝露。
沿用既有遊戲 adapter,驗證自行生成的新策略。未知遊戲仍需接入觀察與操作 adapter,尚未支援任意上傳後立即自動測試。
我們想回答的是:
「這個測試有沒有真的測到問題?」
「這次修改是否解決了可重現的問題?」
Bot 的失敗,可能來自策略、操作、觀察或遊戲本身,需要逐層確認。
代理表現不等於真人難度,也不能作為真人留存證據。 創作者仍保有遊戲設計與修改的最終決定。
這次黑客松,做到可看、可查、可比較。
- 既有基礎
真實遊玩與觀戰
遊戲 adapter、唯讀 probe、規則策略、瀏覽器執行器與即時觀戰。
- 本次開發
從程式生成自己的策略
策略理由、回合間分析、遊玩回放,以及可解讀的前後對照。完成狀態以實際 Demo 為準。
- 後續規劃
隔離修改與創作者審查
可重現問題、遊戲 patch、固定回歸測試與原版/修改版試玩。