AI PLAYTEST LAB
GAMA FORGE · 黑客松研究 Demo
FROM GAME CODE TO PLAYTEST EVIDENCE

把遊戲交給 AI,
修改決定
交回創作者。

從遊戲程式碼產生遊玩策略,實際操作遊戲、留下證據,再用可重現的測試驗證每一次改進。

今天先以 Last Beacon 與 THUNDERFALL 驗證流程。

THE WORKFLOW流程設計
創作者的遊戲 + 程式碼保留來源版本,辨識機制與可操作介面
程式碼 + 已知 adapter
生成可解讀的遊玩策略說明何時建塔、如何避彈、何時使用技能
固定規則執行 · 遊玩中不呼叫 LLM
01 / 瀏覽器真的玩原遊戲畫面、鍵盤與按鈕
02 / 留下可核對證據畫面、動作、狀態與版本
60-SECOND PITCH

我們在做一位會讀程式、會實際遊玩的測試助手。它先改進自己的測試能力,再針對有證據的問題提出遊戲修改,讓創作者看得懂、試得到、能決定。

01 / TWO LOOPS, ONE RULE

一次只改一邊,才知道為什麼變好。

先讓 bot 把遊戲測好。

固定遊戲版本與驗收標準,改進策略或探索腳本。

本次 Demo 重點
  1. 01

    讀程式,產生策略

    從遊戲機制和 adapter,生成有理由、可審查的規則。

  2. 02

    跑一輪,留下紀錄

    實際操作遊戲,記錄看到了什麼、做了什麼、是否生效。

  3. 03

    分析失敗,改進 bot

    找出卡點與替代解釋,提出一個可被否定的改進假設。

  4. 04

    固定測試,比較結果

    在未用來調整策略的 seed 上驗證,允許退步或證據不足。

看進步:測到更多目標機制、操作確實生效、穩定抓到已知問題;不能只看分數。

02 / SHOW THE PLAY, THEN THE CLAIM

讓人看得見變化,也查得到原因。

BEFORE / AFTER證據呈現示意 · 非實測畫面
策略初版實際遊玩回放
策略候選相同測試條件

GIF/逐幀回放呈現目標:定位關鍵動作,對照當時狀態。實際影片、GIF 與數據請看測試對照頁。

一個結論,附上三種證據。

  • 看畫面 — bot 在哪裡卡住?候選策略的行為有何變化?
  • 看紀錄 — 當時的狀態、動作理由與執行效果能否對得上?
  • 看比較 — 同版本、同 seed 與同預算,多次執行是否仍成立?

畫面幫助理解;固定評測決定結論。單段精彩片段無法代表整體改善。

03 / START WITH REAL GAMES

今天的兩個試驗場。

01
Last Beacon

塔防:建造、供電、資源分配與波次覆蓋。

02
THUNDERFALL

彈幕:移動避彈、技能時機與 Boss 曝露。

沿用既有遊戲 adapter,驗證自行生成的新策略。未知遊戲仍需接入觀察與操作 adapter,尚未支援任意上傳後立即自動測試。

我們想回答的是:

「這個測試有沒有真的測到問題?」
「這次修改是否解決了可重現的問題?」

Bot 的失敗,可能來自策略、操作、觀察或遊戲本身,需要逐層確認。

代理表現不等於真人難度,也不能作為真人留存證據。 創作者仍保有遊戲設計與修改的最終決定。

04 / WHAT EXISTS, WHAT COMES NEXT

這次黑客松,做到可看、可查、可比較。

  1. 既有基礎

    真實遊玩與觀戰

    遊戲 adapter、唯讀 probe、規則策略、瀏覽器執行器與即時觀戰。

  2. 本次開發

    從程式生成自己的策略

    策略理由、回合間分析、遊玩回放,以及可解讀的前後對照。完成狀態以實際 Demo 為準。

  3. 後續規劃

    隔離修改與創作者審查

    可重現問題、遊戲 patch、固定回歸測試與原版/修改版試玩。