[AI 實戰] 把 Song Lingo 搬上 Cloud Run:讓一個放著完整歌詞的網站,真的只有我自己看得到

前情提要 上一篇我用 Gemini 3.8 Flash TTS 做了 Song Lingo:貼 YouTube MV 網址,Gemini 轉錄歌詞、加上拼音翻譯文法,再由一位用 voice design 設計出來的老師一句一句念給你聽。 它一直只跑在我自己的電腦上,但我希望拿起手機就能用。所以這篇要做的事很單純:把它搬上 Cloud Run,讓手機也能用。 但這個網站有一個特殊的地方:頁面上是完整的歌詞和翻譯。 需求:「只有我看得到」要多準確 一般的 side project 部署上去,被別人看到頂多有點尷尬。Song Lingo 不一樣,公開有兩個實際的後果: 版權:上一篇花了一整節講,這是個人學習工具,歌詞只存在我自己的電腦。網站一旦公開,性質就從「個人學習」變成「對外提供歌詞」。 費用:加一首歌會呼叫 Gemini Flash,第一次播放示範音會呼叫 TTS。任何人都能用,就等於任何人都能花我的額度。 所以目標不是「有登入功能」,而是從頭到尾每一層都確認過,只有我的帳號能碰到歌詞和 API。 我先比較了兩個方案:   A. IAP + 程式內驗證 B. 不開放外部,用 gcloud run services proxy 能用的裝置 任何瀏覽器,包含手機 只有登入 gcloud 的電腦 設定難度 中等 低 出錯的可能 低 最低,根本沒有公開入口 B 是最安全的,但手機不能用,而手機正是這次部署的理由。所以選 A。 第一版設計的漏洞:簽署網址 我最初的規劃是這樣:音檔放 GCS,播放時由 API 產生一個短時效的簽署網址(signed URL),把瀏覽器重新導向過去。好處是音檔不經過 Cloud Run,省流量,GCS 本身也支援 Range 請求。 寫到一半重新想「怎樣才能準確地只有我看得到」時,才發現這是一個漏洞: 簽署網址在有效期限內,任何拿到網址的人都能直接下載,完全不經過 IAP。 它本質上是一張不記名的通行證。網址出現在瀏覽器歷史、被貼到哪裡、被某個擴充功能記下來,別人就能繞過前面所有的登入檢查。 原因與解法:「只有我能存取」是一整條鏈,強度取決於最弱的那一環。最後的做法是不使用簽署網址,音檔一律由 Cloud Run 讀出來再送給瀏覽器,每一次播放都要先通過 IAP 和程式內的驗證。一段音檔 250KB 左右,多繞一段路的流量成本可以忽略。 架構 部分 做法 容器 一個映像同時裝 Node 22 和 uv/Python,Next.js 直接呼叫原本的 Python 腳本 歌曲資料與音檔 私人的 Cloud Storage bucket,掛載成 /data 資料夾 API key Secret Manager,以環境變數提供 存取控制 IAP + 程式內驗證 IAP 的簽章 執行個體 最多 1 個,最少 0 個;CPU 持續分配 幾個決定的理由: 把 bucket 掛載成資料夾,而不是改寫成呼叫 GCS API。程式原本就是讀寫 output/ 資料夾,掛載之後只要把 SONG_DATA_DIR 指到 /data,幾乎不用改程式。 只跑 1 個執行個體。避免重複產生音檔、額度用完時暫停呼叫、加入新歌的進度,這些狀態都存在記憶體裡;掛載的 bucket 也沒有跨執行個體的鎖定。個人使用,1 個就夠,而且這樣上一篇那些防止重複計費的機制才會有效。 CPU 持續分配(--no-cpu-throttling)。「加入新歌」是在回應送出後繼續在背景跑轉錄和分析的,Cloud Run 預設會在回應送出後限制 CPU,背景工作會卡住。 四層防護 最後的存取控制是四層,任何一層單獨出錯,其他層還是擋得住: Cloud Run 權限:--no-allow-unauthenticated,只有 IAP 的服務帳號能呼叫這個服務。 IAP:只有被授予 roles/iap.httpsResourceAccessor...
繼續閱讀

[AI 實戰] Gemini 3.8 Flash TTS 正式推出:我用它做了一個「跟著 MV 學日文」的 Web App,然後把一天的額度燒光了

前情提要 每次看到 Gemini 出新功能,我第一個念頭都是「能不能接進我的 LINE Bot」。 9/22 的 Gemini API release notes 寫著 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS 正式推出(GA),官方部落格同步發了 Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS。我照慣例先列了一排 LINE Bot 點子:爸媽聲音的睡前故事、把群組聊天變成廣播劇、早晨雙主持人 podcast⋯⋯ 列到一半我發現,這次最打動我的其實不是 bot,而是「逐句導演語氣」這件事特別適合拿來教發音。於是題目改成一個 Web App: 選一首歌,拿到歌詞,同步翻成中文。 如果是日文、韓文,就附上拼音,然後變身語言老師,一句一句教你怎麼念。 變成一個「用歌曲學語言」的工具。 結果做下來,TTS 本身的品質沒什麼好挑的,真正花時間的是它周邊那些文件沒寫的事。 Gemini 3.8 Flash TTS 是什麼 這次 GA 的是兩個模型: 模型 定位 gemini-3.8-flash-tts 旗艦款,重視聲音表現與角色塑造,可以逐句控制演出 gemini-3.8-flash-lite-tts 便宜、快,適合大量產生 跟前一代比,多了三個我覺得真正有用的東西: Voice design:用一段文字描述生出一個聲音,例如「一位 60 多歲、帶英國腔、語氣溫暖的天文學家」。生出來的聲音會拿到一個 voice_id,之後重複使用。 Voice replication:用 10–30 秒的錄音複製一個人的聲音。前提是聲音主人要親口錄一段同意聲明,產出的語音也會帶 SynthID 浮水印與 C2PA 標記。 逐句的演出控制:每一段文字都能附一個 style(例如「慢慢念、每個音節都念清楚」),也支援 <laughs>、<sigh> 這類標籤,以及最多兩人的對話。 實際呼叫的長相,跟過去的 generate_content 不一樣,改走 interactions 與 voices 兩組 API: # 用文字描述設計一個聲音(一次性,存起來重複用) voice = client.voices.create( store=True, voice={ "model": "gemini-3.8-flash-tts", "type": "prompted", "display_name": "Song Lingo Japanese Teacher", "gender": "female", "language_code": "ja-JP", "prompted": {"input": "A warm, patient Japanese language teacher in her early 30s from Tokyo..."}, }, ) # 用這個聲音念一句話,style 控制語氣與速度 interaction = client.interactions.create( model="gemini-3.8-flash-tts", input=[{ "type": "user_input", "content": [{ "type": "text", "text": "こんにちは。今日はいい天気ですね。", "annotations": [{"type": "speech_metadata", "style": "speaking slowly and clearly"}], }], }], response_format={"type": "audio"}, generation_config={"speech_config":...
繼續閱讀

[AI 實戰] Gemini 3.8 Live 升級記:一次 GA 讓我還掉一筆技術債,以及我的實測腳本自己騙了我三次

前情提要 我有一個自己每天在用的 LINE Bot,linebot-helper-python。丟網址回摘要跟社群文案,丟 YouTube 連結可以針對影片連續追問,還有書籤、地點查詢那些。其中一個功能是 LIFF 語音助理:開一個網頁,用 WebSocket 接 Gemini Live API,可以按住說話或免持對話,講完的內容會整理成一則訊息推回 LINE 聊天室。 九月中 Google 發了 Gemini 3.8 Live,看完之後我想做的事情,跟公告想賣的東西不太一樣。 公告在講能力:Speech to Speech Index 排第一(82.6 分)、Big Bench Audio 97.7%、97 種語言自動偵測且可以在對話中途切換、工具呼叫可以在背景執行而不中斷對話流、即時視覺輸入。還有一顆 Gemini 3.8 Live Extended Thinking,能一邊推理一邊出聲。 我第一個念頭是:這下我可以把那個 preview 例外拔掉了。 真正的動機:一個 preview 模型埋了兩次雷 上一篇寫 agentic video 的時候提過一件事:我的智慧對話功能壞了整段時間,沒有人發現。原因是 loader/chat_session.py 寫死了 gemini-3-pro-preview,那個模型從 Vertex AI 下架之後,真實路徑直接回 404,而那個檔案的例外處理是直接 raise。 修完之後我加了一組守衛,用測試強制「模型 ID 只能出現在 config/agent_config.py」「不准使用 preview 或實驗模型」。但那組守衛有兩個例外: # Live API 僅支援 gemini-3.1-flash-live-preview;TTS 是獨立模型家族。 # 這兩處必須維持 preview 模型,不在守衛範圍內。 EXEMPT_FILES = {"services/voice_live.py", "tools/tts_tool.py"} 語音那個例外的理由是「Live API 只有這一顆模型能用」。當時是真的。但那句話一旦寫進註解,就沒有人會再去查它還成不成立——同一類 bug 的最後一個缺口,就這樣光明正大掛在那裡好幾個月。 3.8 Live 的意義因此不只是能力升級。它的模型名稱不含 -preview,這代表那個例外可以縮掉。 先問 API,不要問文件 這次我沒有先讀文件,而是直接問 API 上實際存在哪些東西: curl -s "https://generativelanguage.googleapis.com/v1beta/models?key=$KEY&pageSize=200" \ | jq -r '.models[]?.name' | rg -i 'live' models/gemini-3.5-transcribe-live models/gemini-3.1-flash-live-preview models/gemini-3.8-live models/gemini-3.8-live-extended-thinking models/gemini-3.5-live-translate-preview 一行指令拿到五個確定存在的模型名稱,比在文件裡翻半天可靠。gemini-3.8-live 就在上面,名字乾淨。 順帶還撿到一個我本來不知道的 gemini-3.5-live-translate-preview。我原本在想「要不要做即時口譯模式」,看來那是一顆專門的模型,不是拿通用模型硬幹。這個之後再說。 再往下問 metadata:   3.1-flash-live-preview 3.8-live inputTokenLimit 131072 131072 outputTokenLimit 65536 65536 supportedGenerationMethods bidiGenerateContent bidiGenerateContent 數字一模一樣。到這裡我對「可以無痛換」有了初步信心,但這還只是 metadata,不是行為。 踩坑一:我警告了一個不存在的風險 我第一次評估這件事的時候,很嚴肅地提醒了一句:「公告沒提到 Vertex AI,而這個專案的決策是全面改用 Vertex,所以 3.8 Live 不確定拿不拿得到。」 聽起來很專業。然後我去翻自己的程式碼: client = live_genai.Client( api_key=GOOGLE_AI_API_KEY, vertexai=False, http_options={"api_version": "v1beta"}, ) vertexai=False。語音這條路徑從一開始就是走 Gemini API 加 AI Studio 的金鑰,根本不走 Vertex——而...
繼續閱讀

實測 Google 官方 google-cloud-developer plugin:讓 AI Agent 不再亂掰 gcloud 指令

最近翻 Google Cloud 的開發環境設定文件, 在一堆 gcloud CLI、Cloud Shell、Cloud Workstations 中間,多了一段以前沒有的東西: agy plugin install https://github.com/google/skills/plugins/cloud/google-cloud-developer agy 是 Google Antigravity CLI。但真正讓我停下來的不是這個新 CLI,而是後面那串網址: Google 開始把自家的產品知識,包成 agent plugin 放在 GitHub 上發佈。 結果我打開自己的 Claude Code 一看,這個 plugin 早就裝在機器上了。所以這篇不用先裝 Antigravity CLI, 直接拿現成的來實測,看看它到底做了什麼。 這個 plugin 裡面裝了什麼 先把它拆開看。整包其實不大,5 個 skill、1 份路由規則、1 個 MCP server,全部加起來 1549 行 markdown,沒有任何程式碼: skills/gcloud/ # gcloud 指令的安全護欄與語法驗證(272 行 + 340 行參考文件) skills/retrieving-developer-knowledge/ # 查官方文件(103 行 + 182 行參考文件) skills/finding-google-skills/ # 按需從遠端目錄撈技能(134 行) skills/google-cloud-recipe-onboarding/ # 新手開第一個專案(228 行) skills/google-cloud-recipe-auth/ # 憑證與 ADC 選擇(260 行) rules/google-cloud-discovery.md # 技能路由表(30 行) 有趣的是同一個目錄底下塞了四套 manifest: .claude-plugin/plugin.json # Claude Code .codex-plugin/plugin.json # Codex gemini-extension.json # Gemini CLI / Antigravity plugin.json # 通用格式 那份通用的 plugin.json 開頭是這樣: { "$schema": "https://agent-plugins.org/schemas/1.0.0/plugin.schema.json", "name": "google-cloud-developer", "version": "1.1.2", "author": { "name": "Google LLC" }, "license": "Apache-2.0" } agent-plugins.org 是個跨工具的 plugin schema。Google 沒有為自己的 Antigravity 做一份專屬格式, 而是同一包東西讓四種 agent 都吃得下去。換句話說,你不裝 Antigravity CLI 也用得到這包東西。 安裝:三條路挑一條 Antigravity CLI(文件上寫的) agy plugin install https://github.com/google/skills/plugins/cloud/google-cloud-developer Claude Code claude plugin marketplace add google/skills claude plugin install google-cloud-developer@google-plugins...
繼續閱讀

【Steam Deck 指南】解決 Windows .exe 補丁找不到路徑的痛點:超穩定的「中繼搬移法」

在 Steam Deck 上遊玩各種電腦遊戲時,經常會遇到需要安裝「社群中文化補丁」、「民間修復更新」或「MOD 擴充包」的情況。然而,許多開發者或漢化小組釋出的補丁是包裝成 Windows 的 .exe 安裝程式,並在執行時要求玩家手動選擇遊戲目錄。 這在 Steam Deck 的 SteamOS(Linux 架構)底下往往會遇到一個巨大的痛點:安裝程式的資料夾選取視窗根本找不到遊戲裝在哪裡。 本文將解析這個問題的核心成因,並分享一套目前最直覺、成功率最高且不需輸入複雜指令的「中繼搬移法」。 為什麼補丁程式會「迷路」? SteamOS 是透過相容層(Proton 或 Wine)來模擬 Windows 環境執行程式,底層有兩個機制容易導致安裝程式卡關: 隱藏資料夾限制:Steam 預設將所有遊戲安裝在 /home/deck/.local/share/Steam/steamapps/common/。在 Linux 系統中,名稱開頭為小數點(.)的資料夾是隱藏資料夾。多數 Windows 補丁自帶的「瀏覽資料夾」瀏覽器無法辨識或顯示這些隱藏路徑。 沙盒權限隔離:如果你習慣使用 Bottles(樽)或部分 Flatpak 應用程式來啟動 .exe,這些工具預設受到沙盒權限控管,無法直接讀取使用者的系統深層檔案。 核心解法:中繼搬移三步驟 與其跟隱藏資料夾設定與 Linux 指令搏鬥,最乾淨的做法是先將遊戲資料夾搬移到非隱藏的公開目錄(如 Downloads 或 Desktop),完成補丁注入後再覆蓋回原始路徑。 第一步:複製遊戲目錄至中繼路徑 長按電源鍵,切換至 Switch to Desktop(桌面模式)。 開啟 Steam 收藏庫,在目標遊戲上點擊右鍵 ➔ 管理 ➔ 瀏覽本機檔案。 檔案總管(Dolphin)會打開遊戲所在的目錄。點擊網址列往上一層回到 common 資料夾。 對著「該遊戲的資料夾」按右鍵選擇 Copy(複製)。 從左側快捷欄進入 Downloads(下載) 或 Desktop(桌面),在空白處按右鍵選擇 Paste One Folder(貼上)。 第二步:執行補丁並透過 Z 槽選取路徑 透過 Bottles、Protontricks 或將補丁加入非 Steam 遊戲來啟動補丁 .exe。 當安裝程式跳出「請選擇遊戲安裝目錄」視窗時,點開 My Computer(我的電腦) ➔ Z: 槽(Z:\ 即對應 Steam Deck 的根目錄)。 依序展開以下公開路徑: 若剛才貼在 Downloads: Plaintext Z:\home\deck\Downloads\[你的遊戲資料夾] 若剛才貼在 Desktop: Plaintext Z:\home\deck\Desktop\[你的遊戲資料夾] 選定資料夾後按下確認,開始執行補丁寫入。由於路徑完全透明,安裝程式能順利將替換檔案解壓進去。 第三步:覆蓋回原路徑與啟動檔確認 補丁安裝完成並關閉視窗後,回到剛才的 Downloads 或 Desktop 目錄。 進入補丁更新完畢的遊戲資料夾,按 Ctrl + A 全選所有檔案,點右鍵選擇 Copy(複製)。 回到 Steam 原始的遊戲資料夾(Steam 收藏庫 ➔ 遊戲點右鍵 ➔ 管理 ➔ 瀏覽本機檔案)。 在空白處按右鍵 Paste(貼上),當系統跳出覆蓋提示時,選擇 Overwrite / Write Over(全數覆蓋)。 關鍵檢查:部分補丁在安裝後會產生獨立的執行檔(例如 Game_Patch.exe 或 Game_ZH.exe)。若有此情況,請將原本的遊戲啟動主程式(如 Game.exe)備份改名,並將補丁產生的新執行檔改回 Steam 預設的啟動檔名。 清理暫存檔案:確認無誤後,即可將 Downloads 或 Desktop 中的中繼資料夾刪除。 注意事項與除錯技巧 Linux 檔案大小寫敏感:Linux 系統會將 Data 與 data 視為完全不同的目錄。如果補丁解壓縮出來的資料夾大小寫與原遊戲不同,請手動將內容合併,避免生成雙重資料夾導致遊戲讀取不到補丁資源。 動畫與編碼相容性:若打完補丁後進入遊戲遇到文字方塊、日文缺字或開場動畫黑屏,請在 Steam 該遊戲的 內容 ➔ 相容性 中改用...
繼續閱讀

[AI 實戰] Gemini Agentic Video 實測:官方沒說的四個前提,以及我把它接進 LINE Bot 的過程

前情提要 我有一個自己每天在用的 LINE Bot,linebot-helper-python。丟網址給它會回摘要跟四個平台的社群文案,丟 YouTube 連結會回影片摘要,還有書籤、地點查詢、語音助理那些。跑在 Cloud Run 上,用 Vertex AI。 八月底 Google 發了一篇 Introducing agentic video in Gemini,看完我第一個念頭是:這東西能讓我的 bot 多做一件現在做不到的事——針對影片提問,而不是只給一份摘要。 結果做下來,公告裡沒寫的部分比寫了的更值得記。 Agentic video 是什麼 原本 Gemini 讀影片是「靜態」的:不管你問什麼,它都照固定的取樣率把整支影片的每一格畫面、每一段音訊全部塞進 context。一支兩小時的影片,光影片本身就佔掉幾十萬 token,而你可能只是想問「他有講到定價嗎」。 Agentic 模式把這件事反過來:讓模型自己決定要載入哪一段。先掃逐字稿,判斷答案可能在 1:24 附近,就只把那一段的畫面拉進來。 官方公告給的數字是長片場景 token 少 88%、成本降 66%、正確率高 7%。開啟方式就是在 Part 上多一個參數: video_part = types.Part( file_data=types.FileData(file_uri=..., mime_type="video/mp4"), media_processing="AGENTIC", # 或 "STATIC" ) 支援的模型有三個:gemini-3.7-flash、gemini-3.6-flash、gemini-3.5-flash-lite。輸入來源可以是 YouTube 網址、Cloud Storage URI,或內嵌的 base64。 它實際能做到什麼 我拿兩小時的 Google I/O ‘25 keynote 測,問「他有講到定價嗎?如果有,請給我幾分幾秒」,回來的是: 影片中有提到價格與訂閱方案的定價相關資訊。主要出現在影片的 1:24:40 到 1:26:10 左右⋯⋯ 然後正確描述了 Google AI Pro 與 Google AI Ultra 兩個方案的差異。再問 Android XR 眼鏡那段在哪,回 1:36:31 至 1:50:30,內容也對得上。 這種在兩小時影片裡精準定位的能力,是我覺得這個功能真正值錢的地方。摘要人人都會做,「這支長片裡他哪時候講到 X」目前沒什麼工具做得好。 前置條件:四個參數,少一個都不會報錯 這是這次最貴的一課,所以放前面講。 在 Vertex AI 上要讓 agentic 真的生效,四件事必須同時成立: # 條件 少了會怎樣 1 api_version="v1beta1" agentic 只在 v1beta1 提供,用 v1 會靜默退回 STATIC 2 media_processing="AGENTIC" 預設就是 STATIC,不設等於沒開 3 模型在支援名單內 不支援的模型會靜默降級為 STATIC 4 thinking_level 有設定 見下一節,這個最麻煩 關鍵字是靜默。少任何一個,API 都會回 200、答案照樣產出、看起來完全正常,只有帳單不一樣。沒有任何錯誤訊息會告訴你 agentic 沒生效。 還有兩個環境面的前提: SDK 版本:media_processing 這個欄位是 google-genai 2.20.0 才加進去的。我逐版下載驗證過,2.19.0 沒有、2.20.0 有。版本太舊的話這個參數會被當成未知欄位丟掉,一樣不報錯。 Vertex 專屬:官方文件的多輪對話範例是寫給 Gemini Developer API 的,Vertex 這條路上行為不同,後面會講。 我的作法是把這四項各寫一支測試,斷言送進 SDK 的參數: def test_thinking_level_is_low(captured): youtube_tool.summarize_youtube_video(VIDEO_URL) config = captured["call_kwargs"]["config"] assert...
繼續閱讀