需求痛点
刷网页的时候,总会碰到这种时刻:看到一篇长文,或者一段讨论,想快速知晓大意或是多方观点。念头很简单,但满足它却挺麻烦。前大模型时代只能硬啃;后大模型时代,能把内容丢给豆包、丢给 DeepSeek,可这个"丢"字里全是摩擦:开一个新标签页,将链接丢给他们。碰上反爬或者排版诡异的页面,结果不可控还得回来复制粘贴。
我真正想要的东西十分简单:看到感兴趣的内容,选中,问一句,拿到答案。中间越少越好。
市面上不是没有类似的东西,Chrome 插件 Page-Assist 算比较早的一个,但功能铺得太满,配置项一大堆,用不上的东西成了负担。这活儿逻辑不复杂,手搓也不难,正好还能把本地跑的模型用起来。
于是就有了 PageGrok 这款浏览器插件。
大厂做了,还做不做
开发到一半,Google 把 Gemini 塞进了 Chrome 侧边栏。选中页面问模型,跟我做的事一模一样。这种时刻经典复刻了:你琢磨的东西,大厂顺手就做了,怎么办?
想了想,还是继续做。理由也不复杂。Gemini in Chrome 的完整功能绑在 Google AI Pro 上,一个月 19.99 美元,我只是想总结个页面,用不上生图、云存储。这笔账不划算,何况有些地区还用不了。还有隐私:Chrome 侧边栏默认拿当前标签页内容去生成回答,数据是走 Google 服务器的,公司内部文档、没公开的研究资料,这可使不得。
它能干什么
所以 PageGrok 做的还是一个很朴素的东西:侧边栏常驻,一边看内容一边问;自定义接入本地模型或者 API;借鉴了印象笔记的截屏取景框逻辑,能自定义截取一块区域。这个在小红书、推特这种浮窗式应用上意外地好用;回答可以直接复制走,还能带上来源,方便回头翻。产品形态确实初级,商业化也有限,但我自己天天用,够用。
4个月8个小版本
三月底上线 1.0.1,只支持 Ollama,弹窗交互。五月中到 1.0.4,加了 oMLX 和 LM Studio,顺手把弹窗换成了侧边栏。这一步其实是深度体验后的有依据调整。七月稳定发布 1.0.7 和 1.0.8。四个月,八个版本。五月十一号在 V2EX 发了个帖子,到现在 1100 多次浏览,被几个 AI 工具站收录转载过。周活跃用户在数十位,横跨亚欧美三大洲。这些够我确认一件事:这个需求不是我一人独有。
踩过的坑
踩过的坑也有。最早是 popup 弹窗,点图标弹出来,点别处就收起去。换成 Side Panel API 之后才顺了,不过这 API 本身还比较新,有些交互细节 Google 自己可能都还在摸索。然后是会话不保存,早期版本刷新页面或者关掉侧边栏,之前问的东西就没了,对那种需要反复追问、一层层往下挖的场景,体验糟糕。后来加了 Markdown 渲染和复制,能够衔接到下游的知识管理 pipeline 了。
谁适合用
它并非要跟豆包,以及一些其他国内外 AI agent 抢地盘。多轮复杂对话、文件上传分析、联网搜索这些,PageGrok 现在都做不到,也没打算做。它的范围就是"选中—提问—拿结果"这一条最短路径,适合日常阅读量大,又不想为一个总结功能单开一个 AI 对话窗口的人;适合对隐私有顾虑、不想把公司文档丢给云端模型的人;适合本地已经跑着 Ollama 或 LM Studio、缺的只是一个顺手交互前端的人。
我自己怎么用
以我自己为例,一般是下面这么用的。刷 V2EX、小红书、知乎、推特这类信息流杂的地方,评论区经常比正文更有料,可评论多到看不过来,我会整段选中让模型帮我理出几种不同立场。碰到三五千字的长文,先选全文要一个结构化摘要,摘要里哪个点勾住我了,再细致追问。这个两步走的节奏比通读快得多,尤其碰上那种本身就是 AI 写的文章,硬啃脑壳疼。英文技术文档、日文新闻,选中让模型用中文讲讲,模型会自己补上下文、拆解术语。甚至还可以帮你总结疑难词和语法点。遇到值得反复看的内容,总结完把 Markdown 复制到 Gist 或者自己的笔记系统里,每周复盘的时候翻这些摘要,就再也不会出现:“好像哪里看到,但是记不清是哪里"的问题了。
如果要我来推销这个东西,那我会说:数据自己管,链路少折腾。本地跑 Ollama 就一点都不出机器,公司有自部署的模型服务,填个地址就能用。
现在可以在 Chrome 应用商店搜 PageGrok 装上,或者访问官网 pagegrok.org 了解更多细节。不知道咋的,Chrome 后台显示有 5000+ 的用户。形态不复杂,但它让我的知识管理更顺畅,对我来说,这就够了。