「动嘴办公」火起来了!TRAE SOLO让打工人张嘴就能干活
动动嘴就能指挥你的电脑干活了!
朋友们,现在要写个代码、处理几个文件连字都不用打啦。
有一个你, 你将咖啡端在手中,你靠于阳台的椅子之上, 你朝着胸前位置的、硬币大小的麦克风进行诉说, 诉说的内容为——。
那就弄一个用户登录的模块, 其中要有手机号验证码登录方式, 还要有密码登录, 同时拥有微信登录的办法。安全方面要顾及到, 输入错误达3次就要闭锁10分钟, 密码要记得加密储存。接口返回的格式得统一起来, 顺便把日志以及异常捕获给添加上去。
接着, 你抿了一口咖啡, 随后, 屏幕之上已然出现了完整的代码框架, 并且, 接口文档自动生成, 而且, 测试用例一条都没遗漏句号。
这就是最近流行的Voice 。
从此以后,嘴巴就是你的键盘。
这次的语音输入
跟你想的不一样
近来, TRAE SOLO 为了紧跟 Voice 这个趋向, 竟然与麦克风 Mic Air跨界合作推出了一套组合产品, 就是这样。
我们拿到了这套组合,完整体验了一把。

相较而言, 多数语音转为文字的工具, 实际上做的是“听写”之事。你讲的任何内容, 它就照原样毫无变动地记载下来。最终你面对满屏幕包含众多语气词且断句不整齐、混乱的文字, 还得耗费时间亲自去整理, 这就等同于白白忙活了一番。
但TRAE SOLO完全不一样。
你讲出满嘴的口水话语, 智能结构化转录能够帮你将其整理成条理清晰的、具备可执行性的指令。
能识别出你进行自我纠正的语义理解与自动修正, 会让你说错了就改口, 且只保存最终得出的那个结论。
你提及「对那个Skill进行调整」, 借助功能语音直调, 可协助你经由一句话实现切换过去。
具体怎么个事,咱们来看一波实测。
说一大段,它全接住,连Skill都调好了
比如你在工位上坐累了,想站起来走一走,同时把代码搞定。
仅仅是在领口, 磁吸上一枚有着硬币那般大小的 Mic Air, 它单单只有 7.9 克, 在戴上之后, 基本上就感觉不到它的存在。

来回踱步时,脑子里转着一段代码,边想边说:
唉, 你瞅一瞅这段代码, 就是那个函数, 实在是太杂乱无章了, 真的是, 啥内容都一股脑儿地塞在一块儿了, 麻烦帮我对它进行重构一下。我大致讲一下具体要求, 首先, 要把这个大函数给拆开, 嗯, 拆分成三个部分, 其中一个是专门用来负责请求数据的, 一个是处理数据并进行分级的, 还有一个是往数据库写入数据并且记录日志的。不对, 日志要单独拆出来, 拆成四个部分。就是要让职责划分得清晰一点, 别全部都一股脑儿地堆放在一起。好的, 接下来要做这么几件事!首先, 那个错误处理实在是太杂乱无章了, 到处都是try和print, 要把它们统一起来统一起来!接着改为向外抛出自定义异常!还要改成async await异步的哟也就是那个样子的!请加上注释, 加上type hints, 而且变量名可别再叫r、d、f咯这种谁都看得懂叫啥意思的名字, 得规范一点规范一点!还有啊还有, score > 60这段代码被写了两遍两遍, SQL拼接存在注入风险风险, 这些冗余的以及有问题的逻辑都要清理掉清理掉, 参数化查询要搞一下搞一下。对了对了, 单元测试也得补上补上, 就这些事儿就这些事儿, 差不多就这些就这些。用Plan模式帮我规划一下。
这么长的口喷输出,连续说了好几分钟,中间没有一次断连。
值得一提的是,Mic Air传输几乎零延迟。
TRAE SOLO, 刹那就能把握关键要点, 即刻归纳提炼出具备结构化、能够切实执行的指令。
所有英文的专业名词全部抓准。
然后, TRAE SOLO将会运用指令里所提及的Plan模式, 进而开启疯狂输出的状态。
十分钟后再一看电脑,代码已经跑完了,就等你验收。


存在这样一个细节, 在我们表述为“拆分成三个”过后, 又将其更改成为“不对, 拆分成四个”。
倘若属于传统的语音转文字工具, 定会将前后两个版本统统留存下来, 而AI并不晓得该听哪一句了。
然而, 能够识别这般自我修正的是TRAE SOLO, 它能够自动保留最终得出的结论, 还会将被推翻掉的信息予以删掉。没错, 即便说错了也并无关系, 因为AI仅仅保留结论。
多端协同,任务不中断。你的踱步思考时间,变成了生产力。
除去对代码进行修改之外, TRAE SOLO能够协助你去料理日常工作里的一切种类的文件。
比如说, 帮我去写一个脚本调用, 将这些视频进行批量转换, 使其成为H. 265的格式 , 其中视频的分辨率设置为1080p , 并且把音频提取出来, 保存成MP3格式。还有哦, 要在视频的左下角把文件名印上去当作水印 , 这样可以避免我弄混。调用那个进行批量处理的Skill。
TRAE SOLO生成脚本、自动执行。
很快, MP3完美完成, 脚本也完美完成, 处理后的视频水印皆能依照要求添加上去。
相同场景, 能够用以批量重命名文件, 能够用以批量压缩图片, 能够用以批量 添加 水印。以往需要寻觅各类小工具拼凑而成的流程, 如今一句话就可达成。



要特别指出的是, 那句「调用那个批量处理的Skill」, 与前面在重构代码时所讲的「用Plan模式」相同, 这属于TRAE SOLO的功能语音直调能力。
需要进行切换模式, 调理Skill, 换成模型, 而不用为寻找菜单而做搜寻动作, 可以按照语音指令的模糊匹配方式, 只要发出语音就能达成。
东一句西一句,它全听懂,还理成清单
撰代码, 处置文件, 是为手头之事务, 可工作方面存在其它更为平常之情景, 即老板骤然抛来嘅需求。
有个场景那是大家绝对不会陌生。老板在开会之际, 脑袋突然一转, 就冒出这么的一个想法, 然后这会议一散, 可就马上要求得出结果。
现在,我们推门出来就可以趁热把老板的话复述一遍:
敏捷地瞅一瞅用户所给出的反馈, 瞧瞧大伙都在怨些啥, 哪种问题较为集中, 尽力能瞧出个占比情况来。反馈数量特别多的那类, 要专门挑出来……
在TRAE SOLO获取到这段话之后, 最先开展的事情是进行口语方面的清理, 将语气词、重复出现的部分以及未完整表述的半句话, 全部都自动予以过滤, 你所拿到的这是一段洁净的、能够马上交付给AI去执行的文本。
接下来, 语义理解能力开始发挥作用了, 它并非仅仅是去除噪音这般简单, 而是切实地听懂了你所表达的内容。
你讲的那句「反馈特别多的那种要单独拎出来」, 其理解成为了高频问题提取 , 你又说的那句「有些人就是提个建议, 有些是真用着不爽了」 它被归纳作了情感分类维度 、那也就是建议类和负面体验类需要分开给予处理。
这些均为从大白话朝着专业任务的语义进行的跃迁, 并非单纯的语音转变成文字便能够达成的。
最终整理好的任务清单,可以说是既清晰又简洁:
针对用户反馈内容展开分析, 依据问题类型进行聚类, 计算相应比例, 将高频问题单独去做标注;同时去区分用户态度, 据此生成一份含有柱状图以及饼图的报告, 而数据的来源乃是用户上传的附件。
算下来,从开完会到出结果,大概三五分钟就搞定了。
生成的分析报告, 涵盖内容于图表, 格外丰富且细致, 大体处于拿来即用的水准。
并且,所有结果都被自动存到了本地文件夹里,随时可以取用。





现在,不用再抓耳挠腮地去回忆了,想到就开口说:
下面我要对AI赛道开展梳理工作, 恰好近段时间新闻数量较多。请你协助我将核心功能、用户体验、商业模式这几个方面进行分解, 补充完善竞品情况,接着制作一组对比表格, 维度涵盖功能差异、用户画像以及收费方式等方面。最后请问你帮我总结归纳一下壁垒所在之处, 还有阐述潜在风险, 例如模型依赖、留存率等相关内容。
同样, 口语呈自动完成清洗状态, “维度的话就于模型依赖啊留存啊这些”, 这些口语化成碎片化的内容都会被过滤掉。
再者, 那些诸如AI之类顺口随意就能冒放出来的英文, TRAE SOLO也全都没有遗漏, 终究哪怕是中英混杂着讲也能够跟得上。
语义理解层面,它把一段意识流拆成了三个清晰的任务模块:
有关拆解核心功能, 关乎体验之剖析, 关联商业模式之解析, 以及呈现3 - 5个竞品对比表格, 此表格涵盖功能差异, 还有用户像描绘、收费方式模式信息, 并且涉及近两版本更新情况, 另外涵盖壁垒归纳与风险予以建议。
刚说完,研究框架直接出来了。
哪怕是前几天发生的, 那600亿美元之多被马斯克买断期权这样的事, 也都能给你剖析得清清楚楚、明明白白的。
我们最后只需要再过一遍结果、调调细节,就可以交差了。




周围再吵,它只听你说,噪音一键消了
来到此处, 你或许就会讲, 镇定自若地朝着电脑说出话语, 自然是管用着的。然而倘若周边变得混乱不堪如同一锅煮沸乱动之羹汤般, 那又会如何呢。
举例来说, 当处于乘坐网约车这种情形时, 忽而接到一项紧急需求, 此时司机正播放着音乐, 导航在持续播报相关信息, 并且外面还伴有喇叭发出的声响。
这要是用笔记本内置麦克风,声音基本就全混一起了。
但现在,夹上Mic Air直接开口就行。
它拥有48kHz采样率, 具备全向拾音之能力, 哪怕轻声说出指令,亦能精准予以捕捉。除此之外, 设有一键AI降噪功能, 背景嘈杂声音几近均可被压制消除, 仅留存下人声。
获得了这段明晰的语音之后, TRAE SOLO迅速将其处理成为清洁的:
撰写一份PRD, 用于明天上午与研发进行需求评审。该所涉功能的核心流程为这样, 先是用户注册登录, 接着创建项目, 之后邀请同事协作, 待完成后导出报告。其界面涵盖首页、项目列表、编辑页以及设置页。要考虑网络超时、权限不足等异常状况, 并设计埋点, 埋点分为用户行为类和页面维度曝光类。
于抵达家中这一时刻, 一份构造完备的PRD已然在屏幕之上静候着你。于Word之中将其予以下载, 略微雕琢便可发送给研发评审。
得承认, TRAE这次真就是将语音办公当成一整条完整链路去精心打磨,从进行声音采集, 再到实现智能转录, 每一个环节都不存在任何问题。
而且这条路还在往前走。
TRAE SOLO预计在4月底的时候上线实时进行问答互动, 届时你能够如同跟同事开展聊天那般, 跟AI运用语音去讨论问题, 实现实时对话, 达成实时转录。
Voice
正在发生的工作方式革命
今年以来,语音AI赛道突然变得异常拥挤。
IBM和官宣合作,把语音能力嵌入企业级AI平台。
GPT持续迭代, 实时语音对话已然达成了几近人类水准的流畅程度, 做到乎近乎人类水平的流畅度。
推出了 3.1 flash live, 它是一个从一端到另一端的原生音频模型, 具备能感知语气这种能力, 拥有可以感知语速这般功能, 具备能够感知情绪这个作用, 而且也支持九十多种语言。
同一趋势被这些动作背后所指向, 那就是语音正从「辅助输入」朝着「主力交互」不断升级。
过去, 我们给语音交互留下的印象, 大约还停留在, 对着手机呼喊「Hey Siri帮我定个闹钟」的那个阶段。
但现在的Voice ,远不是这么简单的事。
说话是人类最为自然的表达方式, 这是它背后的核心逻辑所在, 打字实际上是一种“被迫的翻译”。
一个连贯的思路在脑子里存在着, 然而你需要把它拆成一个个字符, 再用手指逐个敲出来。
这中间的信息损耗和效率损失,远比我们以为的要大。
当语音识别准确率达到足够高的程度, 语义理解达到足够深的地步, 响应速度达到足够快的情形时, 「说着干活」便不再是一个仅供噱头的事物了。
而TRAE,是在AI 领域率先把这件事做到产品级的玩家。
下一个生产力入口是嘴
因TRAE SOLO的智能体已然能够自行拆解任务, 并调用工具去完成执行, 所以人类的角色相应地从轻改智从就从「操作者」转变成为「决策者」。
决策者最自然的表达方式是什么?
是说话。
截止到现在, TRAE在全球进行注册的用户数量超过了600万, 每个月活跃的用户数量突破了160万, 其覆盖范围将近200个国家以及地区。
这一回语音输入功能予以上线, 再加上与的联名硬件合作, 这就等同于将Voice从概念转变为一整套完备的解决方案, 软件方面存在智能转录、语义理解以及功能直调, 硬件方面具备专业级的无线收音保障。
今天,TRAE SOLO语音输入功能正式上线。
试试看,张嘴就能干活的感觉,用过就回不去了。
参考资料:
更多推荐



所有评论(0)